FindStatBench는 조합론 코드 합성 능력을 실행 기반으로 평가하는 LLM 벤치마크다. 조합론 데이터베이스 FindStat에서 추출한 24개 컬렉션, 2,329개 과제와 552만 개의 숨겨진 인스턴스로 구성되며, 모델은 수학적 설명과 최대 5개 예시만 보고 도구·재시도 없이 Python solve 함수 하나를 작성해 샌드박스 실행으로 채점받는다. 11개 시스템 평가 결과 최상위 오픈·클로즈드 모델이 1%p 이내로 수렴했고, 예시를 주면 오히려 성능이 떨어지는 사례(예시 0개로 완벽히 풀던 고전 전단사 문제가 5개 예시에서 실패)와 추론이 출력 예산을 소진해 코드를 못 내는 실패도 관찰됐다. 통계 합성보다 사상(map) 합성이 훨씬 어렵고 정확한 기호적 규칙 귀납은 여전히 취약함을 보여준다.
- •FindStat 기반 24개 컬렉션, 2,329개 과제, 552만 숨겨진 인스턴스의 실행 채점 벤치마크
- •도구·실행 피드백·리랭킹 없이 Python solve 함수 1개만 제출하는 엄격한 조건
- •11개 시스템 평가에서 최상위 오픈·클로즈드 모델 간 인스턴스 정확도 1%p 이내 수렴
- •예시 5개 제공 시 오히려 실패하는 역설적 사례와 추론의 출력 예산 소진 실패 관찰
- •통계 합성 대비 사상 합성이 훨씬 어렵고 일부 컬렉션은 정확도 0에 가까움
FindStatBench: Evaluating Large Language Models on Combinatorial Code Synthesis
본문 미리보기
arXiv:2607.18260v1 Announce Type: new Abstract: We introduce FindStatBench, an execution benchmark for evaluating large language models on combinatorial code synthesis. Built from FindStat, it contains 2,329 tasks across 24 collections and 5.52M hidden instances, covering statistic synthesis, which maps objects to integers, and map synthesis, which maps objects to objects. Each task gives a mathematical description and at most five public input-output examples; a model must emit one Python solv
전체 내용이 궁금하다면?
원문을 직접 읽어보세요