FindStatBench는 조합론 코드 합성 능력을 실행 기반으로 평가하는 LLM 벤치마크다. 조합론 데이터베이스 FindStat에서 추출한 24개 컬렉션, 2,329개 과제와 552만 개의 숨겨진 인스턴스로 구성되며, 모델은 수학적 설명과 최대 5개 예시만 보고 도구·재시도 없이 Python solve 함수 하나를 작성해 샌드박스 실행으로 채점받는다. 11개 시스템 평가 결과 최상위 오픈·클로즈드 모델이 1%p 이내로 수렴했고, 예시를 주면 오히려 성능이 떨어지는 사례(예시 0개로 완벽히 풀던 고전 전단사 문제가 5개 예시에서 실패)와 추론이 출력 예산을 소진해 코드를 못 내는 실패도 관찰됐다. 통계 합성보다 사상(map) 합성이 훨씬 어렵고 정확한 기호적 규칙 귀납은 여전히 취약함을 보여준다.
- •FindStat 기반 24개 컬렉션, 2,329개 과제, 552만 숨겨진 인스턴스의 실행 채점 벤치마크
- •도구·실행 피드백·리랭킹 없이 Python solve 함수 1개만 제출하는 엄격한 조건
- •11개 시스템 평가에서 최상위 오픈·클로즈드 모델 간 인스턴스 정확도 1%p 이내 수렴
- •예시 5개 제공 시 오히려 실패하는 역설적 사례와 추론의 출력 예산 소진 실패 관찰
- •통계 합성 대비 사상 합성이 훨씬 어렵고 일부 컬렉션은 정확도 0에 가까움
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
FindStatBench: Evaluating Large Language Models on Combinatorial Code Synthesis
- 1.FindStatBench 공개: FindStat 기반 2,329개 과제·552만 숨겨진 인스턴스의 조합론 코드 합성 벤치마크
- 2.평가 11개 시스템 중 최강 오픈·클로즈드 모델이 인스턴스 정확도 1%p 이내로 수렴
- 3.예시가 오히려 해로움: 예시 0개에서 완벽하던 고전 전단사은 5개 예시 프롬프트에서 실패
- 4.추론이 응답 예산을 소진해 코드 미출력, 긴 프롬프트에서 정확도 급락 등 패턴 확인
왜 중요한가?
샌드박스 실행 기반 채점으로 정확한 기호적 규칙 귀납 능력을 측정하는 드문 벤치마크다. few-shot 예시가 성능을 해칠 수 있고 추론 토큰이 출력 예산을 잠식한다는 발견은 코드 합성 프롬프트 설계 관행에 직접 시사점을 준다.
언급 프로젝트
이 연구는 조합적 코드 합성, 특히 통계 합성을 위한 대규모 언어 모델(LLM)의 성능을 평가하는 새로운 벤치마크인 FindStatBench를 소개합니다. 국내 소프트웨어 개발 및 데이터 과학 분야에서 LLM을 활용한 코드 생성 기술에 대한 관심이 높은 만큼, 이러한 전문화된 벤치마크는 모델의 실제 성능을 객관적으로 측정하는 데 필수적입니다. 이를 통해 국내 AI 연구진과 기업들은 LLM의 코드 생성 능력을 고도화하고, 복잡한 통계 문제 해결에 더욱 정확하고 효율적인 AI 도구를 개발하는 데 기여할 수 있습니다.
본문 미리보기
arXiv:2607.18260v1 Announce Type: new Abstract: We introduce FindStatBench, an execution benchmark for evaluating large language models on combinatorial code synthesis. Built from FindStat, it contains 2,329 tasks across 24 collections and 5.52M hidden instances, covering statistic synthesis, which maps objects to integers, and map synthesis, which maps objects to objects. Each task gives a mathematical description and at most five public input-output examples; a model must emit one Python solv
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

