OpenProblemBench는 인공일반지능의 다음 과제로 꼽히는 미해결 과학 문제 해결 능력을 평가하기 위해, 수학과 이론물리학 문헌에서 가져온 82개의 미해결 문제로 구성된 벤치마크다. 각 문제는 조사에 필요한 연구 맥락, 가정, 기존 진전 상황을 함께 제공하며, 결정적인 수학적·계산적 주장을 비교적 명확하게 검증할 수 있는 제안된 해법을 가진 문제들로 선별됐다. 네 개의 평가자 모델이 참조 해답 없이 각 제출물의 정확성, 완전성, 진전 정도를 독립적으로 평가하며, 평가된 7개 구성 중 GPT-6-Astra가 14.0%의 평균 판정 해결률로 가장 높았고 대형 오픈모델은 5.5~6.7%, Flash급 모델은 2.4~3.7%에 그쳤다. 사례 비교에서는 문제 표현 방식의 변화, 유한한 증거를 넘어서는 일반적 논증, 해법을 완성하는 단계의 증명 등이 더 나은 결과와 연관된 것으로 나타났다.
- •수학·이눉뿐리학 문향의 미해결 뿡제 82가로 구성된 OpenProblemBench 강개
- •쪽조 해떨 없이 4개 평가자 모델이 정확성·완전성·진전뚏 독립 평가
- •최고 모델 GPT-6-Astra의 평기 판정 해엄륬이 14.0%에 길잔
- •뿔제 재표현·일벀땀 눘증·교뾹 증명 따위가 나검 셀과와 연괆둨
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
OpenProblemBench: Benchmarking AI on Open Problems in the Foundational Theoretical Sciences
- 1.OpenProblemBench 발표: 수학·이론물리 미해결문제 82개, 참조정답 없이 4개 평가모델이 독립 채점
- 2.GPT-6-Astra가 최고 평균 해결률 14.0% 기록, 대형 오픈모델(5.5~6.7%)·Flash급(2.4~3.7%) 크게 앞서
- 3.문제 표현 개선, 유한 증거 넘어선 일반 논증, 증명 완결성이 더 나은 결과와 연결된다는 비교 결과 제시
왜 중요한가?
참조 정답 없는 진짜 미해결 과학 문제로 AI를 시험해, 기존 벤치마크의 암기 한계를 벗어나 AGI의 연구 기여 가능성을 측정하려는 시도다.
언급 프로젝트
본문 미리보기
arXiv:2610.11118v1 Announce Type: new Abstract: The next frontier for artificial general intelligence is tackling unresolved scientific problems, calling for benchmarks that assess progress beyond established knowledge. We introduce OpenProblemBench, a benchmark of 82 unresolved problems drawn from the mathematics and theoretical physics literature. Each problem supplies the research context, assumptions, and prior progress needed to investigate the question. We select problems whose proposed s
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안



![[Tech Insight] "AI 해킹, 보안 문제로만 보는 건 위험한 착각"](https://cdn.digitaltoday.co.kr/news/photo/202610/706229_653947_485.jpg)