이 연구는 올림피아드 기하 문제를 '푸는 능력'과 '정확한 도형을 그리는 능력'이 다르다는 점에 주목해, 954개 문제(297개 고난도 부분집합)에 사람이 작성한 Asymptote 코드 기반 고품질 도형을 짝지은 오픈소스 벤치마크를 공개했다. 텍스트·코드·이미지·VLM·제약조건 기반의 다각도 지표로 '다이어그램적 추론'을 측정한다. GPT, Claude 등 최신 파운데이션 모델을 평가한 결과 평균 컴파일 성공률이 36.14%에 그쳐, 문제 풀이 능력과 도형 작도 능력 사이에 뚜렷한 격차가 있음을 확인했다. 강력한 수학적 추론 능력이 곧 정확한 기하 도형 작성 능력을 의미하지 않는다는 점을 보여준다.
- •954개 올림피아드 기하 문제(297개 고난도 부분집합)에 Asymptote 기반 도형 결합
- •텍스트·코드·이미지·VLM·제약조건 지표로 '다이어그램적 추론' 측정
- •최신 모델들의 평균 도형 컴파일 성공률 36.14%에 불과
- •수학 문제 해결 능력과 도형 작도 능력이 별개임을 실증
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Solving Is Not Drawing: A Benchmark for Diagrammatic Reasoning in Olympiad Geometry
- 1.올림피아드 기하 도형 작도 능력만 따로 측정하는 벤치마크 공개, 문제 954개·고난도 297개 포함
- 2.각 문제에 사람이 작성한 Asymptote 코드 기반 고정밀 도형과 해답을 함께 제공
- 3.현재 파운데이션 모델들의 도형 컴파일 성공률 평균 36.14%에 그쳐 풀이력과 작도력 간 괴리 확인
- 4.MathVista·MathVerse 등 기존 벤치마크는 정답률만 측정해 작도 능력은 다루지 않았다는 공백 지적
왜 중요한가?
GPT·Claude 등이 문제는 풀어도 정확한 도형을 그리지 못한다는 사실을 수치로 입증해, 수학추론 벤치마크가 정답률만으로는 불충분함을 보여준다.
본문 미리보기
arXiv:2608.18111v1 Announce Type: new Abstract: Foundation models such as GPT and Claude now solve olympiad-level mathematics with remarkable proficiency, so much so that geometry problem solving has become a standard proxy for their mathematical reasoning. Yet solving a geometry problem and drawing the figure it depends on are not the same skill: progress often hinges on a faithful diagram with the right auxiliary constructions and incidences, and it is unclear that a model which reasons its w
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
