CrowdMath는 잘 정의된 문제 풀이가 아니라 여러 참여자가 부분 논증을 제안하고 오류를 찾아 수정하며 점진적으로 증명을 완성해가는 '협력적 미해결 문제 풀이' 과정을 담은 데이터셋이다. MIT PRIMES-AoPS CrowdMath 프로그램(2016~2025)의 포럼 토론에서 전문가가 주석을 단 164개의 진행 체인으로 구성되며, 각 게시물은 부분 진전·증명 완성·오류 추론·오류 식별 등 기능적 역할로 라벨링됐다. 6개 프론티어 모델은 다음 게시물 예측에서 83~88% 정확도를 보였지만, 게시물 역할 분류에서는 최고 모델조차 macro-F1 0.42에 그쳤다. 이는 정형화된 수학 문제를 푸는 능력과 협력적 수학 진전을 실시간으로 이해하는 능력 사이에 큰 격차가 있음을 드러낸다.
- •MIT PRIMES-AoPS CrowdMath(2016~2025) 토론 기반, 전문가 주석 164개 진행 체인으로 구성된 데이터셋
- •각 게시물을 부분 진전·증명 완성·오류 추론·오류 식별 등 기능적 역할로 라벨링
- •6개 프론티어 모델의 다음 게시물 예측 정확도 83~88%로 토론의 국소적 흐름은 따라감
- •게시물 역할 분류는 최고 모델도 macro-F1 0.42에 그쳐 기여의 기능적 의미 파악에 취약
- •정형 문제 풀이와 협력적 수학 진전 이해 사이의 능력 격차를 드러냄
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
CrowdMath: A Dataset of Crowdsourced Mathematical Research Discussions
- 1.협업적 열린 문제 해결을 다루는 데이터셋 CrowdMath 공개
- 2.MIT PRIMES-AoPS CrowdMath(2016-2025)의 164개 전문가 주석 진행 체인 수록
- 3.게시물을 부분 진전·증명 완성·오류 추론·오류 식별 등 기능적 역할로 라벨링
- 4.6개 모델 평가서 다음 게시물 예측 83-88%지만 역할 분류는 최고 0.42 macro-F1
왜 중요한가?
기존 수학 벤치마크가 완결된 문제·정답만 평가하던 것과 달리, 다자간 협업으로 증명이 점진 형성되는 과정을 평가해 모델이 협업적 수학 진전을 이해하지 못하는 격차를 드러낸 점이 의미 있다.
언급 프로젝트
LLM의 수학적 추론 능력을 평가하는 새로운 데이터셋 'CrowdMath'의 등장은 국내 LLM 개발에 중요한 의미를 가집니다. 기존 벤치마크가 놓쳤던 협력적이고 개방형 문제 해결 능력을 평가하는 이 데이터셋은, 국내 기업 및 연구기관이 개발하는 LLM의 고도화와 인간과 유사한 추론 능력 구현에 기여할 것입니다. 이는 단순히 정답을 찾는 것을 넘어 창의적이고 복합적인 문제 해결이 가능한 AI 개발을 촉진할 중요한 자원이 될 것입니다.
본문 미리보기
arXiv:2606.06526v1 Announce Type: new Abstract: Large language models have made substantial progress on mathematical reasoning, but existing benchmarks typically evaluate well-specified problems with final answers, step-by-step solutions, or complete proofs. They do not capture collaborative open-problem solving: a setting in which participants propose partial arguments, identify gaps or errors in prior steps, repair flawed reasoning, and gradually synthesize incremental contributions into a pr
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:12AI 초안

