MIRA-Math는 문제 해결에 필요한 원자적 사실 하나가 의도적으로 빠진 수학 문제를 주고, 모델이 부족한 정보를 자연어로 요청한 뒤 정답을 계산하는 능력을 진단하는 벤치마크다. 대수, 확률, 마르코프 체인, 회로 등 22개 유형에서 2,310개 문제를 생성했으며, 고정된 LLM 응답자가 요청이 정확할 때만 사실을 제공한다. 프런티어·소형 모델 실험 결과 '올바른 정보 요청'과 '최종 정답 정확도'가 분리되는 현상이 확인됐다. 즉 필요한 사실을 잘 물어보고도 계산에 실패하거나, 힌트 확보 단계에서 실패하는 경우가 모두 존재한다. 에이전트가 스스로 결핍된 정보를 파악해 질문하는 능력을 정량 평가할 도구가 생겼다는 점에서 의미가 있다.
- •필요한 사실 1개가 빠진 수학 문제에서 정보 요청 능력을 평가하는 벤치마크 MIRA-Math 공개
- •22개 수학 유형에서 2,310개 인스턴스 생성, 검증과 채점은 결정론적으로 수행
- •고정된 제약형 LLM 응답자가 요청이 데이터셋의 원자적 사실과 일치할 때만 정보 제공
- •정보 요청 성공률과 최종 정답 정확도가 분리됨을 실험으로 확인
- •생성기·검증기·프롬프트·메타데이터 전체 공개로 재현 가능한 평가 지원
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
MIRA-Math: A Benchmark for Minimal Information Requesting and Mathematical Reasoning
- 1.필수 사실 1개가 빠진 수학 문제로 '최소 정보 요청' 능력을 진단하는 벤치마크 MIRA-Math 공개
- 2.대수·확률·마르코프체인 등 22개 유형 2,310문항, 생성·검증은 결정론적으로 재현 가능
- 3.제한된 요청 예산 내 자연어로 누락 사실을 질문하고 이를 통합해 정확한 답을 내야 함
- 4.실험 결과 질문 성공과 최종 정답 정확도는 분리됨—올바로 질문해도 계산에 실패 빈번
왜 중요한가?
기존 벤치마크가 모든 정보를 제공해 측정하지 못했던 '무엇이 부족한지 파악해 묻는' 능력을 분리 평가함으로써, 불완전한 정보로 동작해야 하는 실제 에이전트·어시스턴트의 핵심 역량을 진단할 도구를 제공한다.
언급 프로젝트
본문 미리보기
arXiv:2607.07391v1 Announce Type: new Abstract: Mathematical reasoning benchmarks typically provide all facts needed to solve each problem, while interactive benchmarks often mix reasoning with tools, retrieval, and long-horizon dialogue. We introduce MIRA-Math, a benchmark for a narrower diagnostic capability: solving mathematical problems whose full latent state has a unique answer, but whose solver-facing view is missing exactly one necessary atomic fact. The solver must request the missing
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

