GR-Ben은 수학적 추론에 편중된 기존 벤치마크의 한계를 극복하기 위해 과학과 논리 두 영역, 9개 하위 영역에서 프로세스 보상 모델(PRM)의 성능을 평가하는 벤치마크다. 22개 모델 실험 결과 수학 외 영역에서 PRM과 LLM의 오류 탐지 능력이 현저히 약하며, PRM은 지식 기반 오류에, LLM은 계산 오류 탐지에 각각 취약한 상호 보완적 한계를 보인다. 이 벤치마크는 일반 도메인 추론을 위한 PRM 연구 촉진을 목표로 한다.
- •과학과 논리 두 영역, 9개 하위 영역에서 프로세스 보상 모델(PRM)을 평가하는 종합 벤치마크다.
- •22개 모델 실험 결과 수학 외 영역에서 PRM과 LLM의 오류 탐지 능력이 현저히 약함을 발견했다.
- •PRM은 지식 기반 오류에 약하고 LLM은 계산 오류 탐지에 더 취약한 상호 보완적 한계를 보인다.
- •일반 도메인 추론을 위한 PRM 연구를 촉진하기 위한 벤치마크로 활용될 수 있다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
GR-Ben: A General Reasoning Benchmark for Evaluating Process Reward Models
- 1.GR-Ben은 과학·논리 2개 도메인, 9개 하위 분야에서 PRM의 프로세스 오류 탐지를 평가하는 벤치마크
- 2.22개 모델 실험에서 수학 외 도메인의 오류 탐지 능력이 수학보다 현저히 낮음을 발견
- 3.PRM은 지식 기반 오류에, LLM은 계산 오류 탐지에 각각 취약한 상반된 약점 보유
왜 중요한가?
테스트 타임 스케일링의 핵심인 PRM의 일반 추론 능력 평가가 부재했으며, GR-Ben이 이를 해결해 더 신뢰할 수 있는 AI 추론 시스템 개발에 기여함.
언급 프로젝트
본문 미리보기
arXiv:2605.01203v1 Announce Type: new Abstract: Currently, process reward models (PRMs) have exhibited remarkable potential for test-time scaling. Since large language models (LLMs) regularly generate flawed intermediate reasoning steps when tackling a broad spectrum of reasoning and decision-making tasks, PRMs are required to possess capabilities for detecting process-level errors in real-world scenarios. However, existing benchmarks primarily focus on mathematical reasoning, thereby failing t
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:12AI 초안

