언어모델 에이전트를 채점하는 자동 판정 모델의 신뢰성을 높이기 위해 연구팀이 '루브릭포지(RubricForge)'를 제안했다. 이는 소량의 정답 라벨이 달린 궤적 데이터로부터 채점 기준(루브릭)을 반사적 진화 방식으로 도출해 고정한 뒤, 별도 환경 접근 없이 한 번의 모델 호출로 새로운 궤적을 평가하는 방식이다. 7B 모델 하나를 에이전트이자 판정자로 사용해 tau-bench와 웹샵 벤치마크에서 실험한 결과, 전체 정확도 향상은 통계적으로 유의하지 않았지만(McNemar p=0.248) 실패한 궤적을 성공으로 잘못 판정하는 '거짓 통과율'은 절반 수준(0.115 대 0.173)으로 줄었다. 저자들은 보상 없는 평가자에게는 거짓 통과율이 전체 일치도보다 배포 관점에서 더 중요한 지표라고 강조한다.
- •루브릭포지는 소량의 정답 라벨 굤적에서 채점 루브릭을 반사적 진화로 도출·고정해 환경 접근 없이 평가하는 방법.
- •tau-bench·웹샵 실험에서 전체 정확도 향상은 통계적으로 유의하지 않음(McNemar p=0.248).
- •실패 굤적을 성공으로 오판하는 '거짓 통과율'이 일반 G-Eval 대비 절반 수준(0.115 대 0.173)으로 감소.
- •저자들은 보상 없는 평가자에게 거짓 통과율이 전체 일치도보다 배포상 더 중요한 지표라고 주장.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Inducing Reward-Free Judging Rubrics that Reduce Over-Crediting in Agent Evaluation
본문 미리보기
arXiv:2608.13564v1 Announce Type: new Abstract: Evaluating language-model agents at scale increasingly relies on a second language model as an automatic judge, because the gold signal, an executable environment reward, is expensive, slow, or unavailable at deployment time. Such a judge is a reward-free proxy whose value depends on whether it can be trusted, yet existing judges either hand-write the scoring rubric, as in G-Eval, or fine-tune the judge's weights, and both tend to credit fluent bu
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:21AI 초안

