도구 사용 LLM 에이전트의 자동 평가가 신뢰할 만하다는 가정을 인간 라벨로 검증한 연구로, 4개 도메인·9개 상용 LLM·100라벨 인간 검증 부분집합을 포함한 2,000과제·2,300트레이스 벤치마크 AgentProp-Bench를 공개했다. 부분 문자열 기반 판정은 인간 합치도가 카파 0.049로 우연 수준에 그쳤고, 3개 LLM 앙상블도 보수적 편향을 가진 채 카파 0.432의 중간 수준에 머물렀다. 인간 보정 결과 매개변수 수준 주입이 잘못된 최종 답변으로 전파될 확률은 약 0.62(0.46-0.73 범위)로 측정됐다. 잘못된 매개변수 거부와 수용 후 회복 능력은 모델별로 독립적이었으며, 런타임 인터셉터는 GPT-4o-mini 환각을 23.0%p 감소시켰지만 매개변수 거부가 강한 Gemini-2.0-Flash에서는 효과가 없었다.
- •AgentProp-Bench: 2,000과제·2,300트레이스·인간 검증 부분집합 벤치마크 공개
- •부분 문자열 기반 자동 판정은 우연 수준의 신뢰도(카파 0.049)
- •3개 LLM 앙상블도 카파 0.432 수준으로 완전하지 않음
- •도구 인수 오류의 최종 답변 전파 확률이 약 62%로 높음
- •런타임 인터셉터가 일부 모델(GPT-4o-mini)에서만 환각을 23%p 감소
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench
- 1.AgentProp-Bench는 2000개 작업·2300개 트레이스 벤치마크
- 2.부분문자열 심판은 사람 주석과 κ=0.049로 우연 수준
- 3.3-LLM 앙상블로 κ=0.432 중간 수준 도달
- 4.튜닝된 런타임 인터셉터로 GPT-4o-mini 환각 23%p 감소
왜 중요한가?
도구 사용 LLM 에이전트의 자동 평가 신뢰성을 인간 검증으로 정량화한 최초 대규모 연구입니다.
본문 미리보기
arXiv:2604.16706v1 Announce Type: new Abstract: Automated evaluation of tool-using large language model (LLM) agents is widely assumed to be reliable, but this assumption has rarely been validated against human annotation. We introduce AgentProp-Bench, a 2,000-task benchmark with 2,300 traces across four domains, nine production LLMs, and a 100-label human-validated subset. We quantify judge reliability, characterize error propagation, and evaluate a runtime mitigation. Substring-based judging
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:43AI 초안

