AgentAtlas는 단일 정확도 지표의 한계를 넘어 LLM 에이전트를 다차원으로 평가하는 방법론을 제시한다. 6가지 제어 결정 분류(행동·질문·거부·중단·확인·복구)와 9가지 궤적 실패 분류 체계를 제안한다. 분류법 인식 vs 비인식 프롬프트 방법론 비교에서, 명시적 레이블 메뉴 제거 시 모든 모델의 궤적 정확도가 14~40pp 하락했다. 15개 에이전트 벤치마크 커버리지 감사로 단일 모델이 모든 행동 축에서 우세하지 않음을 확인했다.
- •6가지 제어 결정 분류와 9가지 군적 실패 분류로 에이전트 평가를 단순 성공률 이상으로 확장한다.
- •에이전트의 겨밀능은 프롬프트 내 지도 라벨에 크게 의존하며, 라벨 제거 시 모든 모델이 0.54~0.62 평주로 수렴한다.
- •15개 에이전트 벤치마크 감사에서 단일 모델이 모든 행동 축에서 우세하지 않음을 확인했다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
AgentAtlas: Beyond Outcome Leaderboards for LLM Agents
- 1.LLM 에이전트 평가를 위한 6개 제어 결정 분류와 9개 궤적 실패 분류 체계 AgentAtlas 제안
- 2.분류 체계 인식 vs 미인식 방법론으로 모델의 외관상 능력 중 프롬프트 감독 부분 측정
- 3.레이블 맴뉴 제거 시 모든 모델의 궤적 정확도 14-40pp 하락, 0.54-0.62 범위로 수렴
왜 중요한가?
단일 정확도 지표를 넘어 배포 가능한 에이전트 평가의 새로운 측정 프로토콜을 제안해 AI 에이전트 벤치마킹 방법론에 중요한 기여를 한다.
언급 프로젝트
본문 미리보기
arXiv:2605.20530v1 Announce Type: new Abstract: Large language model agents now act on codebases, browsers, operating systems, calendars, files, and tool ecosystems, but the benchmarks used to evaluate them are fragmented: each emphasizes a different unit of measurement (final task success, tool-call validity, repeated-pass consistency, trajectory safety, or attack robustness). A line of 2024-2025 work has converged on the diagnosis that a single accuracy column is no longer the right unit of c
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:12AI 초안

