비용 부담 때문에 에이전트 벤치마크를 일부만 돌리는 관행이 완주 결과와 같은 결론을 보장하는지, SWE-bench·AppWorld·tau-bench의 완료된 공개 과제 기록을 리플레이해 검증한 연구다. 부분 실행은 완주 벤치마크의 쌍별 비교 결정을 지지하고, 필수 과제 그룹을 커버하며, 미해결 비교가 목표 비율 이하일 때만 '충분'으로 인정했다. 필요한 과제 비율은 벤치마크마다 극적으로 달랐다. 엄격한 0%p 임계에서 AppWorld는 15%, tau-bench는 25%면 모든 목표를 충족했지만 SWE-bench Verified는 90%가 필요했고, SWE-bench Lite는 95%까지도 기본 커버리지 규칙을 못 맞췄다. 부분 평가 보고서는 성능 차 기준, 과제 선정 방식, 커버리지·결정 규칙, 허용 미해결 비교 수를 명시해야 한다는 제언으로, '몇 % 돌려봤더니 A가 낫더라'식 비교의 위험을 정량화했다.
- •SWE-bench·AppWorld·tau-bench 완료 기록 리플레이로 부분 평가의 결론 일치성을 검증
- •'충분' 기준: 완주 결정 지지 + 필수 과제 그룹 커버 + 미해결 비교 목표 비율 이하
- •필요 과제 비율 격차: AppWorld 15%, tau-bench 25% vs SWE-bench Verified 90%, Lite는 95%도 미달
- •부분 평가 보고 시 성능 차 기준·과제 선정·커버리지·결정 규칙·미해결 허용치 명시 권고
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
How Many Tasks Are Enough for Agent Benchmark Decisions? A Replay Analysis of Public LLM Agent Benchmarks
- 1.에이전트 벤치마크 부분 실행이 전체 실행과 같은 결론을 지지하는지 리플레이 분석
- 2.SWE-bench·AppWorld·tau-bench 공개 기록으로 필요 과제 비율 산출
- 3.AppWorld는 15%, tau-bench는 25%만으로 충분하나 SWE-bench Verified는 90% 필요
- 4.부분 평가 보고 시 과제 선택·커버리지·결정 규칙 등 명시 항목 제안
왜 중요한가?
평가 비용 때문에 벤치마크 일부만 돌리는 관행이 흔한데, 필요한 과제 비율이 벤치마크별로 15%에서 90% 이상까지 극단적으로 달라 '일부만 돌려도 된다'는 가정이 위험함을 실증했다. 에이전트 성능 비교 결과를 읽을 때의 체크리스트를 제공한다.
LLM 에이전트 벤치마크에서 신뢰할 수 있는 결론을 도출하기 위한 최소한의 태스크 수에 대한 연구입니다. 고비용의 AI 모델 평가가 부담이 되는 한국의 AI 연구개발 환경에서, 효율적인 벤치마크 실행 방안을 모색하는 것은 연구 자원 절약 및 신속한 기술 검증에 실질적인 도움을 줄 수 있습니다.
본문 미리보기
arXiv:2607.12338v1 Announce Type: new Abstract: Agent benchmarks often compare two agents after all tasks have run, but costly evaluations make partial runs tempting. A task fraction alone does not show whether a partial run supports the same pairwise conclusion as the completed benchmark. We study this question by replaying completed public task-level records from SWE-bench, AppWorld, and tau-bench. A partial budget counts as enough only when it supports the completed benchmark's decision, cov
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:40AI 초안

