벤치마크 정확도가 포화하면 폐기하고 더 어려운 버전으로 교체하는 관행이 정확도 외 6가지 핵심 차원, 즉 지름길 같은 구성 타당도 문제, 분포 외 일반화, 효율성, 신뢰성, 모델 대 스캐폴드의 상대적 기여, 인간-에이전트 협업 상승효과를 놓치게 한다는 주장을 CORE-Bench 사례로 입증한 연구다(저자에 Arvind Narayanan 포함). 과학 코드 재현성 벤치마크 CORE-Bench Hard의 타당도 위협을 찾아 개선판 v1.1과 분포 외 과제 스위트 CORE-Bench OOD를 내놨고, 포화 후에도 효율성·신뢰성 측정에 유용함을 보였다. 소규모 무작위 실험에서는 인간-에이전트 협업이 실제 재현 작업을 약 2배 가속했으며, 인간 단독 재현의 1/5이 시간 초과였음을 감안하면 과소평가된 수치다. 정확도 중심 평가 패러다임에 대한 엄밀한 대안을 제시한다.
- •포화된 벤치마크도 정확도 외 6개 차원 측정에는 여전히 유용하다는 주장
- •CORE-Bench Hard의 구성 타당도 위협을 규명하고 개선판 v1.1과 OOD 스위트 공개
- •무작위 실험에서 인간-에이전트 협업이 재현 작업을 통계적으로 유의하게 약 2배 가속
- •인간 단독 재현의 20%가 시간 한도 초과로 미완료라 실제 효과는 더 클 가능성
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Life After Benchmark Saturation: A Case Study of CORE-Bench
- 1.벤치마크 정확도 포화 이후에도 6개 차원으로 에이전트 성능 측정을 제안
- 2.CORE-Bench Hard 사례로 지름길 등 구성타당성 위협을 표면화
- 3.개선판 CORE-Bench v1.1과 분포외 과제군 CORE-Bench OOD 도입
- 4.인간-에이전트 협업이 약 2배 속도 향상(통계적으로 유의)
왜 중요한가?
정확도 중심 평가의 한계를 지적하고 효율·신뢰성·스캐폴드·협업 효과 등 다차원 평가를 제시해, 포화된 벤치마크도 폐기 대신 재활용하는 더 엄격한 평가 패러다임을 제안한다.
언급 프로젝트
본문 미리보기
arXiv:2606.26158v1 Announce Type: new Abstract: When a benchmark's accuracy saturates, it is often retired and replaced with a more challenging version. We show that this approach privileges accuracy and misses the opportunity to study six other key dimensions of agent performance: construct validity issues such as shortcuts, out-of-distribution generalizability, efficiency, reliability, the relative importance of the model versus the scaffold, and uplift from human-agent collaboration. We use
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

