Harbor Adapters는 다양한 에이전트 벤치마크를 통합 평가하기 위한 인프라로, 80개 이상의 벤치마크에 대한 어댑터를 개발해 엄격한 코드 리뷰와 패리티 실험으로 검증했다. 연구진은 8개 모델을 54개 벤치마크에서 Terminus-2와 3개 네이티브 하네스 중 하나로 평가하는 대규모 비교를 수행해 기존보다 폭넓은 에이전트 능력·실패 유형 분석을 가능케 했다. 또한 난이도 필터링, AI·인간 감수, 감수-수정 루프를 거쳐 29개 벤치마크에서 82개의 고난도·고품질 과제를 추린 Harbor-Index를 공개했다. 평가된 모델-하네스 조합 중 가장 우수한 GPT-5.5+Codex도 통과율 28.0%에 그쳐, 여전히 여유 있는 난이도를 확보했음을 보여준다.
- •80개 이상 에이전트 벤치마크를 통합 평가하는 인프라 Harbor Adapters 공개
- •8개 모델을 54개 벤치마크에서 Terminus-2와 네이티브 하네스로 비교하는 대규모 평가 수행
- •난이도 필터링과 감수 루프로 29개 벤치마크에서 82개 고난도 과제를 추린 Harbor-Index 공개
- •최고 성능인 GPT-5.5+Codex도 통과율 28.0%에 그쳐 벤치마크의 난이도 여유를 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Harbor Adapters and Harbor-Index: Infrastructure and a Curated Meta-Dataset for Large-Scale Agentic Evaluation
- 1.80개 이상 에이전트 벤치마크를 표준화해 임의 에이전트를 평가하는 인프라 Harbor Adapters 공개
- 2.8개 모델을 54개 벤치마크에서 Terminus-2 및 3개 네이티브 하네스로 대규모 평가
- 3.82개 고난도 과제 셋 Harbor-Index 공개, 최고 성능(GPT-5.5+Codex)도 통과율 28%에 그침
왜 중요한가?
난립한 에이전트 벤치마크를 하나의 인프라로 통합해 재현 가능한 비교를 가능케 한 오픈소스 자원으로, 에이전트 성능을 둘러싼 과장된 주장을 검증하는 기준점이 될 수 있다.
본문 미리보기
arXiv:2609.04298v1 Announce Type: new Abstract: Evaluating agents on the growing number of agentic benchmarks is challenging because they often require complex environments and agent integrations. We introduce Harbor Adapters, a unified evaluation infrastructure for agentic benchmarks. Our work makes three contributions. First, we develop benchmark adapters that port more than 80 benchmarks to evaluate arbitrary agents, and validate them through rigorous code review and parity experiments. Seco
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
