한국어 요약by Claude · 2026. 5. 18.
IBM Research가 AI 에이전트 시스템 전체를 비교 평가하는 오픈 벤치마크 '오픈 에이전트 리더보드'를 출시했습니다. 코딩·리서치·고객 서비스·개인 보조 등 6개 벤치마크에서 에이전트 품질과 비용을 함께 평가하여, 동일 모델이라도 에이전트 아키텍처에 따라 성능과 비용이 크게 달라짐을 보여줍니다. 도구 선별 기능이 모든 모델에서 성능을 향상시켰으며, 실패한 실행은 성공 실행보다 20~54% 더 많은 비용이 발생합니다. 평가 프레임워크 Exgentic과 논문이 함께 공개되어 커뮤니티 재현 및 기여가 가능합니다.
- •SWE-Bench, BrowseComp+, AppWorld, tau2-Bench 등 6개 벤치마크를 통합 프로토콜로 연결해 코딩, 웹 리서치, 앱 작업, 고객 서비스 등 다양한 환경에서 범용 에이전트를 평가합니다.
- •동일한 모델을 사용하더라도 에이전트 아키텍처 설계에 따라 성공률과 비용이 크게 달라지며, 현재는 모델 선택이 지배적 요인이지만 에이전트 구조도 결과에 영향을 미칩니다.
- •실패한 실행은 성공한 실행보다 20~54% 더 많은 비용을 소모하므로, 에이전트 실패 행동 분석이 운영 비용 관리에 중요한 지표가 됩니다.
- •범용 에이전트가 벤치마크 특화 튜닝 없이도 전문 시스템과 대등하거나 일부 경우 능가하는 성능을 보였으며, 오픈웨이트 모델은 최신 클로즈드소스 모델 대비 평균 18~29%p 뒤처집니다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
The Open Agent Leaderboard

출처:HuggingFace Blog
AI 인사이트
개발자투자자
- 1.IBM이 오픈 에이전트 리더보드를 출시해 AI 에이전트 시스템 전체를 평가
- 2.동일 모델도 에이전트 아키텍처에 따라 성능과 비용이 크게 달라짐
- 3.범용 에이전트가 특화 에이전트와 대등하거나 뛰어난 성능을 보이는 사례 확인
- 4.실패 작업이 성공 작업보다 20~54% 더 많은 비용을 유발
왜 중요한가?
모델 선택뿐 아니라 에이전트 아키텍처가 성능에 미치는 영향을 정량화한 최초의 공개 벤치마크로, 프로덕션 에이전트 배포 시 비용 효율성 판단에 직접 활용 가능하다.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
공유:
#AI 에이전트#리더보드#벤치마크#오픈소스 AI#IBM Research
이 글이 만들어진 과정
- 23:34AI 초안

