22개 주요 에이전트 프레임워크를 BBH·GSM8K·ARC 세 가지 추론 벤치마크에서 통일된 환경으로 비교 평가한 대규모 실증 연구다. 2023년 1월부터 2025년 7월까지 1,200개 GitHub 저장소에서 선별된 프레임워크들을 아키텍처 기반으로 분류하고 정확도·실행 시간·비용·일관성을 측정했다. 22개 중 19개가 모든 벤치마크를 완료했으며 12개는 평균 정확도 74.6-75.9%, 과제당 4-6초, 0.14-0.18센트의 안정적 성능을 보였다. 다만 Camel은 컨텍스트 폭증으로 11일 만에 실패하고 Upsonic은 재시도 폭주로 하루 1,434달러를 소비하는 등 실패 원인은 추론 한계가 아닌 오케스트레이션 문제였다. 수학 추론(GSM8K)에서 평균 44.35%로 BBH·ARC(약 90%) 대비 급격히 낮아져, 메모리·실패 처리·비용 관리가 프레임워크 선정의 핵심임을 시사했다.
- •22개 주요 에이전트 프레임워크를 세 벤치마크에서 통일 평가
- •12개 프레임워크가 74.6-75.9% 정확도와 과제당 4-6초의 안정된 성능 제공
- •실패 원인은 추론 한계가 아닌 오케스트레이션 문제가 대부분
- •Camel은 컨텍스트 폭증으로, Upsonic은 하루 1,434달러 소비로 실패
- •수학 추론(GSM8K) 정확도가 BBH/ARC 대비 극적으로 낮아(44%) 의존성 한계 드러남
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Agentic Frameworks for Reasoning Tasks: An Empirical Study
본문 미리보기
arXiv:2604.16646v1 Announce Type: new Abstract: Recent advances in agentic frameworks have enabled AI agents to perform complex reasoning and decision-making. However, evidence comparing their reasoning performance, efficiency, and practical suitability remains limited. To address this gap, we empirically evaluate 22 widely used agentic frameworks across three reasoning benchmarks: BBH, GSM8K, and ARC. The frameworks were selected from 1,200 GitHub repositories collected between January 2023 an
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:43AI 초안

