RL 에이전트부터 파운데이션 모델 에이전트까지 다양한 유형을 공정하게 비교할 수 있는 통합 벤치마크 Agentick을 소개합니다. 6개 능력 범주, 4개 난이도 수준, 5개 관찰 모달리티에 걸친 37개의 절차적 생성 과제를 Gymnasium 호환 인터페이스로 제공합니다. 27개 구성, 9만 회 이상의 에피소드 평가 결과, GPT-5 mini가 전반적으로 0.309점으로 선두이며, 추론 하네스가 LLM 성능을 3~10배 향상시키고, ASCII 관찰이 자연어보다 일관되게 우수한 것으로 나타났습니다.
- •Agentick은 RL, LLM, VLM, 하이브리드, 인간 에이전트를 공통 기반에서 평가하는 최초의 통합 순차 의사결정 벤치마크로, 37개 절차 생성 과제와 Gymnasium 호환 인터페이스를 제공한다.
- •27개 설정, 9만 회 이상 에피소드 평가에서 어떤 단일 접근법도 지배적이지 않았으며, GPT-5 mini가 0.309 오라클 정규화 점수로 전반적 1위를, PPO가 계획·다중 에이전트 과제에서 1위를 차지했다.
- •추론 하네스가 LLM 성능을 3~10배 향상시키고, ASCII 관찰이 자연어보다 일관되게 우수하며, 능력 분해 설계 덕에 패러다임별 강약점을 정밀하게 파악할 수 있다.
- •SFT 데이터셋, 오라클 참조 정책, 조합 가능한 에이전트 하네스, 라이브 리더보드를 함께 제공하여 파운데이션 모델 RL 후훈련의 훈련 환경으로도 활용 가능하다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Agentick: A Unified Benchmark for General Sequential Decision-Making Agents
- 1.RL·LLM·VLM·하이브리드 에이전트를 동일 기준으로 평가하는 통합 벤치마크 Agentick 제안
- 2.37개 절차 생성 태스크와 6개 역량 범주, 4개 난이도, 5개 관찰 모달리티로 구성
- 3.GPT-5 mini가 0.309로 전체 1위, PPO는 계획·멀티에이전트 작업에서 강세
- 4.추론 하네스가 LLM 성능을 3~10배 향상, ASCII 관찰이 자연어보다 일관되게 우수
왜 중요한가?
다양한 에이전트 패러다임을 공정하게 비교할 수 있는 표준 벤치마크로, 범용 자율 에이전트 연구 발전에 필수적인 인프라를 제공한다.
본문 미리보기
arXiv:2605.06869v1 Announce Type: new Abstract: AI agent research spans a wide spectrum: from RL agents that learn from scratch to foundation model agents that leverage pre-trained knowledge, yet no unified benchmark enables fair comparison across these approaches. We present Agentick, a benchmark for sequential decision-making agents designed to evaluate RL, LLM, VLM, hybrid, and human agents on common ground and to power research on the fundamental challenges of sequential decision-making. Ag
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

