이 논문은 LM 에이전트의 탐색(exploration)과 활용(exploitation) 오류를 정책 내부에 접근 없이 정량화하는 방법을 제안한다. 부분 관측 2D 그리드 맵과 미지의 DAG 태스크로 구성된 제어 가능한 환경을 설계해 탐색/활용 난이도를 프로그래밍적으로 조정한다. 프론티어 LM 에이전트들을 평가한 결과 최신 모델도 고전하며 모델별 실패 모드가 다름을 확인했다. 추론 모델이 더 효과적이고, 최소한의 하네스 엔지니어링으로 두 능력 모두 크게 개선 가능함을 보였다.
- •LM 에이전트의 탐색·활용 오류를 정책 내부 없이 측정하는 방법 제안
- •부분 관측 2D 그리드 + 미지의 DAG 태스크 기반 제어 가능 환경
- •프론티어 LM 에이전트들 모두 고전, 모델별 실패 모드 상이
- •추론 모델이 더 효과적이며 하네스 엔지니어링으로 추가 개선 가능
- •정책 불가지(policy-agnostic) 메트릭으로 정량 비교 가능
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Exploration and Exploitation Errors Are Measurable for Language Model Agents
- 1.LM 에이전트 탐색·활용 능력을 정책 없이 정량 측정
- 2.프론티어 모델도 탐색·활용 태스크에서 고전
- 3.추론 모델이 하네스 개선으로 큰 향상 가능
왜 중요한가?
에이전트 평가가 end-to-end 성능에 치중되던 상황에서 탐색·활용이라는 근본 능력을 분리해 측정하는 방법. 다양한 LM 에이전트 비교·개선의 객관적 근거 제공.
본문 미리보기
arXiv:2604.13151v1 Announce Type: new Abstract: Language Model (LM) agents are increasingly used in complex open-ended decision-making tasks, from AI coding to physical AI. A core requirement in these settings is the ability to both explore the problem space and exploit acquired knowledge effectively. However, systematically distinguishing and quantifying exploration and exploitation from observed actions without access to the agent's internal policy remains challenging. To address this, we des
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 15:12AI 초안

