ReAct 방식 LLM 에이전트의 배포 시간 적응을 위해 최종 행동 선택 레이어를 컨텍스트 선형 밴딧으로 모델링하는 OLIVIA 프레임워크를 제안합니다. 동결된 은닉 상태를 결정 컨텍스트로 활용하여 기저 추론 과정을 보존하면서 행동 선택 인터페이스에서 직접 적응하고 명시적 불확실성 추정과 경량 온라인 업데이트를 제공합니다. 4개 벤치마크에서 정적 ReAct 및 프롬프트 기반 기준선보다 일관된 성능 향상을 확인했습니다.
- •OLIVIA는 LLM의 최종 행동 선택 레이어를 컨텍스트 선형 밴딧으로 모델링하여 배포 시간 적응을 수행합니다.
- •동결된 은닉 상태를 결정 컨텍스트로 활용하여 기저 추론 과정을 보존하면서 적응합니다.
- •상한 신뢰 탐색으로 최소 연산 오버헤드로 샘플 효율적인 정책 개선이 가능합니다.
- •4개 벤치마크에서 정적 ReAct 및 프롬프트 기반 추론 시간 기준선보다 일관된 성능 향상을 보였습니다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
OLIVIA: Online Learning via Inference-time Action Adaptation for Decision Making in LLM ReAct Agents
- 1.ReAct 에이전트의 최종 행동 선택 레이어를 문맥 선형 밴딧으로 모델링하는 OLIVIA 프레임워크 제안
- 2.동결된 은닉 상태를 결정 컨텍스트로 활용해 기존 추론 과정 보존
- 3.UCB 탐색으로 최소 계산 오버헤드로 정책을 샘플 효율적으로 개선
- 4.4개 벤치마크에서 정적 ReAct 및 프롬프트 기반 적응 기준선 대비 일관된 성능 향상
왜 중요한가?
배포된 LLM 에이전트가 실제 운영 중 점진적으로 성능을 개선할 수 있는 실용적 온라인 학습 메커니즘을 제시하여, 에이전트 시스템의 배포 후 지속 개선 가능성을 높인다.
언급 프로젝트
본문 미리보기
arXiv:2605.11169v1 Announce Type: new Abstract: Large language model agents interleave reasoning, action selection, and observation to solve sequential decision-making tasks. In deployed settings where agents repeatedly handle related multi-step tasks, small action-selection errors can accumulate into wasted tool calls, latency, and reduced reliability. Despite this need for deployment-time improvement, existing inference-time adaptation methods for LLM agents mainly rely on prompting or retrie
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

