PlanPO는 다중턴 에이전트형 LLM을 강화학습으로 훈련할 때 흔히 쓰이는 그룹 상대 정책 최적화(GRPO)가 성공한 궤적들 사이의 상호작용 효율 차이를 구분하지 못해 우회적인 성공에도 동일한 보상을 주는 '이득 붕괴' 문제를 해결한다. 같은 과제에서 샘플링된 성공 궤적들의 궤적 길이와 턴별 응답 길이 차이를 반영하는 '거칠게-정교하게' 이득 신호를 도입해, 단순히 길이를 최소화하는 방향으로 퇴행하지 않으면서 일반화 가능한 계획 능력을 학습하게 한다. ALFWorld, WebShop, SciWorld 등 어려운 다중턴 벤치마크에서 GRPO 대비 평균 27.2% 성능을 향상시켰으며, 추가 훈련 비용은 미미했다.
- •GRPO의 '이득 붕괴' 문제: 우회적 성공에도 동일 보상 부여되는 한계 해결
- •교적·턴 단위 길이 차이를 반영한 '거칠게-정교하게' 이득 신호 도입
- •ALFWorld·WebShop·SciWorld 등에서 GRPO 대비 평균 27.2% 성능 향상
- •길이 최소화로의 퇴행 없이 일반화 가능한 계획 능력 학습, 추가 비용 미미
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
PlanPO: Group Planning-Aware Policy Optimization for Multi-Turn Agentic LLMs
- 1.PlanPO 제안, 성공 궤적 간 상호작용 효율성 차이를 반영하는 GRPO 기반 강화학습 기법
- 2.궤적 길이·응답 길이 차이를 포착하는 coarse-to-fine 어드밴티지 신호 도입
- 3.ALFWorld·WebShop·SciWorld 벤치마크에서 GRPO 대비 평균 27.2% 성능 향상
- 4.추가 학습 비용 거의 없이 최근 강력한 베이스라인들을 능가
왜 중요한가?
기존 GRPO 계열이 동일 보상으로 인해 우회적 성공까지 같은 값을 부여해 '어드밴티지 붕괴'가 발생하던 문제를 궤적 길이 기반 신호로 해결, 멀티턴 에이전트의 일반화 가능한 계획 능력 학습에 실질적 개선을 제시한다.
본문 미리보기
arXiv:2608.17289v1 Announce Type: new Abstract: Group-relative policy optimization has emerged as a key paradigm for training agentic large language models (LLMs) on multi-turn interactive tasks. However, most existing variants fail to distinguish advantages among successful trajectories even when these trajectories differ substantially in their interaction efficiency. For instance, circuitous successes are often assigned the identical outcome reward, causing advantage collapse and severe perfo
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:59AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
