소형 언어모델 에이전트를 장기 상호작용 과제용으로 학습시킬 때, 온폴리시 증류(OPD)는 초반에 빠르게 개선되지만 교사 수준에서 포화되고 RL은 상한은 높지만 희소·지연 보상 탓에 초반 비효율적이라는 상보성을 활용한 하이브리드 알고리즘 ATOD를 제안한다. 초반엔 OPD가 지배하다가 점진적으로 RL을 강화하는 어닐링 스케줄과, 긴 궤적에서 유용성 높은 턴을 부드럽게 증폭하는 턴 단위 불일치-불확실성 재가중(T-DUR)이 핵심이다. ALFWorld·WebShop·Search-QA의 세 학생 모델 크기 실험에서 평균 성공률이 OPD 대비 3.03점, GRPO 대비 23.62점 높았고, 교사 모델까지 2.16점 넘어섰다. 증류와 RL의 시점별 결합이 소형 에이전트 사후학습의 실용적 레시피임을 보여준다.
- •OPD는 초반 빠른 모방 후 포화, RL은 상한은 높지만 초반 비효율이라는 상보성을 명시적으로 활용
- •OPD 지배 → RL 점진 강화의 어닐링 스케줄 설계
- •턴 단위 불일치-불확실성 재가중(T-DUR)으로 긴 궤적의 고유용 턴을 증폭
- •ALFWorld·WebShop·Search-QA에서 평균 성공률 OPD 대비 +3.03점, GRPO 대비 +23.62점
- •세 학생 모델 크기 모두에서 교사 모델까지 평균 +2.16점 초과
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
ATOD: Annealed Turn-aware On-policy Distillation for Multi-turn Autonomous Agents
- 1.장기 상호작용 과업용 소형 LM 에이전트 학습법 ATOD 제안
- 2.온폴리시 증류(OPD)와 강화학습을 어닐링 스케줄로 결합해 상호 보완
- 3.고효용 턴을 증폭하는 Turn-level Disagreement-Uncertainty Reweighting 도입
- 4.ALFWorld·WebShop·Search-QA에서 OPD 대비 +3.03, GRPO 대비 +23.62점, 교사도 +2.16점 초과
왜 중요한가?
OPD는 초기 학습이 빠르나 교사 수준에서 정체되고 RL은 보상 탐색은 강하나 초기 효율이 낮은데, ATOD는 둘의 장단을 시간에 따라 결합해 교사 성능을 넘어서는 천장을 달성. 소형 에이전트 후학습 효율을 높인다.
본문 미리보기
arXiv:2606.27814v1 Announce Type: new Abstract: Training small language-model agents for long-horizon interactive tasks requires both fast imitation and reward-driven improvement. On-policy distillation (OPD) provides dense teacher guidance and typically improves rapidly in the early stage, but its gains saturate once the student approaches the teacher, limiting the final performance ceiling. Reinforcement learning (RL) directly optimizes environment rewards and encourages exploratory improveme
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

