이 연구는 다중턴 에이전트 학습에서 성공 궤적 같은 학습 전용 참조로 매 턴 학생을 재채점하는 '특권적 온폴리시 증류'가 학생의 실행 상태가 참조와 어긋나는 상태-참조 불일치 문제를 일으킨다는 점을 지적한다. 이를 해결하기 위해 State-Matched Routing and Contextualized Self-Distillation(SMRC-SD)을 제안하는데, 매 턴 학생의 현재 실행 상태가 참조 궤적의 지원 상태와 일치하는지 확인해 일치하는 상태에서만 증류를 적용하고, 실제로 도달한 상태에 맞춘 교사 맥락을 구성한다. ALFWorld와 WebShop 실험에서 Qwen3-1.7B 기준 과제 성공률이 ALFWorld에서 0.746→0.865, WebShop에서 0.574→0.693으로 향상되며 무조건적 전체 경로 증류를 일관되게 능가했다.
- •특권적 증류의 상태-참조 불일치 문제를 처음으로 규명
- •매 턴 학생 상태와 참조 굤적의 지원 상태 일치 여부를 확인해 선별적으로 증류
- •도달한 상태에 맞춘 상태 조건부 교사 맥락 구성
- •ALFWorld 과제 성공률 0.746→0.865로 향상
- •WebShop 과제 성공률 0.574→0.693으로 향상
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
When Privileged Guidance Misaligns: State-Matched Routing and Contextualized Self-Distillation for Multi-Turn Agents
본문 미리보기
arXiv:2608.05219v1 Announce Type: new Abstract: Privileged on-policy distillation provides dense supervision for multi-turn agents by allowing a synchronized teacher to re-score the student's response at every turn with access to training-only references, such as successful trajectories. In interactive environments, however, the student's preceding actions continually change the execution state. As the student takes different actions or completes subgoals in a different order, its rollout may r
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:11AI 초안

