TurnOPD는 장기(long-horizon) 에이전트 학습을 위한 온폴리시 증류(OPD)를 턴 단위로 예산화해 효율을 높이는 기법이다. 기존 OPD는 후반 턴의 약한 KL 신호에 롤아웃 자원을 낭비하고, 손실이 얕은 토큰에 집중돼 깊은 결정 턴이 덜 학습되는 문제가 있었다. 이를 프로브 기반 통계로 롤아웃 길이를 조절하는 적응형 깊이 예산과, 토큰 수준에서 턴 균형 KL 가중치로 점진 전환하는 손실 예산 두 가지 컨트롤러로 해결했다. ALFWorld, WebShop, Multi-Hop Search 실험에서 동일한 학습 시간 예산 대비 더 높은 검증 정확도를 달성했다. 장기 에이전트 증류 학습의 시간-정확도 프런티어를 실질적으로 개선했다는 점에서 에이전트 학습 비용 절감에 의미가 있다.
- •온폴리시 증류(OPD)를 장기 에이전트 과제에 적용할 때의 두 가지 비효율(후반 턴 롤아웃 낭비, 얕은 토큰 위주 KL 손실 집중)을 규명
- •프로브 기반 턴 통계로 롤아웃 길이를 결정하는 적응형 롤아웃 깊이 예산 컨트롤러 도입
- •KL 가중치를 토큰 수준에서 턴 균형 감독으로 점진 전환하는 턴 정규화 손실 예산 적용
- •ALFWorld, WebShop, Multi-Hop Search에서 동일 wall-clock 예산 대비 기존 OPD보다 높은 검증 정확도 달성
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
TurnOPD: Making On-Policy Distillation Turn-Aware for Efficient Long-Horizon Agent Training
- 1.TurnOPD 제안: 장기 호라이즌 에이전트 on-policy distillation을 위한 턴 단위 예산 전략
- 2.프로브 기반 턴 통계로 롤아웃 길이를 적응 결정해 약한 KL 신호의 꼬리 턴 낭비 제거
- 3.KL 가중을 토큰 수준에서 턴 균형으로 점진 이동시켜 깊은 결정 턴의 학습 부족 해소
- 4.ALFWorld·WebShop·Multi-Hop Search에서 동일 wall-clock 예산 대비 검증 정확도 우위
왜 중요한가?
에이전트 증류에서 전체 궤적 롤아웃과 궤적 수준 KL이 낭비하는 계산을 턴 단위로 재배분해, 같은 학습 시간에 더 높은 정확도를 내는 정확도-시간 프런티어를 앞당겼다. 장기 호라이즌 에이전트를 작은 모델로 증류하려는 팀에 바로 적용 가능한 효율화 기법이다.
본문 미리보기
arXiv:2607.05804v1 Announce Type: new Abstract: On-policy distillation (OPD) trains a student policy by matching a stronger teacher on the student's own trajectories, offering a promising framework for language agent training. However, its application to long-horizon agentic tasks remains insufficiently explored. We identify two key inefficiencies in vanilla agent OPD: (1) full-horizon rollouts often waste wall-clock resources on tail turns that provide weak and noisy KL supervision, and (2) tr
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

