RODS는 다중턴 도구사용 강화학습에서 정적 데이터셋의 유익한 샘플 고갈 문제를 해결하는 온라인 데이터 합성 기법이다. 저자들은 GRPO의 그래디언트 신호가 롤아웃 보상 분산이 가장 큰, 즉 에이전트 능력 경계의 샘플에 집중됨을 관찰하고, 학습이 진행되며 이 경계가 이동해 유익 샘플이 고갈됨을 지적한다. RODS는 진행 보상 분산을 추가 추론 없는 무비용 경계 탐지기로 재활용해 경계 샘플을 찾고, API 위상·의존 깊이 등 구조적 복잡도를 맞춘 새 변형을 합성하며 정책과 공진화하는 동적 리플레이 버퍼를 운용한다. 400개 인간 시드와 약 800개 활성 풀로 1만7천 샘플 오프라인 파이프라인에 필적하는 성능을 약 20배 적은 궤적으로 달성했다.
- •RODS: 다중턴 도구사용 RL의 유익 샘플 고갈을 해결하는 보상 기반 온라인 데이터 합성
- •GRPO 그래디언트가 보상 분산 최대(능력 경계) 샘플에 집중, 경계 이동으로 정적 데이터 고갈 규명
- •진행 보상 분산을 무비용 경계 탐지기로 재활용해 추가 추론 없이 경계 샘플 식별
- •구조적 복잡도(API 위상·의존 깊이) 맞춘 변형 합성, 정책과 공진화하는 동적 리플레이 버퍼 운용
- •400 시드·약 800 활성 풀로 17K 오프라인 파이프라인 수준 성능을 약 20배 적은 궤적으로 달성
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
RODS: Reward-Driven Online Data Synthesis for Multi-Turn Tool-Use Agents
- 1.RODS: 다중턴 도구사용 RL의 정보성 샘플 고갈 문제를 온라인 데이터 합성으로 해결
- 2.GRPO 그래디언트가 보상 분산이 큰 경계 샘플에 집중된다는 점(Popoviciu 상한) 활용
- 3.진행 보상 분산을 추가 추론 없는 경계 탐지기로 재활용해 신규 변형 합성
- 4.400개 시드로 17K 오프라인 파이프라인급 성능을 약 20배 적은 궤적으로 달성
왜 중요한가?
정적 데이터셋에서 정책이 발전할수록 정보성 샘플이 고갈되는 다중턴 도구사용 RL의 핵심 병목을, 롤아웃 비용만으로 경계 샘플을 찾아 재생성하는 폐루프로 해결해 데이터 효율을 크게 끌어올린다.
다중 턴 도구 사용 에이전트의 강화 학습에서 고품질 데이터 고갈 문제를 해결하기 위한 보상 기반 온라인 데이터 합성 방법은 국내 AI 개발자들에게 매우 중요한 기술입니다. 이를 통해 국내 연구자 및 기업들은 데이터 부족 한계를 극복하고, 더욱 복잡하고 지능적인 AI 에이전트를 효율적으로 개발할 수 있을 것입니다.
본문 미리보기
arXiv:2606.19047v1 Announce Type: new Abstract: Multi-turn tool-use RL is bottlenecked by the rapid depletion of informative samples in static datasets. We observe that the gradient signal in GRPO concentrates on tasks with the highest rollout reward variance, a consequence of the Popoviciu upper bound. Consequently, samples near the agent's capability boundary -- where successes and failures are roughly balanced -- contribute disproportionately large policy gradients. As training progresses, t
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:23AI 초안
