ToolVerse는 약 400개 실제 MCP(Model Context Protocol)와 4,500여 개 도구로부터 실행 가능한 대규모 에이전트 RL 학습 환경을 자동 구축하는 프레임워크다. 도구 의존성 그래프 기반의 Dynamic Unlocking Sampling 알고리즘으로 장기(long-horizon) 과제를 생성해 GUST 데이터셋을 만들고, 장기 에이전트 RL의 credit assignment 문제를 완화하는 Turn-Aware Relative Advantage 알고리즘을 제안했다. 이 환경에서 대규모 에이전트 RL 학습을 수행한 결과 여러 에이전트 벤치마크에서 장기 도구 사용 능력이 뚜렷하게 향상됐다. 소규모 정형 시나리오에 강하지만 대규모 동적 환경에서 무너지던 LLM 에이전트의 한계를 환경 스케일업으로 돌파하려는 시도다.
- •약 400개 실제 MCP·4,500여 개 도구에서 실행 가능한 RL 학습 환경을 자동 구축
- •도구 의존성 그래프와 Dynamic Unlocking Sampling으로 장기 과제 데이터셋 GUST 생성
- •Turn-Aware Relative Advantage 알고리즘으로 장기 RL의 credit assignment 문제 완화
- •여러 에이전트 벤치마크에서 장기 도구 사용 성능의 뚜렷한 향상 확인
ToolVerse: Unlocking Massive Environments and Long-Horizon Tasks for Agentic Reinforcement Learning
- 1.약 400개 실전 MCP·4500여 개 도구로 대규모 실행형 에이전트 RL 환경을 자동 구축하는 ToolVerse 공개
- 2.도구 의존성 그래프와 동적 언락 샘플링 알고리즘으로 장기 과제를 생성, GUST 데이터셋 제작
- 3.장기 에이전트 RL의 크레딧 할당 문제에 턴 인식 상대 어드밴티지 알고리즘 제안
- 4.여러 에이전트 벤치마크에서 장기 도구 사용 능력의 큰 폭 성능 향상 확인
왜 중요한가?
에이전트 RL의 병목이던 학습 환경 규모 문제를 실제 MCP 생태계로 해결한 점이 핵심으로, MCP 기반 도구 통합이 표준화되는 흐름에서 장기(long-horizon) 도구 사용 학습의 실용적 레시피가 될 수 있다.
본문 미리보기
arXiv:2607.15660v1 Announce Type: new Abstract: While LLM agents demonstrate strong reasoning abilities in compact and well-defined scenarios, they struggle to maintain robustness and effectiveness when faced with large-scale, diverse, and dynamic real-world environments that demand seamless tool integration. To address this gap, we introduce ToolVerse, a comprehensive framework that scales up agentic RL environments and enables agents to perform complex long-horizon reasoning in Tool-Integrate
전체 내용이 궁금하다면?
원문을 직접 읽어보세요