EnvCraft는 에이전틱 강화학습(Agentic RL) 훈련을 위한 상호작용 환경이 극도로 부족한 문제를 해결하기 위해 실행 가능한 환경과 학습 데이터를 자동으로 합성하는 프레임워크다. 환경 합성 엔진이 샌드박스로 격리된 작업공간을 구축하고, 토폴로지 인지형 데이터 생성 엔진이 일관된 과제 궤적을 만들어내며, 이를 통해 139개의 상호작용 환경과 약 2만 개의 복합 과제를 합성했다. 도구 호출 엔드포인트에만 국한된 기존 합성 환경과 달리 상태를 유지하는 실제 작업공간 전반을 아우르는 종단간 요구를 충족한다. Qwen3/3.5 모델(8B~32B) 실험에서 Claw 스타일 벤치마크는 최대 11.9%, 일반 도구 사용 벤치마크는 최대 8.0% 성능이 향상됐고 추론 토큰 비용도 함께 줄었다.
- •에이전틱 RL용 상호작용 환경 부족 문제를 해결하는 자동 합성 프레임워크 EnvCraft 제안
- •139개 환경, 약 2만 개 복합 과제를 자동 생성해 도구 호출 한정 기존 환경의 한계를 극복
- •Qwen3/3.5(8B~32B) 실험에서 Claw 벤치마크 최대 11.9%, 일반 도구사용 최대 8.0% 성능 향상
- •성능 향상과 동시에 추론 토큰 비용 절감도 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
EnvCraft: Synthesizing Executable Environments in Agentic RL for Claw-like Agent
- 1.에이전틱 강화학습용 실행 가능 환경을 자동 합성하는 프레임워크 'EnvCraft' 제안
- 2.샌드박스 격리 워크스페이스 139개, 복잡 작업 약 2만개를 자동 생성
- 3.Qwen3/3.5(8B~32B) 실험에서 Claw형 벤치마크 최대 +11.9%, 범용 도구사용 벤치마크 +8.0% 향상
- 4.동시에 추론 토큰 비용도 감소시켜 효율성까지 개선
왜 중요한가?
에이전틱 RL 훈련의 최대 병목인 상호작용 환경 부족 문제를 자동 합성으로 해결해, 장기 과업 수행 에이전트의 학습 데이터 확보 비용을 크게 낮출 수 있다.
본문 미리보기
arXiv:2609.05576v1 Announce Type: new Abstract: The paradigm of LLMs has rapidly shifted from passive language interfaces to autonomous Claw-like agents that execute long-horizon tasks across stateful workspaces. While Agentic Reinforcement Learning (Agentic RL) provides a promising path to optimize these agents, its scaling is heavily bottlenecked by the severe scarcity of interactive training environments. Existing synthetic environments are strictly limited to tool-calling endpoints, renderi
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

![[10월8일] “수학 문제 4000개에 AI 투입해 성과”…오픈AI가 보여준 과학연구의 변화](https://cdn.aitimes.com/news/photo/202610/216072_220045_048.png)

