이 연구는 코딩 에이전트 강화학습에서 여러 실행 하네스를 섞어 학습하는 '멀티하네스' 레시피 중 그룹 상대 보상 비교 방식(Within vs Cross)이 실제로 이식 가능한 능력을 만드는지 검증했다. Qwen3-8B를 Aider, OpenHands, Qwen Code, SWE-agent 4개 하네스의 동일 기록으로 재현해 GRPO의 Within(작업-하네스별 그룹)과 Cross(하네스 통합 그룹) 방식을 비교한 결과, 평가 하네스 자체가 평균 해결률을 2.14%에서 9.27%로 4.3배 바꾸는 지배적 변수였던 반면 그룹화 규칙의 차이는 held-out 하네스에서 +0.25~0.16%p에 그쳐 시드 편차 범위 안에 있었다. 아웃오브폴드 분류기가 Cross의 어드밴티지에서 생성 하네스를 복원할 수 있었던 반면 Within에서는 불가능해, 통합 그룹화는 하네스 정보를 '실어 나를' 뿐 held-out 성능에서 더 이식 가능한 능력을 만들지는 못한다는 결론이다.
- •코딩 에이전트 RL에서 GRPO 그룹화 규칙(Within vs Cross)이 이식 가능한 능력을 만드는지 검증
- •평가 하네스 자체가 해결률을 2.14%→9.27%(4.3배)로 바꾸는 지배적 변수, 학습 레시피 영향(1.16배)보다 훨씬 큼
- •held-out 하네스에서 Cross-Within 그룹화 차이는 시드 편차 범위 안에 머물러 유의미하지 않음
- •아웃오브폴드 분류기가 Cross 어드밖테지에서 생성 하네스를 복원 가능해, 통합 그룹화가 하네스 정보를 실어 나른다는 것을 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
What Does Multi-Harness RL Learn? Credit Assignment and Portability in Coding Agents
- 1.코딩 에이전트 RL 훈련에서 여러 실행 하네스를 섞는 방식(Cross)과 하네스별 분리(Within)의 효과를 비교
- 2.Qwen3-8B 기반 실험에서 하네스 자체가 해결률을 2.14%→9.27%로 4.3배 좌우하는 지배적 변수로 확인
- 3.그룹핑 방식(Cross vs Within) 차이는 미확인 하네스에서 미미해 이식성 향상 효과는 크지 않음
왜 중요한가?
코딩 에이전트 RL 연구에서 '어떤 하네스로 평가하는가'가 훈련 레시피보다 결과를 더 크게 좌우한다는 점을 실증해, 향후 벤치마크 설계와 보고 관행에 시사점을 준다.
본문 미리보기
arXiv:2609.04518v1 Announce Type: new Abstract: Agent reinforcement learning (RL) increasingly runs through full execution harnesses, and a multi-harness recipe mixes two choices: exposing the policy to several harnesses, and comparing their rewards inside one relative-advantage group. We isolate the second choice in repository-level coding. From one Qwen3-8B supervised warm start we replay the same frozen task-harness records from Aider, OpenHands, Qwen Code, and SWE-agent, with the same numbe
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
