자율 코딩 에이전트가 더 많은 추론 연산을 들여도 실제 수리 품질로 이어지려면 위치 다양성, 편집 다양성, 신뢰할 수 있는 검증이라는 세 가지 학습 가능한 행동이 필요하다는 연구다. 실행 피드백으로 탐색을 이끌고 각 패치를 자신의 되돌린 트리에 대해 채점하는 방식으로, 8샘플 기준선 대비 48.1%의 에이전트 스텝만으로 SWE-bench Verified의 52.8%를 해결했다. 이 행동들을 정책에 직접 학습시킨 결과, 가중 지도 미세조정만으로 pass@1이 31.9%에서 35.2%로, pass@8은 46.7%에서 51.1%로 올랐고, 정답 수리와 오답 변형을 구분하도록 검증자를 강화학습으로 훈련하자 pass@1 43.0%, pass@8 60.7%로 더 상승했으며 검증자 정밀도도 26.8%에서 41.7%로 개선되고 오탐은 절반 이하로 줄었다.
- •위치 다양성·편집 다양성·신뢰성 있는 검증을 정책에 학습시키는 것이 핵심이라는 주장
- •실행 피드백 기반 채점으로 8샘플 기준선의 48.1% 스텝만으로 SWE-bench Verified 52.8% 해결
- •가중 지도 미세조정으로 pass@1 31.9%→35.2%, pass@8 46.7%→51.1% 향상
- •검증자 강화학습 추가 시 pass@1 43.0%, pass@8 60.7%, 정밀도 26.8%→41.7%로 개선, 7B~30B 전반에서 효과 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Teaching Agents to Code Reliably
- 1.코딩 에이전트의 추가 추론 연산이 성능 향상으로 이어지려면 위치 다양성·수정 다양성·신뢰 가능한 검증이 필요함을 제시
- 2.실행 피드백 탐색과 패치 복원 트리 자체 채점으로 SWE-bench Verified 52.8%를 8-샘플 베이스라인의 48.1% 연산으로 해결
- 3.가중 SFT로 pass@1 31.9%→35.2%, pass@8 46.7%→51.1%로 향상
- 4.RL로 검증자 훈련 후 pass@1 43.0%, pass@8 60.7%까지 추가 상승
- 5.검증자 정밀도 26.8%→41.7%, 허위 승인 절반 이하로 감소, 7B/14B/30B서 효과 유지
왜 중요한가?
코딩 에이전트의 성능 향상이 단순 샘플링이 아니라 '어디를 보고, 어떻게 다르게 고치고, 어떻게 검증하는가'라는 학습 가능한 행동에 달려 있음을 정량적으로 보여줘, 자율 코딩 에이전트의 효율과 신뢰성을 개선하는 구체적 레시피를 제공한다.
언급 프로젝트
본문 미리보기
arXiv:2610.03984v1 Announce Type: new Abstract: Autonomous coding agents solve repository issues by reading code, running commands, editing files, and submitting patches. Extra inference-time compute yields gains only when it produces a useful repair and supplies reliable evidence for choosing one. Three behaviors decide both, and we argue they are teachable rather than byproducts of scale, so a policy can carry them instead of a scaffold. Location diversity remains narrow, since attempts retur
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

