연구진은 언어모델 에이전트 주변의 코드인 하네스를 모델 스스로 개선하게 하는 자기진화형 하네스 연구를 진행했다. 기존 방법들은 별도의 제안자가 인간이 설계한 하네스를 수정하고 벤치마크마다 별도의 하네스를 진화시켰지만, 이번 연구는 동일한 고정 모델이 같은 버전의 하네스로 먼저 해결자로서 과제를 풀고 이후 제안자로서 완전한 실행 기록을 읽어 하네스를 직접 수정하는 재귀적 자기개선에 가까운 프레임워크를 제안했다. 49줄짜리 초기 하네스에서 시작해 1단계 종료 시점에 분포 내 벤치마크에서 평균 4.48점, 분포 외 벤치마크에서 12.64점을 개선해 코덱스를 각각 상회하거나 맞추는 성과를 냈고, 2단계에서 분포 외 벤치마크인 클로 이밸에 대한 지속적 진화로 점수를 66.17에서 68.06으로 더 끌어올려 코덱스를 넘어섰다.
- •동일한 고정 모델이 해결자와 제안자 역할을 둘 다 맡아 자신의 하니스를 직접 수정하는 확장을 제시
- •5개 벤치마크에서 학습과 보류셋을 엄격히 분리, 5개 뿔봄 외 벤치마크로 일반화도 검증
- •49줄 초기 하니스에서 1단감 후 분포 나 +4.48점, 봄봄 외 +12.64점 감선, 코놩즈 상회나 닙륨
- •2단감 지속 진화로 클뇌 이밌 점수가 66.17에서 68.06으로 상승, 코놩즈 능거
- •출놥 절삭, 기맽 압축, 독자적 거릈 돼 진현 중 자연 발생릈 릤쿨류즘 분석 제시
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Self-Evolving Harness on Multiple Tasks with the Agent as Its Own Optimizer
- 1.동일 모델이 solver·proposer 역할을 겸해 자신의 하네스를 직접 수정하는 자기진화 프레임워크 제안
- 2.49줄 시드 하네스서 출발, 1단계 진화 후 분포내 평균 4.48점·분포외서 12.64점 향상
- 3.분포내서 Codex 능가, 분포외 벤치마크서는 Codex와 동등한 수준 달성
- 4.Claw-Eval 2단계 지속 진화로 66.17→68.06점 상승, 출력절단·히스토리압축 전략 자연 발생
왜 중요한가?
기존 자기진화 방식이 벤치마크마다 별도 하네스를 요구했던 것과 달리, 하나의 고정 모델·하네스로 여러 도메인에 일반화되는 재귀적 자기개선 경로를 보여준다.
본문 미리보기
arXiv:2609.38372v1 Announce Type: new Abstract: A harness is the code around a language-model agent that organizes prompts, calls tools, manages context, and controls execution. As models grow stronger, recent work has begun to let agents improve their own harnesses, a line of work known as self-evolving harnesses. In most existing methods, a separate proposer running on a human-designed harness modifies the solver's harness, and a separate harness is evolved for each benchmark. Real-world task
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

