구글 클라우드 AI 리서치와 여러 대학 연구진이 자가개선형 AI 에이전트가 테스트 과제를 외워버리는 문제를 막는 'RRSI(Regularized Recursive Self-Improvement)' 기법을 공개했다. 에이전트는 모델을 감싸는 '하네스'(프롬프트·도구·메모리 로직)를 스스로 반복 수정해 성능을 높이지만, 같은 테스트 과제에만 최적화되면서 새로운 과제에서는 성과가 사라지는 부작용이 있었다. RRSI는 한 번에 수정할 수 있는 편집량에 점점 줄어드는 예산을 걸고, 특정 과제명이나 벤치마크 트릭을 하드코딩한 제안은 걸러내는 '비평가' 단계를 둬 일반성을 지킨다. 코딩·사무·엔지니어링 등 8개 벤치마크 실험에서 학습 과제 점수는 최대 14.1점, 미학습 과제에서도 최대 4.7점 올랐고 토큰 사용량은 약 30% 줄었다. 하네스를 모델과 분리해 최적화하는 이 접근은 에이전트의 진짜 범용 성능 개선 가능성을 보여준다.
- •RRSI는 Claude Opus 4.8을 고정한 채 하네스(프롬프트·도구·메모리 로직)만 반복 수정해 성능을 개선
- •편집 예산을 점점 줄이고 벤치마크 특화 트릭을 걸러내는 '비평가'로 과적합 방지
- •미학습 벤치마크 5개에서 최대 4.7점 향상, 토큰 사용량 약 30% 감소
- •Gemini 3.5 Flash로 최적화한 하네스가 더 약한 Gemini 3.1 Flash Lite 정확도도 11.2→14.6점으로 끌어올림
- •기존 수동 설계 하네스는 익숙한 환경에서 97.1%, 낯선 환경에서 0% 성공률을 보이는 등 일반화 실패가 심각했음
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Google researchers find a way to keep self-improving AI agents from memorizing their tests

- 1.구글 클라우드AI 연구팀, 자가개선시 테스트과제 암기되는 문제 해결하는 'RRSI' 공개
- 2.RRSI, 훈련과제 점수 최대 14.1점 상승 + 미학습 벤치마크서도 최대 4.7점 향상 동시 달성
- 3.토큰 사용량은 비정규화 버전 대비 약 30% 절감, 고정모델 Claude Opus 4.8 기준 테스트
- 4.강한 모델로 최적화한 코딩 하네스가 약한 Gemini 3.1 Flash Lite 정확도도 11.2→14.6점 향상
왜 중요한가?
최근 에이전트 성능 향상의 핵심이 모델 자체보다 '하네스' 최적화에서 나온다는 점을 재확인하며, 자가개선 루프가 벤치마크에 특화돼 새 과제에서 성능이 떨어지는 '암기' 문제를 edit 예산 축소와 비평 단계로 억제하는 해법을 제시한다.
본문 미리보기
Self-improving AI agents tend to memorize their test tasks, so their gains shrink or disappear on new ones. RRSI, a new method from Google researchers, reins in this effect and lifts scores on unseen benchmarks by up to 4.7 points while using about 30 percent fewer tokens than an unregularized version. The article Google researchers find a way to keep self-improving AI agents from memorizing their tests appeared first on The Decoder.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:33AI 초안

