RSEA는 전략·스킬·플레이북의 3계층 자연어 상태를 자기 궤적으로부터 재작성하되, held-out 검증 분할에서 성능이 후퇴하지 않을 때만 반영하는 재귀적 자기진화 에이전트다. ALFWorld·GAIA·τ-bench·WebShop 4개 벤치마크에서 ReAct·Reflexion·GEPA·AWM·ACE·Dynamic Cheatsheet 6개 베이스라인과 동일 백본으로 비교한 결과, 어떤 컨텍스트 진화 방식도 보편적으로 이기지 못했다. RSEA는 ALFWorld 단일 패스 69.3%(ReAct 64.6%), 재시도 시 79.4%로 최고였고, held-out 게이트 없는 Dynamic Cheatsheet는 WebShop에서 0.14로 붕괴(ReAct 0.43)해 무방비 컨텍스트 진화의 불안정성을 드러냈다. 엄격한 held-out 선택이 자기진화를 '어느 벤치마크에서도 나빠지지 않는' 단조 안전 상태로 만든다는 점이 에이전트 자기개선 설계에 실용적 지침을 준다.
- •전략·스킬·플레이북 3계층 자연어 상태를 재귀적으로 재작성하는 RSEA 제안, held-out 분할에서 후퇴 없을 때만 커밋하는 keep-better 게이트 적용
- •ALFWorld 단일 패스 69.3%로 ReAct(64.6%) 능가(McNemar p=0.015), 재시도 포함 79.4%로 전체 최고
- •4개 벤치마크·6개 베이스라인 공정 비교 결과 어떤 아티팩트도 보편적 우위 없음, 강한 백본 도구사용 과제에선 AWM이 최고
- •게이트 없는 Dynamic Cheatsheet는 ALFWorld 70.7%로 선전하나 WebShop 0.14로 붕괴, 무방비 컨텍스트 진화는 고분산·불안전
- •RSEA는 진화된 컨텍스트가 해로우면 vanilla ReAct로 폴백해 어떤 벤치마크에서도 유의하게 나빠지지 않음
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Recursive Self-Evolving Agents via Held-Out Selection
- 1.RSEA, 가중치 업데이트 없이 자연어 상태를 진화시키는 재귀적 자기진화 에이전트 제안
- 2.전략·재사용 스킬·절차 플레이북 3계층을 재작성하되 별도 보류 데이터에서 퇴보 없을 때만 커밋
- 3.ALFWorld에서 69.3%로 ReAct 64.6% 상회, 재시도 포함 79.4%로 최고성능
- 4.가드 없는 Dynamic Cheatsheet는 ALFWorld 70.7%나 WebShop에서 0.14로 붕괴, RSEA는 단조 안전성 유지
왜 중요한가?
자연어 아티팩트 진화 기법이 대개 도움되는 단일 벤치마크에서만 성과로 보고되던 관행을 공정 비교로 바로잡고, 보편적 승자는 없음을 보였다. 엄격한 보류셋 선택 게이트로 재귀적 자기진화를 어떤 벤치마크에서도 기저 대비 퇴보하지 않는 '단조 안전'으로 만든 점이 핵심이다.
본문 미리보기
arXiv:2606.28374v1 Announce Type: new Abstract: LLM agents are increasingly improved without weight updates by evolving a natural-language artifact, such as reflections, workflows, playbooks, cheatsheets, or optimized prompts, that conditions a frozen policy. Such methods are typically reported as wins on the single benchmark where they help. We study them apples-to-apples and surface a sharper picture. We introduce RSEA, a Recursive Self-Evolving Agent that carries a compact three-layer natura
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:40AI 초안

