가중치 업데이트 없이 경험에서 학습하는 자기개선형 LLM 에이전트는 각 에피소드를 외부 메모리에 저장·점수화해 향후 유사 과제에서 재활용하는데, 이 점수는 실제 정답 라벨이 없는 배포 환경에서 LLM 자체 평가에 불과하다. 연구진은 이로 인해 잘못된 에피소드가 오히려 높은 보상을 받아 에이전트가 자신이 가장 확신하는 실수를 우선 재사용하는 '에코 갭(Echo Gap)' 실패 모드를 규명했다. 오류는 평균화되지 않고 메모리를 통해 누적되며, 검증 판정자의 오류도 원래 자기평가 편향과 상관돼 있어 어떤 기억이 과대평가됐는지 식별할 수 없다. 연구진은 이 문제 해결의 필요조건으로 '오류-독립성 가정(EIA)'을 정식화하고, 정답 없이 인플레이션을 보정하는 알고리즘 LUCID를 제안해 BIRD 텍스트-투-SQL 벤치마크에서 실행 정확도를 56.9%까지 끌어올려 자기평가 에이전트(54.0%)와 메모리 없는 에이전트(52.4%)를 모두 앞섰다.
- •자기개선형 LLM 에이전트의 메모리 점수는 정답 라벨 없는 LLM 자체 평가일 뿐이라는 구조적 한계 지적
- •'에코 갭(Echo Gap)': 잘못된 에피소드가 높은 보상을 받아 에이전트가 확신하는 실수를 우선 재사용하는 실패 모드 규명
- •오류가 평균화되지 않고 메모리를 통해 누적되며, 판정자 오류도 자기평가 편향과 상관돼 교정 불가
- •인플레이션 보정의 필요조건으로 '오류-독립성 가정(EIA)' 정식화, 회수 가능 성과를 닫힌형 함수로 도출
- •정답 없는 보정 알고리즘 LUCID, BIRD 텍스트-투-SQL에서 실행 정확도 56.9% 달성(자기평가 54.0%, 무메모리 52.4% 대비 우수)
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Memory Reward Inflation in Self-Improving LLM Agents
본문 미리보기
arXiv:2608.00017v1 Announce Type: new Abstract: Self-improving LLM agents increasingly learn from experience without updating any weights. Each episode is stored in an external memory, scored, and retrieved for similar future tasks to shape later behavior. Viewed through a reward lens, the stored score is a proxy reward for an implicit, non-parametric policy. Each retrieved episode then becomes a policy-improvement step whose reliability hinges on how that score is produced. In deployment, grou
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:11AI 초안

