이 논문은 LLM 에이전트가 과거 경험을 스킬로 저장하고 모델 파라미터처럼 최적화하는 '자가 진화' 과정에서 제한된 궤적에 과적합되는 문제를 탐색-활용 트레이드오프 관점으로 재해석하고, 이를 완화하는 3단계 프레임워크 SkillBoost를 제안한다. 구조화된 활용 단계는 관찰된 실패를 편집 가능한 스킬 요소로 국소화하고, 사전지식 기반 탐색 단계는 LLM의 사전 지식을 활용해 다양한 수정 후보를 생성하며, 검증된 수용 단계는 회귀 한계 내에서 성능이 개선될 때만 후보를 확정한다. 23개의 모델-벤치마크 조합 실험에서 SkillBoost는 인간이 설계하거나 LLM이 생성한 스킬보다 뛰어난 성능을 내면서도 과적합을 완화하는 최고 성능을 달성했으며, 전이 실험에서 최적화된 스킬이 유사 과제의 다른 에이전트에도 재사용될 수 있음을 확인했다.
- •스킬 자가진화의 과적합 문제를 탐색-활용 트레이드오프로 재해석
- •구조화된 활용·사전지식 기반 탐색·검증된 수용의 3단계 프레임워크 SkillBoost 제안
- •23개 모델-벤치마크 조합에서 인간 설계·LLM 생성 스킬 모두 능가하는 최고 성능 달성
- •전이 실험에서 최적화된 스킬이 유사 과제의 다른 에이전트에도 재사용 가능함을 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Rethinking Self-Evolution: A Constrained Exploration-Exploitation Process for Mitigating Skill Overfitting
본문 미리보기
arXiv:2607.26643v1 Announce Type: new Abstract: Enabling large language model (LLM) agents to accumulate and reuse experience from past interactions remains a central challenge in real-world applications. A promising solution is to treat skills as trainable states and optimize them in the same way as model parameters in neural network training. However, data-driven skill optimization is prone to overfitting to the limited trajectories collected from real environments. Overexploiting these traje
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:49AI 초안

