FlowEvo는 LLM 에이전트가 문제를 풀며 만들어낸 성공 실행 흔적을 재사용 가능한 '스킬 레코드'로 컴파일해 추론 시점의 스킬 뱅크에 축적하는 학습 불필요(training-free) 프레임워크다. 워크플로를 스킬로 컴파일하는 단계, 축적된 스킬을 직접 실행하거나 구조화된 컨텍스트로 주입해 되먹이는 단계, 부정적 전이를 일으키는 스킬을 억제하는 큐레이션 단계로 구성된다. ALFWorld에서 성공률 82.8%로 최강 베이스라인을 23.6%p 앞섰고, 에피소드당 평균 토큰 사용량은 가장 효율적인 베이스라인의 절반 이하였다. 모델 파라미터를 갱신하지 않고도 에이전트가 경험을 누적해 성능을 높일 수 있음을 보였다는 점에서 실용적이며, 코드는 공개돼 있다.
- •성공한 실행 트레이스를 호출 가능한 아티팩트+구조화된 가이드 쌍으로 컴파일하고 인터페이스·리플레이·안전성 검사를 거쳐 등록한다.
- •워크플로→스킬 컴파일, 스킬→워크플로 피드백, 스킬 큐레이션의 세 메커니즘이 결합된 피드백 루프 구조다.
- •ALFWorld 성공률 82.8%로 최강 베이스라인 대비 23.6%p 향상됐다.
- •에피소드당 평균 토큰 사용량이 가장 효율적인 베이스라인의 절반 미만으로, 정확도-비용 균형이 가장 좋았다.
- •HumanEval·GSM8K 등 코드·수학 생성에서도 검증됐고, 어블레이션으로 각 메커니즘의 기여를 확인했다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
FlowEvo: Self-Evolving Agents through the Co-Evolution of Workflows and Executable Skills
- 1.성공한 워크플로 실행 흔적을 재사용 스킬로 컴파일하는 학습 불필요 프레임워크 FlowEvo 공개
- 2.ALFWorld 성공률 82.8%로 최강 베이스라인 대비 23.6%p 상회, 토큰 사용은 절반 이하
- 3.워크플로→스킬 컴파일, 스킬 검색 재활용, 부정 전이 스킬 억제 큐레이션 3중 메커니즘
- 4.모델 파라미터 업데이트 없이 추론 시점 스킬 뱅크 축적만으로 성능 향상, 코드 공개
왜 중요한가?
파인튜닝 없이 에이전트가 실행 경험을 축적·재사용하는 경로를 보여줘, 배포된 LLM 에이전트 제품에 바로 적용 가능한 자기개선 방식이다. 부정 전이를 걸러내는 스킬 큐레이션을 갖춘 점이 단순 메모리 축적 방식과 차별화된다.
언급 프로젝트
본문 미리보기
arXiv:2607.21596v1 Announce Type: new Abstract: Large language model agents increasingly solve complex tasks by constructing inference-time workflows that combine reasoning, tool use, and code execution. While such workflows enable flexible problem solving, the useful procedures discovered during execution are often transient: they help solve the current task but are not retained in a form that can systematically benefit future tasks. We present FlowEvo, a training-free framework that compiles
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:02AI 초안

