FlowEvo는 LLM 에이전트가 문제를 풀며 만들어낸 성공 실행 흔적을 재사용 가능한 '스킬 레코드'로 컴파일해 추론 시점의 스킬 뱅크에 축적하는 학습 불필요(training-free) 프레임워크다. 워크플로를 스킬로 컴파일하는 단계, 축적된 스킬을 직접 실행하거나 구조화된 컨텍스트로 주입해 되먹이는 단계, 부정적 전이를 일으키는 스킬을 억제하는 큐레이션 단계로 구성된다. ALFWorld에서 성공률 82.8%로 최강 베이스라인을 23.6%p 앞섰고, 에피소드당 평균 토큰 사용량은 가장 효율적인 베이스라인의 절반 이하였다. 모델 파라미터를 갱신하지 않고도 에이전트가 경험을 누적해 성능을 높일 수 있음을 보였다는 점에서 실용적이며, 코드는 공개돼 있다.
- •성공한 실행 트레이스를 호출 가능한 아티팩트+구조화된 가이드 쌍으로 컴파일하고 인터페이스·리플레이·안전성 검사를 거쳐 등록한다.
- •워크플로→스킬 컴파일, 스킬→워크플로 피드백, 스킬 큐레이션의 세 메커니즘이 결합된 피드백 루프 구조다.
- •ALFWorld 성공률 82.8%로 최강 베이스라인 대비 23.6%p 향상됐다.
- •에피소드당 평균 토큰 사용량이 가장 효율적인 베이스라인의 절반 미만으로, 정확도-비용 균형이 가장 좋았다.
- •HumanEval·GSM8K 등 코드·수학 생성에서도 검증됐고, 어블레이션으로 각 메커니즘의 기여를 확인했다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
FlowEvo: Self-Evolving Agents through the Co-Evolution of Workflows and Executable Skills
본문 미리보기
arXiv:2607.21596v1 Announce Type: new Abstract: Large language model agents increasingly solve complex tasks by constructing inference-time workflows that combine reasoning, tool use, and code execution. While such workflows enable flexible problem solving, the useful procedures discovered during execution are often transient: they help solve the current task but are not retained in a form that can systematically benefit future tasks. We present FlowEvo, a training-free framework that compiles
전체 내용이 궁금하다면?
원문을 직접 읽어보세요