SkillFlow는 훈련 가능한 감독자 에이전트가 동적 스킬 라이브러리와 상호작용하며 복잡한 과제를 자동 조율하는 흐름 기반 프레임워크다. 보상에 비례한 궤적을 샘플링하는 Tempered Trajectory Balance(TTB) 손실 함수로 다양한 조율 전략 붕괴를 방지하고 단계별 크레딧 할당을 투명하게 제공한다. 재귀적 스킬 진화 메커니즘이 언제 스킬을 생성하거나 제거할지 자율적으로 결정한다. 14개 데이터셋 실험에서 질의응답, 수학 추론, 코드 생성 등 다양한 과제에서 기존 방법을 크게 능가했다.
- •흐름 기반 훈련으로 보상 극대화 시 전략 붕괴 문제를 방지하고 다양한 조율 전략 유지
- •TTB 손실로 투명한 단계별 크레딧 할당을 추가 추론 비용 없이 제공
- •재귀적 스킬 진화 메커니즘이 훈련 신호에서 자율적 역량 성장으로 루프를 완성
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
SkillFlow: Flow-Driven Recursive Skill Evolution for Agentic Orchestration
- 1.SkillFlow는 플로우 기반 학습으로 LLM 에이전트의 작업 오케스트레이션을 자동화하는 프레임워크
- 2.Tempered Trajectory Balance(TTB)로 단일 전략 붕괴 없이 다양한 오케스트레이션 전략 유지
- 3.재귀적 스킬 진화 메커니즘으로 스킬 생성·가지치기를 훈련 신호 기반으로 자동 결정
- 4.14개 데이터셋에서 질의응답, 수학 추론, 코드 생성 등 전반에 걸쳐 기준선 대비 우수
왜 중요한가?
기존 에이전트의 전략 붕괴 및 신용 할당 불투명성 문제를 원칙적 방식으로 해결해 자율 에이전트의 학습 가능성과 확장성을 크게 높인다.
언급 프로젝트
본문 미리보기
arXiv:2605.14089v1 Announce Type: new Abstract: In recent years, a variety of powerful LLM-based agentic systems have been applied to automate complex tasks through task orchestration. However, existing orchestration methods still face key challenges, including strategy collapse under reward maximization, high gradient variance with opaque credit assignment, and unguided skill evolution whose decisions are typically made by directly prompting an LLM to judge rather than derived from principled
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

