조직·벤더·신뢰 경계를 넘나드는 멀티에이전트 LLM 파이프라인에서 인터페이스 제약 하 워크플로 학습을 연구했다. 이를 인터페이스 제약 반마르코프 결정 과정(IC-SMDP)으로 형식화하고, 핸드오프마다 스칼라 하나만을 교환하는 비동기 분산 Q-학습 알고리즘 IC-Q를 설계했다. IC-Q는 분산 부분 관측 하에서 신경 Q-학습에 대한 최초의 유한 샘플 수렴 보장을 제공하며, 네 가지 실험에서 공동 궤적 없이도 중앙 집중식 오라클에 필적하는 성능을 달성했다.
- •인터페이스 제약 반마르코프 결정 과정(IC-SMDP)으로 분산 멀티에이전트 워크플로를 형식화
- •핸드오프마다 스칼라 하나만 교환하는 비동기 분산 Q-학습 알고리즘 IC-Q 설계
- •분산 부분 관측 환경에서 신경 Q-학습에 대한 최초의 유한 샘플 수렴 보장 제시
- •멀티 LLM 수학 추론·라우팅·CPU 프로그래밍 실험에서 공동 궤적 없이 중앙 집중식 오라클 수준 달성
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Learning to Hand Off: Provably Convergent Workflow Learning under Interface Constraints
- 1.에이전트들이 공유 아티팩트로 제어권을 넘기는 인터페이스 제약 워크플로 학습 문제 연구
- 2.IC-Q 알고리즘 제안: 핸드오프마다 스칼라 하나만 교환하는 비동기 분산 Q-러닝
- 3.분산 부분 관측 가능성 하에서 신경망 Q-러닝의 첫 유한 샘플 수렴 보장 달성
왜 중요한가?
조직·벤더 경계를 넘는 멀티 에이전트 LLM 파이프라인에서 중앙화 없이 수렴 보장을 제공하는 이론적 기반을 처음으로 마련한 연구다.
언급 프로젝트
본문 미리보기
arXiv:2605.19140v1 Announce Type: new Abstract: We study workflow learning in a setting where specialized agents hand off control through a shared artifact, each agent observes only a local function of that artifact and its own private state, and no centralized learner accesses joint trajectories -- the operating regime of multi-agent LLM pipelines that span organizational, vendor, or trust boundaries. We formalize this regime as an interface-constrained semi-Markov decision process (IC-SMDP),
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

