SDOF는 LangChain, LangGraph, CrewAI 같은 멀티에이전트 오케스트레이션 프레임워크에 실제 비즈니스 프로세스의 단계 제약을 강제하는 상태 제약 디스패치 프레임워크다. GRPO로 훈련된 온라인-RLHF 특화 의도 라우터와 유한 오토마톤 GoalStage 검사·전후조건 SkillRegistry 검증을 갖춘 StateAwareDispatcher로 구성된다. 6000개 이상 기업이 사용하는 Beisen iTalent 채용 플랫폼에서 7B 의도 라우터가 GPT-4o 제로샷 대비 80.9% vs 48.9%의 결합 정확도를 달성했다. 종단간 실행에서 86.5% 작업 완료율을 달성하고 불법 HR 주입 작업 22개를 전부 차단했다.
- •LangChain 등 오케스트레이션 프레임워크에 실제 비즈니스 프로세스의 단계 제약을 강제하는 상태 제약 디스패치를 구현한다.
- •GSPO 정렬 7B 의도 라우터가 GPT-4o 제로샷 대비 80.9% vs 48.9%의 높은 결합 정확도를 달성했다.
- •불법 HR 주입 작업 22개 전부 차단하며 메시지 수준 차단에서 정밀도 100%, 재현율 88%를 달성했다.
- •SGD 기반 8개 서비스 도메인 대화에서 201개 단계 순서 충돌을 발견해 실제 파이프라인의 문제를 실증했다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
SDOF: Taming the Alignment Tax in Multi-Agent Orchestration with State-Constrained Dispatch
- 1.SDOF는 멀티에이전트 오케스트레이션을 상태 제약 상태 머신으로 처리해 비즈니스 프로세스 단계 제약을 강제하는 프레임워크
- 2.Online-RLHF 기반 7B Intent Router가 FSM 제약 라우팅에서 제로샷 GPT-4o보다 우수(80.9% vs 48.9%)
- 3.채용 시스템 실제 배포에서 태스크 완료율 86.5%, 불법 HR 작업 전량 차단 달성
- 4.정밀도 100%·재현율 88%·전문가 동의 kappa=0.94 달성
왜 중요한가?
LangChain 등 기존 멀티에이전트 프레임워크의 비즈니스 프로세스 제약 부재를 해결하며, 실제 엔터프라이즈 환경에서 AI 에이전트의 안전성과 규정 준수를 크게 향상시킨다.
본문 미리보기
arXiv:2605.15204v1 Announce Type: new Abstract: Multi-agent orchestration frameworks such as LangChain, LangGraph, and CrewAI route tasks through graph-based pipelines but do not enforce the stage constraints that govern real business processes. We present SDOF, a framework that treats multi-agent execution as a constrained state machine. SDOF operates through two primary defensive layers, implemented by three components: (1) an Online-RLHF Specialized Intent Router trained via Generative Rewar
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

