OrchestraBench는 멀티에이전트 오케스트레이션이 왜 실패했는지, 실패 연쇄가 어디서 시작됐는지, 어떤 라우팅 결정이 붕괴를 초래했는지 진단하는 시드 재현 가능한 실패 주입 도구다. 캐스케이드 반경과 실패 모드별 복구율을 핵심 지표로 도입해 라우팅 정책을 부트스트랩 신뢰구간과 대응 검정으로 비교한다. 26건의 골드 라벨 진단에서 키워드/플래그 라우터는 오도성·누락 플래그가 있는 적대적 사례에서 0%를 기록한 반면, 의도 추론 모델 라우터는 오라클과 동일한 100%를 기록했다. 실제 Claude 에이전트로 검증 가능한 산술 의존 체인을 활용한 통제된 메커니즘 실험에서는 5개 MAST 실패 모드에 걸쳐 도구 결함은 완전 복구(1.0), 모호한 위임은 부분 복구(0.30), 세 가지 잠재적·의미적 모드는 전혀 복구되지 않음(0.0)이라는 3단계 위계를 발견했다. 이 순서는 대출 승인 워크플로로 재구성하거나 Sonnet·Opus·Haiku 모델을 바꿔도 유지됐으며, 캐스케이드 반경은 파이프라인 깊이가 3에서 7로 늘수록 평균 0.9에서 4.7로 증가했다.
- •캐스케이드 반경·실패 모드별 복구율을 핵심 지표로 도입
- •키워드 라우터는 적대적 사례 0%, 의도 추론 라우터는 오라클과 동일한 100%
- •도구 결함은 완전 복구(1.0), 모호한 위임은 부분 복구(0.30), 잠재적 모드는 미복구(0.0)
- •이 3단계 위계가 워크플로 재구성·모델 교체에도 일관되게 유지
- •캐스케이드 반경이 파이프라인 깊이 3→7에서 평균 0.9→4.7로 증가
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
OrchestraBench: Evaluating Multi-Agent Orchestration Failure Modes, Recovery, and Decomposition Quality
본문 미리보기
arXiv:2608.05263v1 Announce Type: new Abstract: Multi-agent orchestration frameworks are moving from demos to production, yet benchmarks typically report task accuracy without diagnosing why a pipeline failed, where a cascade began, or which routing decision caused the breakdown. OrchestraBench evaluates failure, recovery, and decomposition through a controlled, seed-reproducible failure-injection harness over templated enterprise workflows. It introduces cascade radius and per-failure-mode rec
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:11AI 초안

