두 개의 목표가 상충하는 LLM 에이전트가 여러 턴에 걸쳐 상호작용하면 경쟁이 아니라 대화가 무너지는 붕괴 현상이 나타난다. 연구진은 이를 막기 위해 콘텍스추얼 밴딧, PID 제어기, POMDP 신념 추적기로 구성된 제어이론 기반 거버넌스 계층 'Experience Orchestrator(EO)'를 제안했다. 금융서비스 상담 시뮬레이션 6만 건에서 EO는 고의도 방문자의 상담사 연결률을 46.1%에서 78.1%로(32%포인트) 끌어올렸으며, 밴딧의 콘텐츠 선택이 결과 분산의 97%를 설명했다. 전환 의사가 낮은 방문자에게는 거버넌스 계층이 성패를 가르는 핵심 요인이었지만, 이미 전환에 가까운 방문자에게는 단순 LLM으로도 충분했다. 다만 모든 결과는 LLM 간 시뮬레이션에 기반하므로 실제 사용자 대상 검증이 다음 과제로 남는다.
- •EO는 콘텍스추얼 밴딧·PID 제어기·POMDP 신념 추적기 3가지 메커니즘으로 대화 궤적을 조정
- •6만 건 시뮬레이션에서 고의도 방문자 상담사 연결률이 46.1%→78.1%로 32%포인트 상승
- •밴딧의 콘텐츠 선택이 결과 분산의 97%를 설명, 거버넌스 정책이 결과를 좌우함을 확인
- •전환 의사가 낮은 방문자일수록 거버넌스 계층의 효과가 크게 나타남
- •실제 인간 트래픽 검증은 아직 이뤄지지 않아 다음 단계로 제시됨
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Dynamic Governance of Multi-LLM Agent Systems for Collaborative Conversational Outcomes
본문 미리보기
arXiv:2608.11207v1 Announce Type: new Abstract: When two LLM agents with structurally opposed objectives interact across multiple turns, the absence of a shared goal function produces not competition but collapse: the visitor capitulates, the site agent stops varying its approach, and the conversation terminates without achieving either agent's stated objective. This paper asks whether a control-theoretic governance layer can substitute for that missing goal function. The Experience Orchestrato
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:21AI 초안

