L-MAD는 법률 텍스트 함의(Legal Textual Entailment) 과제에서 멀티 에이전트 토론(MAD) 구조와 집계 방식을 체계적으로 평가한 프레임워크다. 서로 다른 전문가 페르소나를 여러 에이전트에 부여해 강력한 단일 에이전트 베이스라인 대비 최대 8% 성능을 끌어올렸다. 토론 규모 분석에서는 뚜렷한 트레이드오프가 드러났다. 에이전트 수를 늘리면 비일관성이 줄고 정확도가 오르지만, 토론 라운드를 늘리면 에이전트들이 서로의 오류를 강화하는 '과숙의 드리프트(over-deliberation drift)'가 발생해 성능이 오히려 나빠진다. 법률처럼 고위험 영역에서 협업형 멀티 에이전트 시스템을 배치할 때의 실용적 한계와 안전 여유를 제시한 결과다.
- •법률 텍스트 함의 과제에서 토론 구조·집계 방식을 체계적으로 비교한 최초급 연구
- •전문가 페르소나 부여로 단일 에이전트 대비 최대 8% 성능 향상
- •에이전트 수 증가는 정확도 개선, 라운드 연장은 오류를 서로 강화하는 역효과
- •'과숙의 드리프트' 현상을 명명하고 고위험 법률 추론에서의 안전 한계 제시
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
L-MAD: A Systematic Evaluation of Multi-Agent Debate Structures in Legal Reasoning
- 1.법률 텍스트 함의 과제에서 멀티에이전트 토론 구조를 체계 평가하는 L-MAD 제안
- 2.전문가 페르소나 부여로 강력한 단일 에이전트 대비 최대 8% 향상
- 3.에이전트 수 증가는 정확도를 높이지만 토론 라운드 연장은 오히려 오류 강화
- 4.서로의 실수를 증폭하는 '과쇴고 표류(over-deliberation drift)' 현상 규명
왜 중요한가?
멀티에이전트 토론이 항상 이로운 게 아니라 라운드가 길어지면 상호 오류 강화로 성능이 악화된다는 실증적 경계를 제시했다. 법률 같은 고위험 도메인에 협업형 에이전트를 배포할 때의 안전 마진 설계에 직접 참고할 결과다.
언급 프로젝트
본문 미리보기
arXiv:2607.09099v1 Announce Type: new Abstract: While multi-agent debate (MAD) frameworks have shown significant potential in general reasoning, their effectiveness in highly structured, knowledge-heavy legal domains remains under-explored. In this work, we introduce the Legal Multi-Agent Debate (L-MAD) framework to systematically evaluate different debate structures and aggregation methods within Legal Textual Entailment. By assigning distinct expert personas to multiple agents, L-MAD improves
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

