이질적 언어모델 앙상블은 후보 응답의 폭을 넓히지만, 새로 생성된 답변이 이미 지지받는 답변을 대체해야 하는 시점에 대한 원칙적 기준이 없다는 문제를 이 논문은 다룬다. 저자들은 후보 여유공간과 대체 권한을 분리해 후자를 명시적이고 감사 가능한 대상으로 제시하며, 고정된 라벨 없는 결정 규칙 ABD(Agreement-Before-Diversity)를 제안한다. 고정된 등가관계 하에 두 개의 추가 신뢰 샘플이 앵커 답변을 뒷받침하면 유지하고, 그렇지 않으면 이질적 종합으로 대체한다. 이 게이팅 메커니즘에 대해 정확도 격차를 합의 커버리지와 보호된 부분집합에서의 앵커 우위로 분해하는 두 가지 정확한 항등식을 증명했으며, 독립성이나 보정된 신뢰도를 가정하지 않는다. 블라인드 정확 ID 평가에서 ABD는 LiveCodeBench-v6 전체에서 59.43%(Single9 52.57%, HAC 52.00% 대비)를, GPQA-Diamond 분할에서 75.00%(대조군 72.78%)를 달성했다.
- •이질적 언어모델 앙샑블에서 답변 대체 시점을 결정하는 공인된 규칙 ABD(Agreement-Before-Diversity) 제안
- •두 개의 추가 신뢰 샘플이 고정 등가관계 하에서 앱커 답변을 뒷받침해야 유지, 아니면 이질적 종합으로 대체
- •정확도 격차를 합의 커버리지와 보호 부분집합 앞서는 것으로 분해하는 두 정확한 항등식 증명
- •LiveCodeBench-v6에서 59.43%(Single9 52.57%, HAC 52.00% 대비)로 우수
- •GPQA-Diamond에서 75.00%(대조군 72.78%) 달성, 모든 집계 차이를 열거 가능한 보호 계층으로 국소화
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Agreement Before Diversity: Verification-First Complementarity for Heterogeneous Language-Model Coordination
본문 미리보기
arXiv:2608.04618v1 Announce Type: new Abstract: Heterogeneous language-model ensembles expand the space of candidate responses, yet they lack a principled criterion for when a newly generated answer should supersede an already supported one. We decouple candidate headroom from replacement authority, rendering the latter as an explicit, auditable object. Our proposed method, Agreement-Before-Diversity (ABD), is a frozen, label-free decision rule: an anchor answer is retained if two additional tr
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:11AI 초안

