여러 LLM 심사위원의 합의 점수를 보고하는 'LLM 배심(PoLL)'의 통계적 취약성을 규명하고 강건한 대안 RoPoLL을 제안한다. Huber 오염 모델 하에서 PoLL은 배심 규모와 무관하게, 단 한 명의 심사위원이 LLM 전형적 방식(모드 붕괴, 아첨, 안전 거부)으로 편향되면 무한 편향을 겪는다는 것을 보였다. 합의를 고전적 강건 평균 추정으로 재구성해, 집계 함수를 기하 중앙값(GM) 기반 강건 추정기로 대체했다(튜닝 불필요, 최적 붕괴점 1/2). 13개 오픈웨이트 심사위원(4B~675B)·3개 보상모델 벤치마크·최대 50% 오염에서 RoPoLL은 모든 편향 오염 유형에서 PoLL을 압도했고, 38B 3인 위원회가 30% 오염에서 Mistral-Large-3(675B)를 1.31배 앞서 18배 파라미터 이점을 냈다.
- •PoLL은 단 한 명의 심사위원이 편향되면 배심 규모와 무관하게 무한 편향을 곪는다는 점을 Huber 오염 모델로 증명
- •집계 함수를 기하 중앙값(GM) 기반 강건 추정기로 교체, 튜닝 불필요·최적 붕괴점 1/2
- •13개 오픈웨이트 심사위원·최대 50% 오염에서 모든 편향 오염 유형에 PoLL 압도(교차차원 공격 약 19%)
- •38B 3인 RoPoLL가 30% 오염에서 Mistral-Large-3(675B)를 1.31배 능가, 18배 파라미터 이점
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
RoPoLL: Robust Panel of LLM Judges
- 1.LLM 심사단(PoLL)의 합의 점수가 단 1명의 편향 judge로도 무한대 편향 가능 증명
- 2.집계 함수를 기하 중앙값으로 바꾼 RoPoLL 제안 — 튜닝 불필요, 붕괴점 1/2
- 3.13개 오픈 judge·3개 벤치마크에서 교차차원 공격 시 PoLL 대비 약 19% 우위
- 4.38B급 3-judge RoPoLL이 30% 오염 하에서 675B Mistral-Large-3를 1.31배 능가
왜 중요한가?
LLM-as-judge 평가가 업계 표준이 된 상황에서, 단순 다수결 합의가 모드 붕괴·아첨·안전 거부 같은 전형적 judge 실패에 통계적으로 무방비임을 이론과 실험으로 입증했다. 견고 통계의 고전 기법(기하 중앙값)만으로 평가 파이프라인을 고치는 저비용 처방을 제시한다.
본문 미리보기
arXiv:2606.30931v1 Announce Type: new Abstract: The LLM Jury, a Panel of LLM Evaluators (PoLL) reporting consensus scores, has become a practical alternative to single-judge LLM evaluation, yet its statistical behavior remains poorly understood. We formalize the LLM Jury under the Huber contamination model and show that PoLL incurs unbounded bias under any positive contamination, regardless of jury size, whenever a single judge fails in a biased, LLM-typical way (mode collapse, sycophancy, sa
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

