LLM 심사위원(LLM-as-judge) 앙상블이 전제하는 '합의=정확성'이라는 가정이 신뢰할 수 없음을 대규모로 입증한 연구다. 모델은 공유된 편향, 암기된 휴리스틱, 선택지 위치 선호 때문에 자기 자신 또는 다른 모델과 진실이 아닌 이유로 합의할 수 있다. GPQA Diamond·AIME에서 53개 러너가 K=50 샘플씩 총 26만5천 샘플을 뽑아 분석한 결과, 합의는 정확성의 양의 상관이지만 약한 예측자(rho 0.20~0.59)였고 유용성은 상황 의존적이었다. 미포화 중급 모델과 연산 배분에는 유용하나, 가장 일관된 프론티어 모델에서는 과신만 커질 뿐 정확도는 나아지지 않았다(합의≥0.8인 GPQA 항목의 48%가 오답). 자기일관성은 독립적 신뢰도 점수가 아닌 조건부 대리지표로만 써야 함을 시사한다.
- •심사위원 간 또는 자기 샘플 간 '합의=정확성' 가정이 공유 편향·암기 휴리스틱 때문에 신뢰할 수 없음을 입증
- •GPQA Diamond·AIME에서 53개 러너, 총 26만5천 샘플 규모의 교차 분석 수행
- •합의는 약한 예측자(rho 0.20~0.59)로, 미포화 중급 모델·연산 배분에만 유용
- •가장 일관된 프론티어 모델은 합의≥0.8 항목의 48%가 오답으로 과신만 커짐
- •자기일관성은 독립적 신뢰도 점수가 아닌 조건부 대리지표임, 익명화된 데이터 공개
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
When LLMs Agree, Are They Right? Auditing Self-Consistency and Cross-Model Agreement as Confidence Signals
- 1.LLM 판정 '일치=정답' 가정을 26.5만 샘플 실험으로 검증, 상관 0.20~0.59의 약한 예측력
- 2.GPQA Diamond·AIME에서 53개 러너가 각 50회 샘플링, 일치도는 조건부 프록시에 불과
- 3.최상위 프론티어 모델은 일치도 0.8 이상이 77%지만 그중 48%가 오답으로 과신 경향 확인
- 4.중위권 모델 평가·컴퓨트 배분엔 유용, 비식별 런별 데이터 공개
왜 중요한가?
LLM-as-judge와 자기일관성은 기업 평가 파이프라인의 사실상 표준인데, 모델 간 합의가 공유 편향이나 암기 휴리스틱에서도 나올 수 있어 신뢰도 지표로 쓰기엔 위험하다는 실증이다. 프론티어 모델일수록 확신에 찬 오답이 많다는 점은 평가 설계 재검토를 요구한다.
언급 프로젝트
AI 시스템 평가에 LLM을 활용하는 방식이 확산되는 가운데, LLM들의 자체 일관성 및 모델 간 합의가 항상 올바른 판단을 보장하지는 않는다는 점을 지적합니다. 국내 기업들이 AI 기반 의사결정 시스템을 도입할 때, 이러한 평가 방식의 맹점을 이해하고 교차 검증 및 감사 체계를 강화해야 합니다. AI 시스템의 신뢰도를 높이기 위한 평가 방법론에 대한 심도 깊은 논의가 필요한 시점입니다.
본문 미리보기
arXiv:2607.08065v1 Announce Type: new Abstract: LLM-as-judge (Zheng et al., 2023) is increasingly the default for evaluating AI systems in enterprise pipelines, often scaled to ensembles (Verga et al., 2024) or "mixture-of-experts" (Shazeer et al., 2017) panels of judges. These systems share a key assumption: that consistency -- agreement among judges, or among a model's own samples -- indicates correctness. We show this assumption is unreliable. Agreement is not accuracy: a model can agree wit
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

