LLM 신뢰도(confidence) 평가의 표준 기준인 캘리브레이션이 불충분하다고 주장하는 연구다. 캘리브레이션은 자명하게 비일관적인 추정기도 허용하고 평가 분포에 의존하며 일관된 확률 함수로 해석 가능한지 검증하지 못한다. 연구진은 구조적 일관성, 충실성, 유용성 세 축으로 일관된 확률적 신념의 조건을 정식화하고 이를 C1 지표로 운영화했다. 널리 쓰이는 추정기들은 잘 캘리브레이션된 것처럼 보여도 이 조건들을 체계적으로 위반했다—모델은 논리적으로 더 쉬운 질문에 31%의 빈도로 더 낮은 신뢰도를 부여했고, RMSCE를 낮추는 개입도 구조적 위반은 바꾸지 못했다. RLHF와 사고 사슬(CoT)은 유용성 지표만 개선할 뿐 일관성을 복원하지 못했다. 현재 LLM 신뢰도 추정치를 일관된 확률로 해석할 수 없다는 결론으로, 신뢰도 기반 의사결정 시스템 설계에 경종을 울린다.
- •캘리브레이션만으로는 LLM 신뢰도의 확률적 타당성을 보장할 수 없음을 체계적으로 논증
- •구조적 일관성·충실성·유용성 3축의 C1 지표로 일관된 확률 신념 조건을 정식화
- •모델이 논리적으로 더 쉬운 질문에 31% 빈도로 더 낮은 신뢰도 부여
- •RLHF·CoT는 유용성만 개선, 구조적 일관성은 복원 못함—캘리브레이션과 확률적 타당성은 직교
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Rethinking Uncertainty Evaluation in Large Language Models
- 1.캘리브레이션만으로는 LLM 신뢰도 평가가 불충분하다며 '일관된 확률 믿음' 조건을 공식화
- 2.구조적 일관성·충실성·유용성 3축의 C1 지표 제안, 기존 추정기의 체계적 위반 확인
- 3.모델이 논리적으로 더 쉬운 질문에 낮은 신뢰도를 부여하는 경우가 31%에 달함
- 4.RLHF·CoT는 유용성만 개선할 뿐 확률적 일관성은 복원하지 못함
왜 중요한가?
잘 캘리브레이션된 것처럼 보이는 신뢰도 점수도 일관된 확률로 해석할 수 없다는 결과로, 신뢰도 기반 라우팅·거부·앙상블 등 다운스트림 활용의 전제를 흔든다. 캘리브레이션과 확률적 타당성이 서로 직교한다는 진단은 LLM 불확실성 평가 관행의 재설계를 요구한다.
본문 미리보기
arXiv:2607.19367v1 Announce Type: new Abstract: Calibration is the primary criterion for evaluating LLM confidence, but it is insufficient: it admits trivially incoherent estimators, depends on the evaluation distribution, and does not test the extent to which the estimation can be interpreted as a consistent, underlying probability function. What we actually need is for LLM confidence estimates to satisfy the conditions required of coherent probabilistic beliefs. We formalize these conditions
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:40AI 초안

