연구팀은 대형언어모델의 고확신 오류가 단순히 취약한 내부 추론의 증거가 아니라, 작은 섭동에도 국소적으로 안정적으로 유지되는 '안정적 오보정(stable miscalibration)' 현상일 수 있다고 제안한다. 이를 위해 강제 답변 기준선 아래에서 신뢰도 변화와 과신 오류로 도메인 순위를 매기는 라벨 인지 출력 감사 점수와, 은닉 상태 변화를 측정하는 내부 민감도 프로브 두 가지 진단 도구를 결합했다. 다중 도메인 이진 사실 감사 데이터셋 실험에서 이 감사 점수는 자기비판적 프롬프트가 의사결정 손실을 줄이는 지점을 잘 포착했으나, 직접 라벨링된 기준선이 그 효과를 더 강하게 순위화했다. 내부적으로는 자기비판 프롬프트가 세 개의 오픈웨이트 모델 전반에서 은닉 상태 민감도를 일관되게 줄였지만, 이것이 곧 보정(calibration) 개선을 의미하지는 않았다.
- •고확신 오류를 '취약한 추론'이 아니라 섭동에도 안정적으로 유지되는 '안정적 오보정' 현상으로 재해석.
- •라벨 인지 출력 감사 점수와 은닉 상태 민감도 프로브 두 진단 도구를 결합해 분석.
- •자기비판적 프롬프트는 세 개의 오픈웨이트 모델 모두에서 은닉 상태 민감도를 일관되게 감소시킴.
- •다만 민감도 감소가 곳 보정 개선을 의미하지 않아, 일부 고확신 오류는 안정적이면서도 오보정된 상태로 남을 수 있음.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Stable Miscalibration in Large Language Models: A Practical View of High-Confidence Errors
본문 미리보기
arXiv:2608.13591v1 Announce Type: new Abstract: High-confidence errors in large language models are often treated as evidence of fragile internal inference. We study a different possibility: stable miscalibration, where a confident wrong answer remains locally stable under small perturbations. We combine two diagnostics: a label-aware output-level audit score that ranks domains by confidence variation and overconfident mistakes under a forced-answer baseline, and an internal sensitivity probe t
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:21AI 초안

