이 논문은 언어모델의 선형 프로브(linear probe)가 손상된 문맥을 거의 완벽한 정확도로 탐지하지만, 이것이 실제 실패 예측 신뢰성으로 이어지지 않는다는 '아는 것과 말하는 것의 괴리'를 다중홉 산술 체인 실험으로 밝혀낸다. 손상을 탐지하는 프로브가 최종 답의 정오와는 무관하며, 구조화된 신뢰도 형식을 강제하면 모델이 구별 불가능한 두 값으로 붕괴하고, 프로브 지속성이 정답과 오답을 구분하지 못해 사전 등록한 '지속성이 정점을 이긴다' 가설도 기각됐다. 이 패턴은 추론 모델을 포함한 여러 모델 계열에서 일관되게 나타났으며, 실시간 모니터링 개입 효과는 모델·오류유형에 따라 크게 달라 branch-and-pick은 대체로 순이익이지만 reprompt·replace-prior는 구한 만큼 정답 흐름을 깨뜨리는 경향을 보였다.
- •손상 탐지 프로브의 정확도와 실제 실패 예측 신뢰성 사이의 괴리(knowing-saying gap) 규명
- •'프로브 지속성이 정점을 이긴다' 사전등록 가설이 다중홉 실험에서 기각됨
- •branch-and-pick 개입은 순이익, reprompt·replace-prior는 구한 만큼 정답도 깨뜨림
- •프로브 모니터링은 언어화 신뢰도의 보완재일 뿐, 모델·오류유형별 라우팅 필요
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
The Knowing-Saying Gap: When Probes See Errors that Confidence Misses
본문 미리보기
arXiv:2608.07528v1 Announce Type: new Abstract: Linear probes detect corrupted context in language models with near-perfect accuracy, yet this does not translate into reliable failure prediction. The result is a dissociation with direct implications for deployment monitoring. Across multi-hop arithmetic chains, probes that detect corruption turn out to be uninformative about final answer correctness; models forced into structured confidence formats collapse to two values with indistinguishable
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:39AI 초안

