이 연구는 LLM이 샘플링한 여러 답변 중 하나를 고를 때 다수결 투표 대신 모델의 은닉 상태에서 정답 신호를 읽어 선택하는 CASE(Correctness-Axis SElection) 기법을 제안했다. 핵심은 '디코더빌리티'라는 지표로, 질문별로 정답 후보를 오답보다 얼마나 잘 순위화하는지를 측정해 은닉 상태 기반 선택이 투표보다 나을지 미리 예측한다. 문항별 그룹 평가에서 디코더빌리티는 선택 기법의 성능 향상폭과 피어슨 상관계수 0.75로 강한 상관관계를 보였고, 일반·의료 LLM 전반에서 CASE는 중간 난이도 문제에서 최대 19점, 어려운 문제에서 16.8점 투표보다 높은 정확도를 냈다. 디코더빌리티는 모델 규모가 아니라 요구되는 정렬된 지식에 좌우되며, 미지의 과학 분야에도 3.8점 이내 오차로 예측이 전이됐다.
- •은닉 상태에서 정답 신호를 읽어 선택하는 CASE 기법, 다수결 투표 대체
- •'디코더빌리티' 지표가 선택 성능 향상을 사전 예측(피어슨 상관 r=0.75)
- •중간 난이도 문제 최대 19점, 어려운 문제 16.8점 투표 대비 정확도 향상
- •디코더빌리티는 모델 규모보다 요구 지식에 좌우, 미지 과학 분야로도 전이
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
A decodability criterion predicts when hidden-state selection beats majority voting in large language models
- 1.CASE(Correctness-Axis SElection) 제안, 답변 토큰 은닉상태에 선형 게이트를 학습해 최고 후보를 선택하는 동적 결합기
- 2.핵심 기여는 'decodability' 지표: 은닉상태 선택이 투표보다 우수할지를 사전에 예측
- 3.기존 프로브의 높은 정확도는 질문 식별 누설에 따른 착시이며, 문제별 그룹화 평가에서는 사라짐
- 4.일반·의료 LLM에서 CASE는 중난이도 문제 최대 19점, 고난이도 문제 16.8점 투표 대비 성능 향상
왜 중요한가?
난이도 높은 질문에서 다수결 투표가 상관된 오류로 오답을 고를 수 있다는 한계를, 신뢰 가능 시점을 사전에 예측할 수 있는 decodability 지표로 보완해 언제 은닉상태 선택이 투표보다 나은지 실용적 기준을 제시한다.
언급 프로젝트
본문 미리보기
arXiv:2608.17124v1 Announce Type: new Abstract: Combining the answers a large language model (LLM) samples for a question into one decision is a test-time information fusion problem, usually solved by majority voting. Voting is unreliable on difficult questions, where the sampled answers share correlated errors, so the wrong answer can win and drawing more samples makes the decision worse. Selecting a candidate by reading a correctness signal from the model's hidden states is a promising altern
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:59AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
