언어 모델이 최종 답변을 표현하기 전에 내부적으로 언제 답변 선호도가 확정되는지를 연구하는 '사전 언어화 확약' 이론을 제시합니다. 유한 답변 집합에 대한 연속 확률을 투영하는 유한 답변 선호 안정화 개념을 도입하며, 이진 과제에서는 정확한 로그 오즈 코드를 도출합니다. Qwen3-4B-Instruct 모델 실험에서 맥락적 유한 답변 투영은 답변이 파싱 가능해지기 17~31 토큰 전에 안정화됩니다. 이 신호는 탐침 없이 모델의 최종 출력을 추적하며 압축 은닉 요약에서 선형적으로 복원 가능합니다.
- •언어 모델이 최종 답변을 생성하기 전에 내부적으로 답변 선호도가 언제 확정되는지를 연속 확률 투영으로 정량화하는 새로운 틀을 제시한다.
- •이진 과제에서 정확한 로그 오즈 코드 대상인 유한 답변 투영은 greedy 평가나 학습 탐침 없이 파서 기반 답변 시작 시점과 안정화 시간을 정의한다.
- •Qwen3-4B-Instruct에서 맥락적 유한 답변 투영은 답변이 파싱 가능해지기 17~31 토큰 전에 안정화되며, 첨생 저진행음에서도 포지츯브 리드를 보인다.
- •이 신호는 모델의 최종 출력을 추적하며 압축된 은닉 요약에서 선형적으로 복원 가능하고, 카서 진의로부터 부분적으로 분리될 수 있는 특성을 가진다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
When Does a Language Model Commit? A Finite-Answer Theory of Pre-Verbalization Commitment
- 1.언어 모델이 최종 답변 출력 전에 선호가 안정화되는 시점을 수학적으로 정의하는 연구
- 2.유한 답변 선호 안정화 개념으로 사전 언어화 콌밋 시점과 리드 토큰 수를 계산
- 3.Qwen3-4B-Instruct에서 평균 17~31 토큰 않서 답변 선호가 안정화됨을 확인
- 4.신호가 모델의 최종 출력을 추적하며 콤팩트 히든 요약에서 선형 복원 가능
왜 중요한가?
LLM의 내부 결정 과정을 외부에서 추적 가능한 신호로 포착하는 새로운 이론적 프레임워크로, 모델 해석 가능성과 조기 개입 연구에 중요한 기반을 제공한다.
언급 프로젝트
본문 미리보기
arXiv:2605.06723v1 Announce Type: new Abstract: Language models often generate reasoning before giving a final answer, but the visible answer does not reveal when the model's answer preference became stable. We study this question through a narrow computable object: \emph{finite-answer preference stabilization}. For a model state and specified answer verbalizers, we project the model's own continuation probabilities onto a finite answer set; in binary tasks this yields an exact log-odds code, $
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

