단일 모델의 반복 샘플링(self-consistency)이 모델의 무지를 드러내는지 검증한 연구다. 같은 질문 세트에 대해 한 모델을 τ=1로 100회 실행한 경우와 24개 LLM 앙상블을 τ=0으로 1회씩 실행한 경우를 비교하고, Marchenko-Pastur 랜덤 행렬 검정으로 신호와 샘플링 노이즈를 분리했다. 5개 모델 계열과 3개 벤치마크(MMLU, HellaSwag, GSM8K)에서 단일 모델 내 변동은 노이즈를 넘는 차원이 최대 1개에 그친 반면, 다양한 앙상블에서는 4개의 고유값이 노이즈 경계를 넘었다. 즉 self-consistency는 질문별 불확실성 추정에는 유효하지만 관련 질문들이 함께 틀리는 교차 질문 구조는 포착하지 못하며, 모델이 무엇을 모르는지는 다양한 모델 앙상블만이 드러낸다. 온도 샘플링 기반 불확실성 정량화의 근본 한계를 보여주는 결과다.
- •단일 모델 100회 샘플링(τ=1) vs 24개 LLM 앙상블 1회씩(τ=0)을 동일 질문에서 비교
- •Marchenko-Pastur 랜덤 행렬 검정으로 신호와 샘플링 노이즈 분리
- •단일 모델 내 변동은 최대 1개 차원만 노이즈 초과, 앙상블은 4개 고유값이 경계 돌파
- •self-consistency는 질문별 불확실성에만 유효—교차 질문 구조는 다양한 앙상블만 포착
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Stochastic Sampling is Epistemically Shallow: The Dimensionality Gap Between Temperature Variation and Model Diversity in LLMs
- 1.단일 모델 100회 샘플링(τ=1)과 24개 LLM 앙상블(τ=0)을 동일 질문에서 비교 분석
- 2.Marchenko-Pastur 랜덤행렬 검정 결과 단일 모델 내 교차질문 구조는 최대 1차원만 유의
- 3.앙상블에선 고유값 4개가 노이즈 경계를 초과, MMLU·HellaSwag·GSM8K 전반에서 확인
- 4.자기일관성은 문항별 불확실성만 정확, 모델이 모르는 것은 다양한 앙상블만 드러냄
왜 중요한가?
temperature 샘플링 반복이 앙상블을 대체할 수 있다는 통념에 정량적 반박을 제시한 연구로, 불확실성 추정·환각 탐지 시스템을 설계할 때 단일 모델 재샘플링만으로는 지식 공백을 못 찾는다는 실무적 한계를 보여준다.
LLM의 확률적 샘플링과 모델 다양성 간의 관계를 분석하여 불확실성을 규명하려는 이 연구는 국내 AI 서비스의 신뢰성 확보에 중요한 통찰을 제공합니다. 특히 의료, 법률 등 고위험군 분야에서 LLM의 답변 변화가 모델의 '무지'를 드러내는지 이해하는 데 필수적인 기반 지식이 될 것입니다.
본문 미리보기
arXiv:2607.20464v1 Announce Type: new Abstract: When a language model gives different answers on repeated runs, does that variation reveal what it does not know? Self-consistency turns the variation into a per-question uncertainty estimate via majority voting. But does the same variation reveal cross-question structure -- related questions flipping together, the way a diverse ensemble does? We compare two regimes on the same questions: one model run $100$ times at $\tau=1$ versus an ensemble of
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

