LLM이 동일한 답에 도달하더라도 추론 경로가 불안정·모순적일 수 있는 문제를 진단하기 위해 '구조적 불확실성' 프레임워크를 제안했다. 출력 분산만 보는 기존 방식과 달리, 모델이 자기 출력들 사이의 쌍별 선호를 판단하게 하고 Bradley-Terry·PageRank로 순위 분포를 집계해, 시행 간 순위 불안정성과 시행 내 후보 모호성이라는 두 엔트로피 성분으로 분해한다. 5개 LLM·8개 벤치마크 실험에서 논리·수학 추론은 답 분산과 상보적 신호를 제공해 비신뢰 사례 식별을 개선했으나, 사실 검색에서는 신호가 균일하게 붕괴했다. 시행 내 모호성은 정확도와 양의 상관, 시행 간 불안정성은 음의 상관을 보였다.
- •답 분산이 아닌 '자기 선호 순위의 안정성'에 기반한 구조적 불확실성 프레임워크 제안
- •쌍별 자기선호를 Bradley-Terry+PageRank로 집계해 시행 간 불안정성·시행 내 모호성 두 성분으로 분해
- •논리·수학 추론에서 답 분산과 상보적 신호 제공, 사실 검색에서는 신호가 균일하게 붕괴
- •시행 내 모호성은 정확도와 양의 상관, 시행 간 불안정성은 음의 상관
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Quantifying Consistency in LLM Logical Reasoning via Structural Uncertainty
- 1.추론 경로 일관성을 측정하는 '구조적 불확실성' 프레임워크 제안
- 2.자기선호 순위 안정성을 Bradley-Terry·PageRank로 집계해 두 엔트로피 성분으로 분해
- 3.5개 LLM·8개 벤치마크서 답변 분산과 상보적 신호 제공, 논리·수학 추론서 비신뢰 사례 식별 개선
- 4.시행내 모호성은 정확도와 양의 상관, 시행간 불안정성은 음의 상관
왜 중요한가?
기존 출력 분산 측정이 버리던 '추론 후보를 일관되게 순위 매기는 능력' 신호를 활용해, 다단계 논리 추론의 신뢰성을 영역 민감하게 진단하는 보완 지표를 제시했다.
LLM의 논리적 추론 일관성을 구조적 불확실성을 통해 정량화하는 연구는 국내 AI 시스템의 신뢰성과 투명성을 확보하는 데 매우 중요합니다. 특히 금융, 법률 등 고위험 의사결정 분야에서 LLM 적용 시, 그 추론 과정의 안정성을 검증하는 데 핵심적인 기준을 제공할 것입니다.
본문 미리보기
arXiv:2606.17312v1 Announce Type: new Abstract: Large language models can arrive at the same answer through reasoning paths that are unstable, contradictory, or difficult to rank consistently -- a failure mode especially prevalent in multi-step deductive reasoning. Existing methods assess reliability primarily through output dispersion -- measuring how much sampled answers differ -- but this discards a complementary signal: whether the model can consistently rank competing reasoning candidates.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 15:11AI 초안

