이 논문은 LLM의 신뢰성 있는 배치를 위해 입력 모호성에서 비롯된 우연적(aleatoric) 불확실성을 추정하는 새로운 접근을 제안한다. 기존 분해 방식은 입력에 대한 여러 해석(clarification)을 생성하고 각 해석마다 모델에 답변을 질의한 뒤 답변들을 비교하는 방식이었지만, 저자들은 답변 자체가 불필요하며 비용을 늘리고 인식적 불확실성이 새어 들어와 오도할 수 있다고 주장한다. 대신 답변 없이 그럴듯한 해석의 공간만으로 모호성 기반 불확실성을 직접 추정하는 '해석 전용' 방법을 제안했다. 3개 벤치마크의 모호성 탐지 평가에서 이 방법은 AUROC를 63.34로 개선(기존 60.85 대비)했고, 출력 토큰 기준 연산 비용을 4~26배, API 호출 수를 2.2~3.5배 줄이면서 인식적 불확실성과의 상관관계도 크게 낮췄다.
- •입력 모호성에서 비롯된 우연적 불확실성을 답변 없이 해석 공간만으로 추정하는 방법 제안
- •기존 방식은 여러 해석에 대한 모델 답변을 비교하지만, 답변이 인식적 불확실성을 섮어 오도할 수 있다고 지적
- •3개 벤치마크에서 AUROC 63.34로 개선(기존 60.85 대비)
- •출력 토큰 연산 비용 4~26배, API 호출 수 2.2~3.5배 절감하며 인식적 불확실성과의 상관관계도 감소
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
From Answers to Interpretations: Rethinking Ambiguity-Induced Aleatoric Uncertainty Estimation in LLMs
- 1.LLM의 모호성 기반 불확실성을 답변 생성 없이 해석 공간만으로 추정하는 기법 제안
- 2.기존 방식은 명확화 질문마다 답을 생성해 비교했지만, 이 연구는 해석 문장 자체만 비교
- 3.AUROC 63.34 대 60.85로 성능 개선, 출력 토큰 4~26배·API 호출 2.2~3.5배 절감
왜 중요한가?
모델이 '몰라서' 불확실한 것과 '질문이 모호해서' 불확실한 것을 구분하는 일은 LLM 신뢰성 평가의 핵심 과제인데, 이를 훨씬 저렴하고 정확하게 해낸 결과다.
본문 미리보기
arXiv:2609.04543v1 Announce Type: new Abstract: A key challenge in reliable LLM deployment is recognizing when uncertainty reflects irreducible variability in the task rather than limitations in the model's knowledge. In language tasks, a central source of such aleatoric uncertainty is input ambiguity or underspecification, where multiple interpretations remain plausible. Existing decomposition methods estimate aleatoric uncertainty by generating multiple clarifications of the input, querying t
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
