이 논문은 LLM이 제공하는 설명이 실제 추론을 반영하지 못하는 '불충실성'을 완전성 부족(관련 요인 누락)과 근거성 부족(영향 없는 요인 인용) 두 축으로 구분한다. 기존 방법들은 대부분 근거성 문제 해결에 집중해온 반면, 이 연구는 모델 설명에서 언급되지 않은 개념을 입력에서 제거하고 축소된 입력으로 모델을 재질의하는 테스트 시점 기법을 제안해 완전성 문제를 직접 겨냥한다. 이 방법은 언급된 개념의 영향은 보존하면서 언급되지 않은 영향은 제거하는 방식으로, 가중치 접근이나 대규모 연산 없이 추론 시점에만 적용 가능하다. 두 데이터셋, 여러 모델 계열, 두 가지 독립적 충실성 지표에서 기존 프롬프팅 대비 설명 충실성을 개선하는 것으로 나타났다.
- •LLM 설명의 불충실성을 완전성 부족과 근거성 부족 두 차원으로 구분해 분석
- •설명에 언급 안 된 개념을 입력에서 제거해 재질문하는 테스트 시점 완전성 개선 기법 제안
- •모델 가중치 접근 없이 추론 시점에만 적용 가능한 모델 비종속적 방법
- •두 데이터셋·여러 모델·두 충실성 지표에서 기존 프롬프팅 대비 일관된 개선 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
A Removal Based Approach to Improve LLM Faithfulness at Test-Time
- 1.LLM 설명의 '불완전성'(영향 요인 누락)을 테스트 타임에 직접 교정하는 기법 제안
- 2.모델 설명에서 언급되지 않은 개념을 입력에서 제거한 뒤 재질의해 불완전성만 선택적으로 해소
- 3.두 데이터셋·여러 모델군·두 충실도 지표 전반에서 기존 프롬프팅 대비 설명 충실도 개선
왜 중요한가?
모델 가중치 접근이나 대규모 연산 없이 추론 단계에서만 적용 가능해, LLM 의사결정 설명의 신뢰성을 실무에서 저비용으로 높일 수 있는 방법을 제시한다.
본문 미리보기
arXiv:2609.04343v1 Announce Type: new Abstract: Large language models (LLMs) are increasingly used for consequential decisions, making their explanations an important tool for auditing model behavior. Unfortunately, these explanations can be unfaithful, failing to reflect the actual reasoning underlying the model's decisions. We consider a setting in which an LLM provides both an answer and an explanation in response to a question. We identify two distinct dimensions of unfaithful explanations:
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
