추론자가 검증자에게 전달하는 근거(rationale)가 실제로 무엇을 달성하는지 진단했다. 증거와 후보 답을 고정한 채 근거만 바꾼 결과, 충실한 근거는 답변 정확도를 거의 높이지 못했지만 손상된 근거는 지지 판단을 크게 왜곡시켰다. 블라인드 설정에서 무해한 재구성은 지지 판단을 0~2.5%만 바꿨지만 손상된 근거는 10~22% 흔들었고, 명시적 검토 프롬프트는 이를 34~55%까지 증폭했다. 최종 답변 변화는 더 낮았으며 사람 평가에서는 손상된 근거 10건 중 9건을 거부한 반면 모델은 그대로 받아들여, 근거 공유를 답변 정확도 경로가 아니라 별도의 검증 메시지 채널로 평가해야 한다는 결론이다.
- •충실한 근거는 답변 정확도를 거의 높이지 못하지만 손상된 근거는 지지 판단을 크게(10~55%) 왜곡
- •명시적 근거 검토 프롬프트는 손상된 근거의 왜곡 효과를 34~55%까지 오히려 증폭
- •손상된 지지 판단 변화 중 실제 최종 답변 변화로 이어진 경우는 2.9~35.3%에 불과해 괴리 존재
- •사람 평가자는 손상된 근거 10건 중 9건을 거부했지만 모델은 그대로 받아들이는 '손상 과신뢰' 경향 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
What Do Rationales Communicate? A Message-Intervention Study in Role-Specialized QA
- 1.QA 파이프라인에서 추론자가 검증자에게 보내는 '근거 설명'이 실제로 무엇을 바꾸는지 메시지 개입 실험으로 분석
- 2.MuSiQue·HotpotQA·2WikiMultiHopQA 400건에서 충실한 근거는 정답률을 거의 올리지 못함
- 3.손상된 근거는 검증자의 지지 판단을 10~22%, 명시적 점검 프롬프트에서는 34~55%까지 흔들어놓음
- 4.사람 평가자는 손상된 근거 10건 중 9건을 거부했지만, 모델 검증자는 42건 중 16건에서 과신(overtrust)함
왜 중요한가?
추론 근거 공유가 답변 정확도보다는 검증자를 흔드는 새로운 공격 표면이 될 수 있음을 보여, 역할 분리형 LLM 파이프라인에서 근거 공유를 재검증 메커니즘으로만 취급해서는 안 된다는 점을 시사한다.
본문 미리보기
arXiv:2610.00018v1 Announce Type: new Abstract: Role-specialized QA pipelines increasingly pass rationales from a reasoner to a verifier, but it is unclear what this message actually buys: better answers, stronger support assessment, or a new failure surface. We introduce a message-intervention diagnostic that fixes the evidence and candidate answer while varying only the rationale passed across the reasoner-to-verifier boundary. On 400 MuSiQue, HotpotQA, and 2WikiMultiHopQA examples with DeepS
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

