이 논문은 AI 안전성 평가 트랜스크립트에서 모델의 사고사슬(CoT)이 최종 답과 논리적으로 일치하는지 사후 검사하는 '추론 일관성 스캐닝' 기법을 제안한다. 충실성(faithfulness) 검증은 통제된 개입 실험이 필요하지만, 일관성은 트랜스크립트만으로 판정 가능하다는 점에 착안했다. 저자들은 비일관성을 6개 하위 유형으로 분류하고, InstrumentalEval 출력을 수작업 검증한 60개 트랜스크립트 벤치마크를 구축했으며, InspectScout용 스캐너를 구현했다. 4개 생성 모델과 3개 평가에서 추론 비일관성이 실제로 존재하고 탐지 가능하며 모델·과제 유형에 따라 체계적으로 달라짐을 보였다. 안전성 평가 결과를 해석할 때 CoT를 액면 그대로 믿어선 안 된다는 실무적 경고이기도 하다.
- •개입 실험 없이 트랜스크립트만으로 판정 가능한 '추론 일관성'을 충실성과 구분해 형식화
- •비일관성을 6개 하위 유형으로 분류하는 택소노미 제시
- •InstrumentalEval 출력 기반 60개 트랜스크립트의 검증된 벤치마크 구축
- •InspectScout용 일관성 스캐너를 최초 구현
- •4개 모델·3개 평가에서 비일관성이 모델과 과제 유형별로 체계적으로 변화함을 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Reasoning Consistency Scanning: A Framework for Auditing Chain-of-Thought Validity in AI Safety Evaluations
- 1.CoT 추론과 답변의 논리적 일관성을 트랜스크립트만으로 사후 검사하는 '추론 일관성 스캐닝' 제안
- 2.불일치 6개 하위유형 분류체계 정의, InstrumentalEval 기반 검증 벤치마크 60건 구축
- 3.InspectScout용 스캐너 구현, 4개 모델·3개 평가에서 불일치가 모델·과제별로 체계적 변동 확인
왜 중요한가?
충실성(faithfulness) 검증은 통제 실험이 필요해 사후 적용이 불가능했지만, 일관성은 기록만으로 검사할 수 있어 이미 수행된 AI 안전 평가 트랜스크립트를 대규모로 감사할 실용적 경로를 연다.
본문 미리보기
arXiv:2607.07229v1 Announce Type: new Abstract: Prior work has shown that chain-of-thought (CoT) reasoning is often unfaithful: a model's stated reasoning does not reliably reflect the process that produced its output. Detecting unfaithfulness, though, requires controlled experimental interventions, which cannot be applied to evaluation transcripts after the fact. We turn instead to a more tractable question that has received less attention: whether the stated reasoning is logically consistent
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

