추론 가능 모델에서 사고 사슬(CoT) 추론이 위치 편향(position bias)을 줄이기는커녕 추론 궤적 길이에 비례해 오히려 증가시킨다는 것을 발견한 연구입니다. 13개 추론 모드 구성(두 개의 R1 증류 7~8B 모델, CoT 프롬프트 기본 모델 2개, DeepSeek-R1 671B)에서 12개가 정확도를 통제한 후에도 궤적 길이와 위치 편향 점수(PBS) 간 양의 편상관관계를 보였습니다. CoT 추론은 기존 직접 답변 방식의 기준선 편향을 길이 누적 편향으로 대체하며, 추론 모델을 객관식 평가에서 순서 강건하다고 가정해서는 안 됨을 경고합니다.
- •CoT 추론과 추론 튜닝된 모델이 위치 편향을 줄인다는 통념과 달리, 13개 구성 중 12개에서 군일 관계 길이가 길어질수록 위치 편향 점수(PBS)가 높아지는 패턴을 발견했다.
- •머리 이음(lead) 효과: 특정 시점 이후 재개된 연속은 R1-Qwen-7B에서 절대적 위치 버킷범위에 따라 16%~32%의 위치 선호 옵션으로 이동하는 인과적 증거를 제공한다.
- •671B 규모에서 전체 PBS는 0.019로 작지만 가장 긴 쫓 출력에서는 PBS=0.071로 나타나, 정확도가 편향 표현을 게이트하지만 근본 메커니즘은 없애지 않는다는 점을 시사한다.
- •CoT 추론은 직접 답변 방식의 기준선 편향을 길이 누적 편향으로 대체하며, PBS·확약 변경점·효과적 전환·절단 탐침등 진단 도구킷을 제시한다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
More Thinking, More Bias: Length-Driven Position Bias in Reasoning Models
- 1.추론 모델에서 사고 과정이 길어질수록 위치 편향(PBS)이 증가하는 현상 발견
- 2.13개 추론 설정 중 12개에서 구적 길이와 위치 편향 점수 간 양의 상관관계 확인
- 3.671B 모델은 전체 PBS가 낙지만 최장 구적 사분위에서 편향이 여전히 증가
- 4.CoT 추론이 기준 위치 편향을 길이 누적 편향으로 대체하는 현상 분석
왜 중요한가?
추론 모델이 기본적으로 순서에 강건하다는 가정을 반박하며, MCQ 평가 파이프라인 설계와 추론 모델 신뢰성 감사에 중요한 함의를 제공한다.
언급 프로젝트
본문 미리보기
arXiv:2605.06672v1 Announce Type: new Abstract: Chain-of-thought (CoT) reasoning and reasoning-tuned models such as DeepSeek-R1 are commonly assumed to reduce shallow heuristic biases by thinking carefully. We test this on position bias in multiple-choice QA and find a different story: within any reasoning-capable model, per-question position bias scales with the length of the reasoning trajectory. Across thirteen reasoning-mode configurations (two R1-distilled 7-8B models, two base models pr
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

