대형 추론 모델(LRM)이 추론을 길게 할수록 항상 이득이라는 가정에 의문을 제기하며, 정답에 도달한 뒤의 추가 추론이 해법을 다듬는지 오히려 이탈시키는지를 분석한다. 저자들은 모델이 처음 정답을 내는 데 필요한 최소 추론 예산을 기준으로 한 접두사 단위 궤적 평가 프로토콜을 제안해, 불필요하지만 무해한 '장황한 과사고'와 이미 맞은 궤적을 무너뜨리는 '해로운 과사고'를 구분한다. 멀티모달 벤치마크에서 추론 집약적이라 여겨진 문제들이 의외로 적은 추론만 요구했고, 첫 정답 접두사에서 멈추면 정확도가 표준 추론 대비 최대 21% 향상됐다. 조기 종료 같은 전략은 장황한 과사고를 최대 50% 줄였지만 해로운 과사고는 막지 못했다. 정답 이탈은 주로 논리적 표류와 시각적 재해석에서 비롯됐으며, 언어 전용 벤치마크에도 일반화돼 광범위한 신뢰성 위험임을 보였다.
- •정답 도달 이후의 추가 추론이 해법을 망가뜨릴 수 있는 '해로운 과사고' 개념 제시
- •최소 추론 예산 기준 접두사 단위 평가로 장황한 과사고와 해로운 과사고를 분리
- •첫 정답 접두사에서 멈추면 표준 추론 대비 정확도 최대 21% 향상
- •조기 종료는 장황한 과사고를 최대 50% 줄이지만 해로운 과사고는 완화하지 못함
- •정답 이탈의 주원인은 논리적 표류와 시각적 재해석—언어 전용 벤치마크에도 일반화
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Thinking Past the Answer: Evaluating Harmful Overthinking in Large Reasoning Models
- 1.대형 추론 모델(LRM)에서 더 긴 추론이 항상 이롭다는 가정을 재검토
- 2.정답 도달 후 추가 추론이 정답을 흔드리는 '해로운 과추론' 개념 정의
- 3.첫 정답 프리픽스에서 멈추면 표준 추론 대비 정확도 최대 21% 향상
- 4.조기 종료는 장황한 과추론은 50% 줄이나 해로운 과추론은 못 막아
왜 중요한가?
모델의 한계가 추론 능력만이 아니라 '멈출 시점을 모르는 것'에도 있음을 보여, 논리적 표류·시각 재해석이 신뢰성을 떨어뜨리는 광범위한 리스크임을 시사한다.
국내에서도 대규모 추론 모델(LRM)의 활용이 확산됨에 따라, 이 연구는 무조건적인 추론 과정의 증대가 성능 향상으로 이어지지 않을 수 있다는 중요한 시사점을 던집니다. 한국 기업들은 LRM 도입 시 단순히 추론 단계를 늘리는 것을 넘어, '과도한 사고'가 오히려 해가 될 수 있음을 인지하고 모델 설계 및 최적화에 대한 깊이 있는 고민이 필요합니다.
본문 미리보기
arXiv:2606.02835v1 Announce Type: new Abstract: Large Reasoning Models (LRMs) improve performance by generating explicit intermediate reasoning traces through increased test-time compute, yet the assumption that longer reasoning is consistently beneficial remains under-examined. While recent evidence shows that additional reasoning can lead models to overthink, we ask: "Once a model has reached the correct answer, does further reasoning refine the solution, or deviate from it?" To study the dyn
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:12AI 초안

