추론 모델의 테스트타임 연산 낭비를 줄이는 조기 종료(early-exit) 규칙들(신뢰도 임계, 엔트로피, 답 안정성, 학습형 종료기)이 언제 실제로 이득인지 비용을 고려해 통제 실험한 연구다. GSM8K·MATH-500·MMLU-Pro·AIME-90·GPQA와 Qwen3·DeepSeek-R1 증류 모델의 18개 설정에서, 정답 손실 허용치 α=0.15로 맞췄을 때 결과는 세 가지 체제로 갈렸다. 학습형 종료(LearnStop)는 Qwen3 자유형 수학 4개 설정 모두에서 승리(+3.2~+21.2pp 토큰 절감), 보정된 스칼라 종료는 객관식 MMLU-Pro에서 우세, 작고 어려운 벤치마크(AIME-90·GPQA)에서는 인증 가능한 공격적 정책이 없었다. 특히 KV 캐시 포킹에서 32% 절감하던 정책이 블랙박스 반복 프리필에서는 121% 추가 비용을 내, 서빙 방식이 결정적임을 보였다.
- •조기 종료 규칙의 이득은 과제·모델·서빙 조건에 따라 세 체제로 갈린다는 의사결정 절차 제시
- •학습형 종료(LearnStop)는 Qwen3 자유형 수학 4개 설정에서 +3.2~+21.2pp 추가 토큰 절감
- •답이 진동하고 정답 근거가 여러 신호에 분산될 때 학습형이 유리, 첫 체크포인트에서 대부분 풀리면 단일 임계치로 충분
- •동일 정책이 KV 캐시 포킹에선 32% 절감, 블랙박스 반복 프리필에선 121% 추가 비용
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
When Does Learning to Stop Help? A Cost-Aware Study of Early Exits in Reasoning Models
- 1.추론 모델 조기 종료(early-exit) 정책을 18개 과제-모델 세팅에서 동일 위험 기준으로 비교한 통제 연구
- 2.학습형 스토퍼(LearnStop)는 Qwen3 자유형 수학 4종에서 토큰 절감 +3.2~21.2%p 우위
- 3.객관식(MMLU-Pro)은 단순 스칼라 임계값이 우수, AIME-90·GPQA는 공격적 정책 자체가 불가
- 4.같은 정책이 KV캐시 포킹엔 32% 절감, 블랙박스 반복 prefill엔 오히려 121% 추가 비용
왜 중요한가?
기존에 방법마다 제각각이던 early-exit 평가를 '정답 손실 허용치 고정 + 프로브 오버헤드 포함'이라는 배포 관점으로 통일해, 어떤 워크로드에 어떤 중단 규칙을 쓸지 결정 절차를 제시했다. 서빙 인프라(KV캐시 여부)에 따라 절감이 비용으로 뒤집힌다는 실측은 추론 비용 최적화 실무에 직결된다.
언급 프로젝트
본문 미리보기
arXiv:2606.30852v1 Announce Type: new Abstract: Reasoning models spend different amounts of useful computation across instances, but it remains unclear when a learned stopping rule improves over simple confidence or convergence thresholds. We study this question with LearnStop, a hidden-state-free checkpoint stopper for reasoning language models. At fixed budget checkpoints, LearnStop probes a short answer from the current reasoning prefix and predicts prefix correctness from online features su
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

