저비트 양자화가 추론(reasoning) 모델에 '토큰 인플레이션'이라는 숨은 비용을 유발함을 밝힌 연구다. INT4/INT3 사후 양자화 모델은 최종 정답 정확도는 유지해도 더 긴 사고 사슬(CoT)을 생성하는 경향이 있어, 토큰당 속도 향상이 늘어난 토큰 수에 상쇄된다. 수학 추론, 코드 생성, 과학 QA, 에이전트 도구 사용 벤치마크 전반에서 이를 확인했고, 양자화 모델과 풀정밀 모델의 추론 길이를 비교하는 'CoT 토큰 인플레이션 비율' 지표를 제안했다. 토큰 증가는 중간 단계 증가와 의미적 반복 심화를 동반하며 실제 서빙 지연으로 이어진다. 완화책 중 프롬프팅·디코딩 샘플링은 효과가 일관되지 않았고 양자화 인지 학습(QAT)이 가장 유망했다. 양자화 추론 모델 평가 시 정확도와 함께 추론 토큰 사용량을 보고해야 한다는 실무적 교훈을 준다.
- •INT4/INT3 양자화는 정확도를 유지해도 추론 토큰 사용량을 늘려 토큰당 속도 이득을 상쇄
- •수학·코드·과학 QA·에이전트 도구 사용 벤치마크 전반에서 확인
- •양자화-풀정밀 추론 길이를 비교하는 'CoT 토큰 인플레이션 비율' 지표 제안
- •토큰 증가는 중간 단계 증가·의미적 반복 심화를 동반하며 실제 서빙 지연으로 이어짐
- •완화책 중 양자화 인지 학습(QAT)이 정확도 손실과 토큰 인플레이션 모두에 가장 유망
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Quantization Inflates Reasoning: Token Inflation as a Hidden Cost of Low-Bit Reasoning Models
- 1.저비트 PTQ(INT4/INT3)가 정확도는 유지하나 추론 토큰 사용량을 늘려 속도 이득 상쇄
- 2.이 효과 측정을 위해 CoT Token Inflation Ratio 지표 도입
- 3.토큰 인플레이션은 중간 단계 증가·의미 반복 등 추론 행동 변화를 동반
- 4.프롬프티·디코딩은 효과 불안정, 양자화 인식 학습(QAT)이 더 유망
왜 중요한가?
양자화 평가에서 정확도만 보면 실제 서빙 비용을 놓친다는 점을 드러내, 추론 모델 배포 시 정확도와 함께 추론 토큰 사용량도 보고해야 함을 시사한다.
본문 미리보기
arXiv:2606.25519v1 Announce Type: new Abstract: Quantization is widely used to reduce the inference cost of large language models, but its effect on reasoning models is not fully captured by final-answer accuracy or per-token latency. We show that low-bit post-training quantization can introduce a hidden test-time compute cost: quantized reasoning models often generate longer chains of thought even when they still answer correctly. Across mathematical reasoning, code generation, scientific ques
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

