연구진은 대형 추론 모델(LRM)의 에너지 비용을 줄이면서도 핵심 추론 회로 손상을 막는 '추론 인식 압축' 프레임워크를 제안했다. GSM8K, FOLIO, MATH-500, ProofWriter, MuSiQue 등 5개 추론 벤치마크와 하드웨어 수준 GPU 에너지 측정을 통해 196~224개의 (레이어, 프로젝션) 쌍에 대한 INT4 취약성을 프로파일링한 뒤 가장 민감한 회로만 FP16으로 복원했다. 그 결과 균일 INT4 양자화는 추론 사슬을 늘려 GSM8K에서 25% 전력 절감이 오히려 순 에너지 증가로 이어질 수 있음을 발견했고, 취약성은 과제에 따라 달라 수학 추론에는 어텐션 프로젝션이 특히 중요했다. 선택적 압축을 적용한 R1-Qwen-7B는 ProofWriter에서 FP16 대비 정확도 12%포인트 향상과 9.7% 에너지 절감을 동시에 달성했다.
- •균일 INT4 양자화 대신 취약 추론 회로만 선택적으로 FP16 복원하는 프레임워크 제안
- •5개 추론 벤치마크와 하드웨어 GPU 에너지 측정으로 196~224개 레이어·프로젝션 취약성 분석
- •균일 INT4는 추론 사슬 연장으로 GSM8K에서 전력 절감이 오히려 순 에너지 증가로 반전
- •취약성은 과제 의존적이며 수학 추론에서 어텐션 프로젝션이 특히 중요
- •선택적 압축으로 ProofWriter에서 정확도 +12%p, 에너지 -9.7% 동시 달성
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Reasoning-Aware Compression: Identifying and Protecting Vulnerable Reasoning Circuits for Energy-Efficient LLM Deployment
- 1.대형 추론모델(LRM)의 추론 회로를 보호하는 추론인지형 압축 프레임워크 제안
- 2.GSM8K 등 5개 벤치마크에서 GPU 에너지를 직접 측정해 계층별 INT4 취약성 프로파일링
- 3.균일 INT4 양자화는 추론 사슬을 늘려 GSM8K에서 전력 25% 절감이 오히려 순에너지 증가로 역전
- 4.민감 회로만 선택적으로 FP16 복원한 R1-Qwen-7B는 ProofWriter서 FP16 대비 +12%p, 에너지는 9.7% 절감
왜 중요한가?
균일 양자화가 추론모델의 에너지 효율을 오히려 악화시킬 수 있다는 점을 실측으로 보여, 추론 특화 선택적 압축이 LRM 배포 비용 절감의 실질적 대안이 될 수 있음을 시사한다.
본문 미리보기
arXiv:2609.05512v1 Announce Type: new Abstract: Large Reasoning Models (LRMs) impose substantial energy costs during deployment, yet current compression methods apply uniform quantization across all components, risking damage to critical reasoning circuits. We present a reasoning-aware compression framework that benchmarks quantization conditions across five reasoning benchmarks, GSM8K, FOLIO, MATH-500, ProofWriter, and MuSiQue, with hardware-level GPU energy measurement; profiles per-module IN
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

![[10월8일] “수학 문제 4000개에 AI 투입해 성과”…오픈AI가 보여준 과학연구의 변화](https://cdn.aitimes.com/news/photo/202610/216072_220045_048.png)

