멀티버스컴퓨팅이 구조적으로 압축되고 4비트로 양자화된 모델의 성능을 원본 모델 수준 이상으로 회복시키는 기법 '양자화 인지 힐링(QAH)'을 발표했다. 기존의 양자화 인지 학습(QAT)이나 양자화 인지 증류(QAD)와 달리, QAH는 압축 이전의 원본 풀프리시전 모델을 교사로 직접 사용해 KL발산으로 지식을 증류함으로써 회복된 체크포인트의 한계에 갇히지 않는다. GPT-OSS 120B를 60B로 구조 압축한 뒤 MXFP4로 양자화한 모델에 적용한 결과 9개 벤치마크 중 7개에서 자체 bfloat16 버전을 능가했으며, 특히 장문맥 추론(+7.4점)과 수학(+5.6점)에서 큰 향상을 보였다. QAT와의 직접 비교에서도 QAH는 약 100스텝 만에 최고 성능에 도달해 QAT(700스텝)보다 7배 빠르고, 학습을 계속해도 성능이 붕괴하지 않는 안정성을 보였다.
- •QAH, 압축 전 원본 풀프리시전 모델을 교사로 직접 증류해 성능 한계 돌파
- •GPT-OSS 120B→60B 압축·MXFP4 양자화 모델, 9개 벤치마크 중 7개서 bfloat16 원본 능가
- •장문맥 추론 +7.4점, 수학(AIME2025) +5.6점 등 압축 취약 영역서 큰 향상
- •QAT 대비 7배 빠른 수렴(100 vs 700스텝), 장기 학습해도 성능 붕괴 없어
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original
- 1.Multiverse Computing, 4비트 압축모델이 원본을 능가하게 하는 'QAH' 기법 공개
- 2.GPT-OSS 120B→60B 압축 후 MXFP4 양자화 모델이 9개 벤치마크 중 7개서 자체 bfloat16보다 우세
- 3.장문맥 추론 AA-LCR +7.4, AIME25 수학 +5.6 등 압축이 가장 해치는 영역에서 최대 개선
- 4.QAT 대비 7배 빠른 약 100스텝에 최고성능 도달, 이후 성능 드리프트 없이 유지
왜 중요한가?
기존 양자화 인식 학습(QAT)이 정점 이후 성능이 급격히 무너지는 문제를 원본 모델 직접 증류로 해결하면서도, 4비트 모델이 16비트 원본보다 더 정확해지는 역전을 실증했다는 점에서 대규모 모델의 경제적 서빙에 직접적 영향을 준다.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:39AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
