스페인 AI 기업 멀티버스컴퓨팅이 4비트로 양자화한 압축 모델이 원본 모델의 전체 정밀도(bfloat16) 버전보다 더 높은 성능을 내는 기법 '양자화 인지 힐링(QAH)'을 8월 25일 공개했다. OpenAI의 GPT-OSS 120B를 60B 파라미터로 압축한 뒤 MXFP4로 양자화하는 데 이 기법을 적용했으며, 압축·양자화된 4비트 모델이 원본 전체 정밀도 체크포인트를 능가하는 결과를 보였다. 이는 모델을 작게 만들면 성능이 떨어진다는 기존의 통념을 뒤집는 결과로 평가된다.
- •멀티버스컴퓨팅, 4비트 압축 모델이 풀프리시전 원본을 능가하는 'QAH' 기법 공개
- •GPT-OSS 120B를 60B로 구조 압축 후 MXFP4 양자화에 적용
- •압축+양자화에도 성능이 오히려 향상돼 기존 통념 뒤집어
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Multiverse Computing’s 4-Bit Healing Beats Full-Precision Model

- 1.멀티버스 컴퓨팅, 파라미터 절반압축+4비트 양자화 모델이 풀프리시전 원본보다 점수 높은 기법 'QAH' 공개
- 2.Quantization-Aware Healing(QAH)을 오픈AI GPT-OSS 120B에 적용, 60B로 압축 후 MXFP4로 양자화
- 3.압축·양자화는 곧 성능저하라는 통념을 뒤집는 결과, 블로그 글과 별도 논문으로 기법 상세 공개
왜 중요한가?
모델 압축은 보통 정확도를 희생하는 트레이드오프인데, QAH는 4비트 양자화 모델이 원본보다 성능이 높다고 주장해 사실이라면 추론비용 절감과 성능 유지를 동시에 노리는 배포전략에 영향을 줄 수 있다.
본문 미리보기
Multiverse Computing published a technique on August 25, 2026 that inverts one of the most reliable tradeoffs in model deployment: a large language model compressed to half its parameters and quantized to 4 bits that scores higher than the full-precision checkpoint it was built from. The method, called Quantization-Aware Healing (QAH), is detailed in a company blog post and a companion paper, and was applied to OpenAI's GPT-OSS 120B compressed down to 60B parameters and quantized to MXFP4. The…
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:53AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
