이 연구는 4B 파라미터 instruction-tuned 모델 Qwen을 KOTMS 회전, E2M-ATQ 삼진화(ternarization), TWLA 기반 GPTQ 스타일 오차 보정을 결합해 사후 학습으로 초저비트 변환하는 방법을 제시한다. 활성화값은 16비트로 유지한 채 가중치만 압축했으며, 최종적으로 양자화 선형 가중치의 81.62%에 대해 파라미터당 유효 1.641비트를 달성했다. 10개 능력 평가 항목의 평균 정확도는 64.5%에서 54.7%로 하락했고, BoolQ는 84.6%의 성능을 유지한 반면 ARC-Challenge는 43.8%까지 떨어지는 등 과제별 편차가 컸다. 후속 패킹 작업으로 모델 크기를 8.29GiB에서 3.96GiB로 줄이면서도 퍼플렉시티는 거의 유지했지만, Triton GEMV 마이크로벤치마크에서는 FP16 cuBLAS보다 4.6배 느려 압축만으로는 추론 속도 향상이 보장되지 않음을 보여준다.
- •Qwen3-4B를 KOTMS 회전·E2M-ATQ 삼진화·TWLA 오차보정으로 사후 학습 초저비트(1.641비트) 변환했다.
- •10개 능력 평가 평균 정확도가 64.5%→54.7%로 하락했으며 과제별 편차가 캻다(BoolQ 84.6% vs ARC-Challenge 43.8%).
- •패킹을 통해 모델 크기를 8.29GiB에서 3.96GiB로 줄이면서도 퍼플렉시티는 거의 유지했다.
- •Triton GEMV 벤치마크에서 FP16 cuBLAS보다 4.6배 느려 압축이 곳 추론 속도 향상을 의미하지는 않는다.
- •1.58비트라는 명목상 라벨이 실제 저장 표현·성능·런타임 동작을 온전히 설명하지 못함을 시사한다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Post-Training Ternarization of Qwen3-4B Capability, Effective Bit Budget, Storage Compression, and Deployment
- 1.Qwen3-4B를 KOTMS 회전·E2M-ATQ 삼진화·TWLA 오차보정으로 후처리 양자화
- 2.가중치당 실효 1.641비트로 압축, 정확도는 64.5%→54.7%로 하락
- 3.체크포인트 8.29GiB→3.96GiB 축소했지만 Triton GEMV는 FP16보다 4.6배 느림
- 4.BoolQ는 84.6% 성능 유지되나 ARC-Challenge는 43.8%로 과제별 열화 편차 큼
왜 중요한가?
'1.58비트' 같은 표기가 실제 저장·성능·런타임을 온전히 설명하지 못한다는 것을 실측으로 보여줘, 초저비트 양자화 도입 시 압축률만으로 속도 향상을 기대해선 안 된다는 경고를 준다.
언급 프로젝트
본문 미리보기
arXiv:2609.01962v1 Announce Type: new Abstract: Ultra-low-bit language models can reduce storage and memory bandwidth, but a nominal "1.58-bit" label does not fully describe the stored representation, retained capability, or runtime behavior. We study an end-to-end post-training conversion of Qwen, an instruction-tuned 4B-parameter model, using KOTMS rotation, E2M-ATQ ternarization, and GPTQ-style error compensation from TWLA. The experiment is weight-only: activations remain at 16-bit precis
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
