리퀴드AI(LiquidAI)가 LFM2.5 시리즈(230M·350M·1.2B-Instruct·2.6B) 모델의 4비트 양자화 체크포인트를 양자화 인식 증류(QAD) 기법으로 새로 공개했다. 고정밀 교사 모델의 지식을 양자화된 학생 모델에 증류하는 방식으로, 기존 Q4_0 수준의 메모리 사용량과 속도를 유지하면서도 양자화로 손실된 BF16 대비 정확도의 97%를 회복했다. GPQA Diamond, MMLU-Pro, IFEval 등 벤치마크에서 네 모델 모두 각각 BF16 기준 성능의 96.5~97.4%를 유지했으며, 맥북프로·삼성 갤럭시S26울트라 등 실제 엣지 기기에서 기존 대비 최대 33% 높은 디코딩 처리량을 보였다. 해당 GGUF 파일은 허깅페이스에서 즉시 내려받아 llama.cpp 등에서 사용할 수 있다.
- •리퀴드AI, QAD 기법으로 LFM2.5 4종 모델의 새 Q4_0 체크포인트 공개
- •양자화로 손실된 BF16 대비 정확도의 96.5~97.4% 회복
- •맥북프로·삼성 갤럭시S26울트라 등에서 기존 대비 최대 33% 높은 처리량
- •허깅페이스에서 GGUF 파일 즉시 다운로드 가능, llama.cpp 등에서 바로 사용
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
LFM2.5 Q4\_0 Checkpoints from Quantization-Aware Distillation
- 1.LiquidAI, LFM2.5 4개 모델(230M~2.6B)용 QAD 기반 Q4_0 GGUF 체크포인트 공개
- 2.Quantization-Aware Distillation으로 고정밀도 교사 모델을 양자화된 학생 모델로 증류해 품질 손실 복구
- 3.BF16 대비 양자화로 잊었던 정확도의 96.5~97.4%를 QAD로 복원, GPQA·MMLU-Pro·IFEval 등으로 검증
- 4.230M/350M은 Q5_K_M, 1.2B/2.6B는 Q4_K_M과 동등 품질을 더 높은 디코딩 처리량(3~33%)으로 달성
왜 중요한가?
엣지 기기에서 흔히 발생하는 저비트 양자화 품질 저하 문제를, 증류 기반 QAD로 완화해 동일한 메모리·속도로도 더 높은 정확도를 유지할 수 있음을 실측 벤치마크로 보여줘 온디바이스 LLM 배포에 실질적 대안을 제시한다.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:58AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
