리퀴드AI가 LFM2.5 모델군 3종에 투기적 디코딩(speculative decoding) 드래프트 체크포인트 'DSpark'를 공개하며 출력 품질 저하 없이 단일 H100 GPU에서 최대 3.18배, 애플 실리콘 맥북에서 최대 2.87배 추론 속도를 높였다고 밝혔다. DSpark는 딥시크(DeepSeek) 연구진이 2026년 7월 논문으로 제안하고 DeepSeek-V4에 적용한 기법을 기반으로, 병렬 백본과 경량 순차 헤드, 신뢰도 기반 검증기를 결합해 드래프트 토큰을 제안하고 타깃 모델이 이를 한 번의 순전파로 검증하는 방식이다. LFM2.5-2.6B는 H100에서 평균 2.67배, M4 맥스에서 2.27배 빨라졌고 멀티툴 시나리오에서 함수 호출 지연시간을 평균 57% 줄였으며, 가장 큰 폭의 개선은 LFM2.5-8B-A1B가 MATH500 벤치마크 H100에서 기록한 3.18배였다. 세 모델의 체크포인트는 세이프텐서·GGUF 형식으로 허깅페이스에 공개돼 llama.cpp와 SGLang에서 즉시 사용할 수 있다.
- •LFM2.5-DSpark, H100 GPU 최대 3.18배·맥북(M4 Max) 최대 2.87배 추론 속도 향상, 출력 품질 동일 유지
- •DeepSeek 2026년 7월 논문의 DSpark 기법(병렬 백본+경량 순차헤드+신뢰도 검증기) 채택
- •LFM2.5-2.6B, 멀티툴 시나리오 함수 호출 지연시간 평균 57% 감소
- •체크포인트 3종 모두 허깅페이스 공개, llama.cpp·SGLang에서 day-one 지원
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Liquid AI Ships LFM2.5-DSpark for Up to 3.2X Faster Inference

- 1.Liquid AI가 LFM2.5 3개 모델용 추론가속 드래프트 체크포인트 'DSpark'를 8월20일 공개, 출력 결과는 동일하게 유지
- 2.H100 GPU에서 최대 3.18배, 애플실리콘 맥북에서 최대 2.87배 처리속도 향상, 함수호출 지연은 평균 57% 감소
- 3.DSpark는 2026년 7월 DeepSeek 논문 기법을 적용, 병렬 백본·경량 순차 헤드·신뢰도 기반 검증기 3요소로 구성
- 4.체크포인트는 Safetensors·GGUF 형식으로 llama.cpp·SGLang에 당일 지원, Hugging Face에서 즉시 다운로드 가능
왜 중요한가?
추측적 디코딩 기법을 온디바이스 모델에 적용해 클라우드 모델 수준의 응답성을 로컬 하드웨어에서 구현할 수 있음을 보여주며, 정확도 손실 없는 추론 가속이 에이전트형 온디바이스 AI 확산의 핵심 변수가 되고 있음을 시사한다.
본문 미리보기
Liquid AI released speculative-decoding draft checkpoints for three models in its LFM2.5 family on August 20, 2026, reporting throughput gains of up to 3.18x on a single H100 GPU and up to 2.87x on an Apple-silicon MacBook, with no change to model outputs. The LFM2.5-DSpark release covers drafters for LFM2.5-1.2B-Instruct, LFM2.5-2.6B, and the mixture-of-experts LFM2.5-8B-A1B, each adding roughly 300 million parameters of draft overhead on top of the target model. The checkpoints ship in…
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:53AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
