리퀴드AI가 LFM2.5 계열 3개 모델(1.2B-Instruct, 2.6B, 8B-A1B)에 투기적 디코딩 드래프트 모델 'DSpark' 체크포인트를 공개하며 출력 품질 변화 없이 GPU에서 최대 3.18배, 온디바이스에서 최대 2.87배 추론 속도를 높였다고 밝혔다. DSpark는 DFlash 스타일의 병렬 백본, 인접 토큰 간 의존성을 모델링하는 경량 순차(마르코프) 헤드, 저신뢰 구간을 잘라내는 신뢰도 기반 검증기 3요소를 결합한 기법으로, 각 드래프트 모델은 약 3억개 매개변수 규모로 5개 층·블록 크기 9의 어텐션 전용 구조를 채택했다. LFM2.5-2.6B는 H100에서 평균 2.67배, M4 맥스에서 2.27배 빨라졌고 멀티툴 시나리오의 함수 호출 지연시간을 평균 57% 줄였으며, LFM2.5-8B-A1B는 llama.cpp의 MoE 구현 한계로 온디바이스 개선폭이 평균 18%에 그쳤다. 세 드래프트 모델 모두 세이프텐서·GGUF 형식으로 허깅페이스에 공개돼 llama.cpp와 SGLang에서 곧바로 사용할 수 있다.
- •LFM2.5-DSpark, GPU 최대 3.18배·온디바이스 최대 2.87배 추론 속도 향상, 출력 품질은 그리디 디코딩과 동일
- •병렬 백본+경량 마르코프 헤드+신뢰도 기반 검증기 3요소 결합, 드래프트 모델은 약 3억개 매개변수
- •LFM2.5-2.6B 멀티툴 함수 호출 지연시간 평균 57% 감소
- •LFM2.5-8B-A1B는 llama.cpp MoE 구현 한계로 온디바이스 개선폭 평균 18%에 그침
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Up to 3.2x Faster Inference with LFM2.5-DSpark
- 1.리퀴이드AI가 LFM2.5 3종(1.2B-Instruct, 2.6B, 8B-A1B)용 DSpark 드래프모델 체크포인트 공개
- 2.H100 GPU에서 최대 3.18배, 온디바이스(M4 Max)에서 최대 2.87배 추론 속도 향상, 출력 품질은 그리디 디코딩과 동일
- 3.LFM2.5-2.6B 기준 함수호출 지연시간 평균 57% 단축, 온디바이스 에이전트 추론에 최적화
- 4.llama.cpp·SGLang에 데이원 지원, DFlash 병렬백본·마르코프 헤드·신뢰도 기반 검증기 3요소 결합
왜 중요한가?
드래프트 모델과 검증기를 결합한 투기적 디코딩으로 출력 품질 저하 없이 온디바이스 에이전트 지연시간을 크게 줄여, 클라우드 의존 없는 로컬 에이전틱 추론의 실용성을 높인다.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:39AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
