리퀴드AI가 20일 LLM 추론 병목을 줄이는 추측 디코딩 기술 '디스파크'를 공개했다. 약 3억 개 매개변수의 경량 초안 모델이 토큰을 먼저 생성하면 대형 목표 모델이 이를 한 번에 검증하는 방식으로, 출력 품질을 그대로 유지하면서 GPU에서 최대 3.18배, 온디바이스 환경에서 최대 2.87배 디코딩 처리량을 높였다. LFM2.5 계열 3종 모델에 적용됐으며, 여러 도구를 연속 호출하는 에이전트 시나리오(BFCL 벤치마크)에서는 평균 지연시간을 57% 줄이는 효과를 보였다. 리퀴드AI는 관련 모델을 허깅페이스에 공개하고 llama.cpp·SGLang 등과의 통합도 지원해 실제 배포 환경에서 곧바로 활용할 수 있게 했다.
- •초안 모델(약 3억 매개변수)이 후보 토큰 생성, 목표 모델이 한 번의 순방향 연산으로 검증하는 추측 디코딩 방식
- •GPU에서 최대 3.18배, 온디바이스(M4 Max)에서 최대 2.87배 디코딩 속도 향상
- •함수 호출 벤치마크 BFCL에서 다중 도구 사용 시나리오 평균 지연시간 57% 감소
- •LFM2.5-8B-A1B는 MoE 구조 특성상 엣지 기기에서 개선폭이 18%로 상대적으로 작음
- •허깅페이스에 공개, llama.cpp·SGLang 등 오픈소스 프레임워크와 통합 지원
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
리퀴드 AI ‘디스파크’, 메모리 병목 뚫었다…소형 모델이 미리 쓰고 대형 모델이 검증
- 1.리퀴드AI가 추측 디코딩 기반 추론 가속 기술 '디스파크(DSpark)' 공개, GPU서 최대 3.18배·엣지서 최대 2.87배 처리량 향상
- 2.3억개 매개변수 소형 초안모델이 후보 토큰 생성, 대형 목표모델이 한번에 검증해 출력품질 유지
- 3.LFM2.5 1.2B/2.6B/8B-A1B 대상 공개, BFCL 다중도구 시나리오 지연시간 57%↓
- 4.허깅페이스에 세이프텐서·GGUF로 공개, llama.cpp·SGLang 등에 통합 지원
왜 중요한가?
온디바이스·에이전트 AI 확산으로 추론 속도·메모리 대역폭이 핵심 과제가 된 가운데, 추측 디코딩으로 정확도 손실 없이 배포 비용을 낮추는 실용적 해법을 제시했다.
대규모언어모델(LLM)의 실제 활용성을 높이는 데 핵심적인 요소인 추론 속도와 비용 효율성 개선은 국내 AI 기업들에게도 큰 과제입니다. 리퀴드AI의 '디스파크' 기술은 소형 모델과 대형 모델의 협업으로 메모리 병목을 해결하며, 특히 온디바이스 AI 및 AI 에이전트 개발 경쟁이 치열한 한국 시장에서 주목할 만한 돌파구가 될 수 있습니다. 이는 AI 서비스의 상용화와 보급 확산에 기여할 중요한 기술 발전 방향을 제시합니다.
본문 미리보기
대형언어모델(LLM)의 성능 경쟁이 모델 규모와 정확도를 넘어 실제 추론 속도와 비용 효율성을 높이는 방향으로 확대되고 있다. 특히 AI 에이전트와 온디바이스 AI의 활용이 늘면서 매 토큰 생성 과정에서 발생하는 메모리 병목을 줄이는 기술이 주목받는 가운데, 리퀴드AI가 새로운 추론 가속 기술을 선보였다.리퀴드 AI는 20일(현지시간) LLM의 추론 과정에서 발생하는 병목을 줄이기 위한 ‘디스파크(DSpark)’ 추론 기술을 공개했다.약 3억개 매개변수의 경량 모델이 생성한 토큰을 대형 모델이 한꺼번에 검증하는 방식으로, 모델의 출
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

