SonicSampler는 LLM 추론의 샘플링 파이프라인 전체를 하나의 배치 커널로 수직 융합한 타일 인지(tile-aware) Triton 커널 모음이다. 문법 제약 디코딩, 반복·빈도·존재 페널티, logit bias, 온도 스케일링, top-k/top-p/min-p 필터링, 투기적 디코딩 검증까지 요청별로 다른 샘플링 동작을 단일 커널에서 지원하면서 CUDA Graph 호환성을 유지한다. 핵심인 계층적 2단계 top-k 알고리즘은 LLM 출력의 저엔트로피 구조를 활용해 기존 대비 최대 10배, 이종 투기적 디코딩 워크로드 전반에서는 최대 16배 속도 향상을 달성했다. 동적 서빙 환경에서 샘플링 단계가 병목이 되던 문제를 해소해 LLM 서빙 효율을 크게 높일 수 있는 시스템 기여다.
- •로짓 처리·토큰 선택·투기적 검증까지 샘플링 파이프라인 전체를 단일 Triton 커널로 수직 융합
- •요청별 이질적 샘플링 설정(문법 제약, 페널티, top-k/p, min-p 등)을 지원하며 CUDA Graph 호환
- •계층적 2단계 top-k 알고리즘이 LLM 출력의 저엔트로피 구조를 활용해 최대 10배 가속
- •이종 투기적 디코딩 워크로드에서 SOTA 대비 최대 16배 속도 향상
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
SonicSampler: Unified Tile-Aware Kernels for LLM Sampling and Speculative Verification
- 1.SonicSampler 공개: LLM 샘플링 파이프라인 전체를 단일 Triton 커널로 수직 융합
- 2.계층적 2단계 top-k 알고리즘으로 기존 대비 최대 10배, 투기적 디코딩 워크로드서 최대 16배 가속
- 3.문법 제약 디코딩·반복 패널티·top-k/p/min-p 등 요청별 동적 샘플링을 하나의 배치 커널로 지원
- 4.CUDA Graph 완전 호환으로 동적 서빙 워크로드에서도 효율적 실행 가능
왜 중요한가?
기존 샘플링 구현은 파이프라인 일부만 가속하거나 배치 내 동일 샘플링을 가정해 실서비스의 요청별 이질적 설정을 감당하지 못했는데, 이를 단일 커널로 해결해 LLM 서빙 인프라의 추론 비용 절감에 직결되는 개선이다.
언급 프로젝트
LLM 추론 과정의 효율성을 극대화하는 SonicSampler 연구는 국내 AI 서비스 비용 절감 및 실시간 응답 성능 향상에 핵심적인 기술입니다. 이는 LLM의 광범위한 상용화를 촉진하고 국내 기업들이 글로벌 경쟁력을 확보하는 데 중요한 역할을 할 것으로 보입니다.
본문 미리보기
arXiv:2607.20475v1 Announce Type: new Abstract: Sampling in LLM inference comprises a combinatorial set of logit processing, token selection, and verification operations for speculative decoding. However, existing implementations either accelerate only subsets of this pipeline, rely on multiple kernel launches, or assume homogeneous sampling behavior across a batch, limiting support for dynamic serving workloads and preventing efficient CUDA Graph execution. We present $\textbf{SonicSampler}$,
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

