PARSE(병렬 프리픽스 추측 엔진)는 의미 수준의 병렬 프리픽스 검증을 통해 LLM 추론을 가속하는 추측적 생성 프레임워크이다. 기존 추측적 디코딩은 토큰 수준 동등성으로 수락 길이가 짧지만, PARSE는 단일 전방 패스에서 커스텀 어텐션 마스크를 사용해 여러 프리픽스를 병렬 평가하여 최대 유효 프리픽스를 직접 식별한다. 다양한 모델과 벤치마크에서 목표 모델 대비 1.25×~4.3×, EAGLE-3와 조합 시 1.6×~4.5×의 처리량 향상을 무시할 만한 정확도 저하로 달성했다.
- •기존 추측적 디코딩은 토큰 수준 동등성으로 수락 길이가 짧아 속도 향상이 제한적이다.
- •PARSE는 단일 전방 패스와 커스텀 어텐션 마스크로 여러 프리픽스를 병렬 평가해 최대 유효 프리픽스를 직접 찾는다.
- •PARSE는 토큰 수준 추측적 디코딩과 직교적이며, EAGLE-3와 결합 시 추가 처리량 향상이 가능하다.
- •모델과 벤치마크 전반에 걸쳐 무시할 만한 정확도 저하로 1.25×~4.3×의 처리량 향상을 달성했다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Parallel Prefix Verification for Speculative Generation
- 1.LLM 추론 속도를 향상시키는 병렬 접두사 검증 기반 투기적 생성 프레임워크 PARSE 소개
- 2.단일 순방향 패스로 의미 수준에서 여러 접두사를 동시에 검증하는 코스텀 어텐션 마스크 적용
- 3.EAGLE-3와 결합 시 1.6~4.5배 처리량 향상, 단독으로도 1.25~4.3배 향상
- 4.정확도 저하 없이 기존 토큰 수준 투기적 디코딩에 직교 적용 가능
왜 중요한가?
LLM 추론 비용·지연 시간 감소는 AI 서비스 확장성의 핵심 과제이며, PARSE는 기존 방법과 호환되면서 의미 수준 검증으로 실질적인 속도 향상을 달성한다.
본문 미리보기
arXiv:2605.04263v1 Announce Type: new Abstract: We introduce PARSE (PArallel pRefix Speculative Engine), a speculative generation framework that accelerates large language model (LLM) inference by parallelizing prefix verification on a semantic level. Existing speculative decoding methods are fundamentally limited by token-level equivalence: the target model must verify each token, leading to short acceptance lengths and modest speedups. Moving to semantic or segment-level verification can subs
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

