이 연구는 투기적 확산 디코딩(SDD)에서 대상 모델이 매 블록마다 호출되는 검증 병목을 줄이기 위해, 선택된 드래프트 접두어를 검증 없이 그대로 채택하는 '검증자 스킵' 정책을 연구했다. 흥미롭게도 더 나은 토큰 예측기가 반드시 더 나은 스킵 스케줄러가 되는 것은 아니며, 스킵에는 연속된 고신뢰 접두어가 필요한 반면 짧은 스킵은 오히려 추가 드래프팅 라운드를 유발할 수 있음을 발견했다. HumanEval에서 DiffuCoder-7B-Instruct와 Qwen3-32B로 실험한 결과, 원시 신뢰도·학습된 주변/조건부 생존 점수 세 가지 신호 모두 동일한 pass@1 수준에서 검증자 호출을 9.6~13.5% 절감했으며, 놀랍게도 가장 단순한 원시 신뢰도가 가장 큰 절감 효과를 보였다. 이는 검증자 스킵의 핵심 난제가 토큰 예측 자체보다 접두어 스케줄링에 있음을 시사한다.
- •검증자를 건너뛰고 드래프트 접두어를 바로 채택하는 '검증자 스킵' 정책 제안
- •더 좋은 토큰 예측기가 반드시 더 좋은 스케줄러는 아니라는 점 발견
- •HumanEval에서 세 신뢰도 신호 모두 동일 pass@1에서 검증자 호출 9.6~13.5% 절감
- •원시 신뢰도가 학습된 생존 점수보다 오히려 더 큰 절감 효과
- •핵심 난제는 토큰 예측이 아니라 접두어 스케줄링임을 입증
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
From Positionwise Confidence to Prefix Scheduling: Verifier Skipping in Speculative Decoding
- 1.추측확산디코딩(SDD)에서 검증기 호출 자체를 건너뜻는 '검증기 스킹' 정책을 새 손실 축으로 제안
- 2.HumanEval, DiffuCoder-7B·Qwen3-32B 조합에서 검증기 호출 9.6~13.5% 절감 달성
- 3.정교한 학습 기반 신뢰도보다 단순 원시 신뢰도(raw confidence)가 오히려 더 큰 절감 효과 보임
왜 중요한가?
추측 디코딩의 남은 병목이던 검증 단계 자체를 줄이는 새 최적화 축을 제시했으며, 더 나은 토큰 예측기가 반드시 더 나은 스케줄러는 아니라는 반직관적 발견은 후속 추론 가속 연구에 시사점을 준다.
본문 미리보기
arXiv:2608.14787v1 Announce Type: new Abstract: Speculative decoding is a leading technique to reduce the cost of autoregressive generation by using a small drafter to propose several tokens, which are then verified in parallel by a larger target model. Speculative diffusion decoding (SDD) further removes sequential drafting by generating every position in a draft block in parallel with a discrete diffusion model. However, SDD still invokes the target on every block, leaving verification as a p
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:02AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
