연구진은 동시 자기회귀 추론에서 새로 들어온 긴 프롬프트의 프리필이 이미 디코딩 중인 요청의 토큰을 지연시키는 간섭 문제를 해결하기 위해 DLFP라는 모델 비의존적 컨트롤러를 제안했다. DLFP는 활성 디코드와 겹치는 프리필 작업만 조정하며, 관찰된 지연 간격을 비례 피드백으로 사용해 다음 프리필 청크 크기를 재조정한다. vLLM에 구현해 A100 80GB GPU 한 대에서 Qwen3-0.6B 모델 기준으로 테스트한 결과 P99 토큰 간 지연시간을 평균 27.7퍼센트 줄였고 출력은 정확히 일치했으며 서비스 수준 목표 준수도 유지됐다. 다만 P99 첫 토큰 생성시간이 34.8퍼센트 늘었고, 더 큰 모델이나 다중 GPU 구성에는 이 메커니즘이 일반화되지 않는 한계도 확인됐다.
- •동시 추론에서 새 프롬프트의 프리필이 디코딩 중인 요청을 지연시키는 간섭 문제를 해결하려 했다
- •DLFP는 관찰된 지연 간격을 비례 피드백으로 사용해 프리필 청크 크기를 동적으로 조정한다
- •Qwen3-0.6B와 A100 GPU 환경에서 P99 토큰 간 지연시간이 평균 27.7퍼센트 줄었다
- •대신 P99 첫 토큰 생성시간은 34.8퍼센트 늘었다
- •더 큰 모델이나 다중 GPU 텐서 병렬 구성에는 이 방식이 일반화되지 않는 한계가 확인됐다
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Decode-Latency Feedback Prefill: A Model-Free Controller and Its Generalization Limits
- 1.DLFP(Decode-Latency Feedback Prefill), 디코딩 지연 기반 모델프리 프리필 제어기 제안
- 2.vLLM에 구현, Qwen3-0.6B·A100 80GB 환경서 P99 토큰간 지연 평균 27.7% 감소
- 3.SLO 준수 유지하며 출력 정확히 일치, 단 P99 첫토큰 지연은 34.8% 증가
- 4.Qwen3-8B·32B, 2-GPU 텐서병렬엔 일반화 실패 — 스케줄러 호출 간격의 한계로 분석
왜 중요한가?
긴 프롬프트의 프리필이 기존 디코딩 요청을 지연시키는 간섭 문제를 수동 튜닝 없이 동적으로 완화하지만, 대형 모델·병렬 환경엔 안 통한다는 한계를 명시해 후속 연구 방향을 제시한다.
본문 미리보기
arXiv:2609.38386v1 Announce Type: new Abstract: Concurrent autoregressive inference creates a fundamental interference problem: prefilling a newly arrived long prompt can delay tokens for requests that are already decoding. Fixed prefill chunks reduce this interference, but the best chunk size depends on the model, hardware, load, and latency objective. We introduce Decode-Latency Feedback Prefill (DLFP), a model-free controller that changes only prefill work that overlaps active decodes. After
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

