vLLM의 transformers 모델링 백엔드가 이제 다수 LLM 아키텍처에서 vLLM 자체 구현과 같거나 더 빠른 속도를 낸다고 Hugging Face가 발표했다. torch.fx로 모델 그래프를 정적 분석하고 AST로 소스 코드를 재작성해 MoE 전문가 병렬화용 커널, MergedColumnParallelLinear, QKVParallelLinear 같은 융합 연산을 런타임에 자동 적용하는 방식이다. Qwen3 4B(단일 GPU), 32B(텐서 병렬), 235B FP8 MoE(8×H100 데이터+전문가 병렬) 모두에서 네이티브 구현 처리량을 따라잡거나 능가했으며, --model-impl transformers 플래그 하나로 사용할 수 있다. 모델 제작자가 vLLM용 커스텀 포팅 없이 transformers 구현만으로 최고 속도 추론을 얻고, 같은 코드를 학습·평가·RL 롤아웃에도 쓸 수 있게 됐다는 점이 핵심이다.
- •torch.fx 정적 분석 + AST 코드 재작성으로 추론 특화 레이어 융합을 런타임에 자동 적용
- •Qwen3 4B·32B·235B FP8 MoE 세 구성 모두에서 vLLM 네이티브 구현 처리량을 동등 또는 초과
- •--model-impl transformers 플래그 하나로 사용, TP/DP/EP 등 기존 병렬화 옵션과 호환
- •torch.compile·CUDA Graphs 호환을 유지하며 동일 모델 코드를 학습·평가·RL 롤아웃에도 사용 가능
- •선형 어텐션 기반 모델은 아직 미지원(추후 지원 예정)
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Native-speed vLLM transformers modeling backend
- 1.vLLM의 transformers 백엔드가 다수 LLM에서 커스텀 네이티브 구현과 동속 이상 달성
- 2.Qwen3 4B·32B·235B FP8 MoE 3종 벤치마크에서 네이티브 처리량 동등 이상 확인
- 3.torch.fx 정적 분석+AST 소스 재작성으로 vLLM 융합 커널·병렬 플럜을 런타임 적용
- 4.--model-impl transformers 플래그 하나로 사용, 학습·평가·RL 롤아웃과 코드 공유
왜 중요한가?
모델 제작자가 vLLM용 커스텀 포팅 없이 transformers 구현만으로 네이티브급 추론 속도를 얻게 돼, 신규 모델의 서빙 지원 격차와 이중 구현 부담이 사라진다.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 01:53AI 초안

