연구진은 마스크 확산 언어모델(dLLM)이 실제 동시 서빙 부하에서 어떻게 동작하는지 체계적으로 측정했다. LLaDA-8B-Instruct에 D2F LoRA 어댑터를 적용해 H200 GPU 한 대에서 GSM8K·HumanEval로 평가한 결과, 요청 난이도(디노이징 스텝 수)는 연속적이 아니라 11개의 고정 단계로 이산화되어 있었고 생성 전 이를 예측할 신호는 없었다(R²=0.150). 단일 요청 처리 시간의 24%만 GPU 연산이고 나머지는 CPU 디스패치 오버헤드였으며, 배치 크기 16에서 디노이징 스텝별 순전파를 공유해 처리량을 16배 향상시켰다. 이는 dLLM 서빙이 자기회귀 모델과 달리 디노이징 스텝 단위의 병렬 처리를 필요로 함을 보여준다.
- •요청 난이도는 11개의 고정된 디노이징 스텝 레벨로 이산화됨
- •생성 전 난이도를 예측하는 신호를 찾지 못함(최고 R²=0.150)
- •단일 요청 처리시간의 76%가 GPU 아닌 CPU 디스패치 오버헤드
- •배치 크기 16에서 스텝별 순전파 공유로 처리량 16배 향상
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Serving Masked Diffusion LLMs: Characterization and Design Principles from Real Hardware
- 1.확산언어모델(dLLM) 실제 동시 서빙 환경 특성을 최초로 체계적 측정, LLaDA-8B에 D2F LoRA 적용해 실험
- 2.요청 난이도(디노이징 스텝 수)는 연속적이지 않고 11단계로 이산적 분포, 생성 전 예측 불가(R²=0.150)
- 3.단일요청 처리시간 중 GPU 연산은 24%에 불과, 나머지는 CPU측 디스패치 오버헤드
- 4.배치크기 16에서 처리량 16배 향상, 포아송 도착 가정하 배치-타임아웃 규칙도 도출
왜 중요한가?
자기회귀(AR) 모델 서빙 인프라의 가정을 그대로 확산모델에 적용하면 안 된다는 실증 근거를 제시해, dLLM 상용 서빙 시스템 설계 방향을 CPU 오버헤드 최적화와 스텝단위 병렬화로 재조정해야 함을 시사한다.
언급 프로젝트
본문 미리보기
arXiv:2608.23807v1 Announce Type: new Abstract: Masked diffusion language models (dLLMs) can in principle generate text faster than autoregressive (AR) models, since they denoise many tokens at once. Recent systems have begun building serving infrastructure for dLLMs, but none first measure how these models behave under real, concurrent serving load. Serving systems built without this grounding risk carrying over assumptions from AR serving that may not hold for dLLMs. We characterize dLLM serv
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
