LLM 추론 비용에서 프롬프트 프리필(병렬·연산 집약)과 자기회귀 디코드(순차적·메모리 대역폭 집약)의 부담 특성이 다르다는 점에 착안해, 저자들은 '듀얼플로우 트랜스포머(Dual-Flow Transformer)'를 제안한다. 주 흐름은 프롬프트를 처리하고 KV 캐시를 기록하는 완전한 인과적 언어모델이며, 보조 흐름은 프롬프트 처리 시엔 비활성화되고 마지막 프롬프트 위치 이후부터만 작동해 지속 상태 기록이나 주 흐름에 영향 없이 연속 예측 연산만 추가한다. 두 흐름은 주요 어텐션·MLP·출력 행렬을 공유하되 토큰 임베딩은 별도로 둔다. 토큰 수를 맞춘 비교에서 다양한 아키텍처·데이터 구성 전반에 걸쳐 검증 손실이 낮아졌으며, MoE 모델에서는 프리필과 디코드의 전문가 배분을 독립적으로 제어할 수 있음을 보였다.
- •프리필(연산 집약)과 디코드(메모리 대역폭 집약) 비용 특성 차이에 착안해 Dual-Flow Transformer 제안
- •주 흐름은 프롬프트 처리·KV 캐시 기록, 보조 흐름은 프롬프트 이후부터만 연속 예측 수행
- •두 흐름이 어텐션·MLP·출력 행렬을 공유해 가중치·캐시 재사용 가능
- •토큰 수 일치 비교에서 다양한 구성 전반에 걸쳐 검증 손실 개선
- •MoE 모델에서 프리필·디코드별 전문가 배분을 독립 제어 가능함을 입증
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Dual-Flow Transformers: Decoupling the Primary Prefill Path from Additional Decode Computation
- 1.prefill과 decode를 분리한 Dual-Flow Transformer 제안, 단일 지속 KV캐시 유지
- 2.보조 플로우는 프롬프트 처리 중 비활성, 마지막 프롬프트 위치부터 활성화돼 영속상태 기록 없이 연산 추가
- 3.주요 어텐션·MLP·출력 행렬 공유, 토큰임베딩만 분리, 다양한 아키텍처·데이터서 검증손실 개선
- 4.MoE 모델서 주·보조 전문가 배분 독립제어, prefill·decode 비용과 예측품질 트레이드오프 실험
왜 중요한가?
기존 폭·깊이 확장은 prefill과 decode 비용을 동시에 늘렸지만, 이 구조는 연산량을 decode 전용으로 선택적으로 배분할 수 있어 추론 비용이 급증하는 LLM 서빙 환경에서 비용 대비 성능을 조절할 새로운 레버를 제공한다.
언급 프로젝트
본문 미리보기
arXiv:2608.12385v1 Announce Type: new Abstract: As large language models serve more requests, cumulative inference cost is becoming increasingly important relative to one-time training cost. The two inference phases stress hardware differently: prompt prefill is parallel and typically compute-bound, whereas autoregressive decode is sequential and often memory-bandwidth-bound. Conventional width or depth scaling increases both costs together because every added layer is evaluated in both phases.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:21AI 초안

