배치 처리 방식의 LLM 서빙은 처리량을 높이지만 에너지 회계를 복잡하게 만든다. GPU 전력 텔레메트리는 집계값만 제공하는 반면 지속가능성 보고, 사용료 청구, 워크로드 분석에는 요청 단위 에너지 비용이 필요한데, 기존 벤치마크는 모델·단계·토큰 단위 에너지만 보고해 요청 단위 실측 기준값이 없었다. 연구진은 vLLM에서 요청 부분집합을 재현 가능한 프로토콜로 재실행해 GPU 전력 텔레메트리를 통합하고 각 요청의 정확한 섀플리(Shapley) 에너지를 계산하는 오프라인 하네스와, 저비용 요청 특징으로부터 섀플리 배분을 예측하도록 학습하는 경량 보정모델 'JCalib'으로 구성된 'JouleShare' 프레임워크를 제시했다. 16개 모델·워크로드 조합에서 토큰 비례 배분은 정적 배치에서 평균 정규화 L1 오차 0.440, 연속 배치에서 0.458로 정확한 섀플리 값과 차이를 보였으나, JCalib은 이를 각각 0.116, 0.177로 줄여 온라인에서 불가능한 단독 측정 기준선보다도 낮은 오차를 달성했다.
- •배치 LLM 서빙의 요청 단위 에너지 배분을 위해 오프라인 하네스+경량 보정모델 'JCalib'로 구성된 'JouleShare' 제안
- •vLLM에서 요청 부분집합 재실행으로 각 요청의 정확한 섬플리(Shapley) 에너지를 실측한 기준값 최초 확보
- •토큰 비례 배분은 정적 배치 L1 오차 0.440, 연속 배치 0.458로 실제 섬플리 값과 큰 괴리
- •JCalib은 오차를 정적 배치 0.116, 연속 배치 0.177로 축소, 온라인 불가능한 단독 측정 기준선보다 우수
- •16개 모델·워크로드, 3종 데이터센터 GPU에서 재현되는 결과로 토큰 배분이 한계 에너지의 신뢰할 만한 대리지표가 아님을 입증
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Request-Level Energy Attribution for Batched LLM Serving
본문 미리보기
arXiv:2608.00026v1 Announce Type: new Abstract: Batched LLM serving improves throughput but complicates energy accounting. GPU power telemetry is aggregate, whereas sustainability reporting, chargeback, and workload analysis often require request-level energy charges. Existing inference-energy benchmarks report model-, phase-, or token-level energy, and recent carbon-accounting work motivates Shapley fairness conceptually. Neither provides measured request-level ground truth, so how far the acc
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:11AI 초안

