강화학습 후처리 훈련이 최신 언어모델 개발을 주도하고 있지만 GPU 하드웨어에서의 전력 거동은 특성화되지 않았고, 데이터센터는 작업 내용을 모르는 정적 상한과 반응적 스로틀링으로 전력을 관리해 하드웨어 속도를 무차별적으로 늦춘다. 연구진은 A100 GPU 1~4개에서 7B, 14B, 72B 규모의 GRPO 훈련을 0.5초 단위 전력 텔레메트리로 38만 건 이상 계측하고, 측정된 전력에 맞춰 생성 파라미터를 조정하는 PPO 메타 컨트롤러를 학습시켰다. 7B 모델 전체 트레이스에서 컨트롤러는 전력 상한 위반을 89.8% 줄이면서 토큰 출력을 18.1%, 에너지 효율을 26.2% 높였다. 72B 실전 배포에서는 원래 액추에이터가 모델 샤딩 하에서 권한을 잃는 문제가 발견돼, 생성 동시성을 액추에이터로 삼아 17~22%의 전력 권한을 유지하는 방식으로 재구성했고, 정적 안전 기준선 대비 35.7% 많은 출력과 87.2% 적은 위반을 3회 반복 실험에서 달성했다.
- •A100 1~4대에서 7B/14B/72B 규모 GRPO 훈련의 전력을 38만 건 이상 계측해 PPO 메타 컨트롤러 학습
- •7B 모델에서 전력 위반 89.8% 감소, 토큰 출력 18.1%·에너지 효율 26.2% 동시 향상
- •72B 실전 배포에서 액추에이터를 생성 동시성으로 재구성, 정적 기준선 대비 35.7% 많은 출력·87.2% 적은 위반
- •측정 창을 30초~5분으로 넓히면 전력 급변 비율이 23.6%에서 거의 0%로 감소, 약 2배 오버서브스크립션 가능성 시사
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Cutting AI Datacenter Energy with Reinforcement Learning: Measured Power Control of LLM Training from One GPU to the Fleet
본문 미리보기
arXiv:2608.11226v1 Announce Type: new Abstract: Reinforcement-learning post-training dominates modern language-model development, yet its power behavior on GPU hardware has not been characterized, and datacenters manage GPU power with workload-blind mechanisms, static caps and reactive throttling, that slow hardware indiscriminately. We instrument GRPO training with half-second power telemetry at 7B, 14B, and 72B scales on one to four A100s (380,000+ samples), and train a PPO meta-controller th
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:21AI 초안

