이 논문은 로컬 배포되는 LLM의 에너지 비용이 대부분 정확도 위주 벤치마크에 가려 제대로 파악되지 않았다는 문제의식에서, 소비자용 GPU(RTX 4060Ti 16GB) 한 대로 1B~7B 파라미터의 오픈소스 LLM 9종을 대상으로 재현 가능한 하드웨어 수준 에너지 벤치마크를 제시한다. Ollama 추론 엔진을 사용해 nvidia-smi로 GPU 전력 소모를 2Hz로 샘플링하고, 고정된 프롬프트 세트에서 평균/최대 전력, 프롬프트당 총 에너지(J/prompt), 출력 토큰당 에너지(J/token), 처리량(tok/s)을 측정했다. 그 결과 에너지 효율은 단순 파라미터 수보다 모델 아키텍처와 양자화 전략에 더 크게 좌우되는 것으로 나타났다. gemma3:1b와 llama3.2:1b가 각각 0.56 J/token, 0.65 J/token으로 가장 낮은 에너지 비용과 초당 170토큰 이상의 최고 처리량을 기록한 반면, 7B 규모의 Mistral 모델은 가장 효율적인 모델보다 토큰당 최대 4.4배의 에너지를 소모했다. 특히 qwen3.5:2b는 내부 추론 과정이 길어지면서 프롬프트당 에너지가 이례적으로 높게 나타나, 효율성 지표에서 토큰 생성 모드를 구분해야 할 필요성을 보여줬다.
- •소비자용 GPU 1대(RTX 4060Ti 16GB)로 1B~7B급 오픈소스 LLM 9종 하드웨어 수준 에너지 벤치마크 수행
- •Ollama + nvidia-smi로 2Hz 전력 샘플링, J/prompt·J/token·처리량(tok/s) 측정
- •에너지 효율은 파라미터 수보다 모델 아키텍처·양자화 전략에 더 좌우됨
- •gemma3:1b·llama3.2:1b가 각각 0.56·0.65 J/token으로 최저 에너지·최고 처리량(170+ tok/s)
- •7B Mistral은 최고 효율 모델 대비 토큰당 최대 4.4배 에너지 소모, qwen3.5:2b는 긴 추론으로 프롬프트당 에너지 이례적 급증
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Energy Efficiency of Locally Deployed LLMs: A Preliminary Quantitative GPU Power Benchmark on Consumer Hardware
본문 미리보기
arXiv:2608.00008v1 Announce Type: new Abstract: The local deployment of large language models (LLMs) is gaining traction due to privacy concerns and the desire for on-premise inference. However, the energy costs on consumer hardware remain poorly characterized, as most benchmarks focus solely on accuracy. This paper presents a reproducible, hardware-level energy benchmark of nine open-source LLMs (1B to 7B parameters) executed on a single consumer GPU (RTX 4060Ti 16GB). Using the Ollama inferen
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:11AI 초안

