이기종 엣지 기기에 LLM을 배포할 때 어떤 모델을 고를지 정하기 위한 런타임 인지형 지연 예측 프레임워크다. 각 추론 요청을 하드웨어-런타임-모델-프롬프트 구성으로 표현하고 prefill과 decode 단계를 분리한 뒤, 정적 서술자와 실시간 하드웨어 텔레메트리를 게이트 방식으로 융합해 예측한다. Pixel 8에서 전체 지연 R²가 0.953에서 0.960으로, decode 지연은 0.957에서 0.973으로 개선됐고, Pixel 8 Pro의 prefill 지연 R²는 -1.383에서 0.966으로 크게 올랐다. 소량 보정만으로 기기 간 전이도 가능해 Pixel 8 Pro→Pixel 8 전체 지연 R²가 -0.974에서 0.940이 됐다. 같은 SmolLM2가 Orange Pi 5 Pro에서 8.42 tokens/s, RTX 3090급에서 64.38 tokens/s를 내는 등 지연이 기기·런타임에 크게 좌우됨을 보였다.
- •추론 요청을 하드웨어-런타임-모델-프롬프트 구성으로 표현하고 prefill과 decode를 분리해 예측한다.
- •정적 서술자와 DVFS·발열 등 동적 텔레메트리를 게이트 모델로 적응적 융합하는 것이 핵심 기법이다.
- •Pixel 8 전체 지연 R² 0.953→0.960, decode 0.957→0.973, Pixel 8 Pro prefill R² -1.383→0.966으로 개선됐다.
- •기기 간 전이 시 보정만으로 Pixel 8 Pro→Pixel 8 전체 지연 R²가 -0.974에서 0.940으로 회복됐다.
- •동일 SmolLM2 계열이 Orange Pi 5 Pro에서 8.42 tokens/s, RTX 3090급에서 64.38 tokens/s로 기기별 편차가 컸다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Transferable Latency Prediction for Fast LLM Screening on Heterogeneous Edge Devices
본문 미리보기
arXiv:2607.21602v1 Announce Type: new Abstract: Accurate latency prediction is critical for deploying large language models (LLMs) on heterogeneous edge devices, where inference latency is affected by model architecture, prompt behavior, runtime backend, hardware utilization, dynamic voltage and frequency scaling (DVFS), and thermal variation. This paper presents a runtime-aware latency prediction framework for deployment-oriented LLM selection. The framework represents each inference request a
전체 내용이 궁금하다면?
원문을 직접 읽어보세요