이기종 엣지 기기에 LLM을 배포할 때 어떤 모델을 고를지 정하기 위한 런타임 인지형 지연 예측 프레임워크다. 각 추론 요청을 하드웨어-런타임-모델-프롬프트 구성으로 표현하고 prefill과 decode 단계를 분리한 뒤, 정적 서술자와 실시간 하드웨어 텔레메트리를 게이트 방식으로 융합해 예측한다. Pixel 8에서 전체 지연 R²가 0.953에서 0.960으로, decode 지연은 0.957에서 0.973으로 개선됐고, Pixel 8 Pro의 prefill 지연 R²는 -1.383에서 0.966으로 크게 올랐다. 소량 보정만으로 기기 간 전이도 가능해 Pixel 8 Pro→Pixel 8 전체 지연 R²가 -0.974에서 0.940이 됐다. 같은 SmolLM2가 Orange Pi 5 Pro에서 8.42 tokens/s, RTX 3090급에서 64.38 tokens/s를 내는 등 지연이 기기·런타임에 크게 좌우됨을 보였다.
- •추론 요청을 하드웨어-런타임-모델-프롬프트 구성으로 표현하고 prefill과 decode를 분리해 예측한다.
- •정적 서술자와 DVFS·발열 등 동적 텔레메트리를 게이트 모델로 적응적 융합하는 것이 핵심 기법이다.
- •Pixel 8 전체 지연 R² 0.953→0.960, decode 0.957→0.973, Pixel 8 Pro prefill R² -1.383→0.966으로 개선됐다.
- •기기 간 전이 시 보정만으로 Pixel 8 Pro→Pixel 8 전체 지연 R²가 -0.974에서 0.940으로 회복됐다.
- •동일 SmolLM2 계열이 Orange Pi 5 Pro에서 8.42 tokens/s, RTX 3090급에서 64.38 tokens/s로 기기별 편차가 컸다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Transferable Latency Prediction for Fast LLM Screening on Heterogeneous Edge Devices
- 1.이종 엣지 기기에서 LLM 지연시간을 예측하는 런타임 인지 프레임워크 제안
- 2.추론을 프리필·디코드로 분리하고 정적 설명자와 동적 하드웨어 원격측정을 게이트 모델로 융합
- 3.Pixel 8 Pro 프리필 R²를 -1.383에서 0.966으로 개선, 기기 간 전이도 보정으로 해결
- 4.동일 SmolLM2가 Orange Pi에선 8.42, RTX 3090급에선 64.38토큰/초로 기기 의존성 확인
왜 중요한가?
DVFS·발열 등 런타임 변수 때문에 정적 프로파일링이 무력해지는 엣지 환경에서, 경량 보정만으로 기기별 전수 측정 비용을 줄이고 지연 기준 모델 선택을 가능하게 한다. 온디바이스 AI 제품의 모델 스크리닝 실무에 바로 쓸 수 있는 접근이다.
언급 프로젝트
본문 미리보기
arXiv:2607.21602v1 Announce Type: new Abstract: Accurate latency prediction is critical for deploying large language models (LLMs) on heterogeneous edge devices, where inference latency is affected by model architecture, prompt behavior, runtime backend, hardware utilization, dynamic voltage and frequency scaling (DVFS), and thermal variation. This paper presents a runtime-aware latency prediction framework for deployment-oriented LLM selection. The framework represents each inference request a
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:02AI 초안

