기존 LLM 쿼리 라우터는 응답 품질과 비용만 고려하고 생성 지연시간(latency)은 무시한다는 문제의식에서, 지연·정확도·비용을 동시에 최적화하는 라우터를 제안한 연구다. 지연시간은 프롬프트 길이뿐 아니라 모델 인스턴스의 prefill·decode 부하와 서빙 프레임워크의 배칭 정책에 좌우돼 예측이 어려운데, 저자들은 자기회귀 토큰 배치 처리를 시뮬레이션해 첫 토큰까지의 시간(TTFT)을 추정하는 경량 지연 추정기를 설계했다. 이를 라우터에 통합한 결과, 라운드로빈 등 표준 로드밸런싱과 동일한 지연시간을 유지하면서 정확도-비용 효용을 최대 40% 개선했다. 동적 워크로드 환경에서 LLM 서빙 비용을 낮추려는 인프라 운영자에게 실용적인 접근이다.
- •기존 쿼리 라우터는 품질·비용만 보고 지연시간은 로드밸런서에 맡기는 분리 구조의 비효율 지적
- •서빙 프레임워크의 토큰 배치 처리를 시뮬레이션해 TTFT를 예측하는 경량 지연 추정기 설계
- •지연·정확도·비용을 동시 최적화하는 지연 인지(latency-aware) 라우터에 통합
- •표준 로드밸런싱과 동일 지연시간에서 정확도-비용 효용 최대 40% 개선
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads
- 1.지연시간 인지 LLM 쿼리 라우터 제안: 정확도·비용·지연을 동시 최적화해 모델 배정
- 2.서빙 프레임워크의 토큰 배치 처리를 시뮬레이션해 TTFT를 예측하는 경량 추정기 설계
- 3.기존 라우터는 지연 무시, 라운드로빈 등 로드밸런서는 정확도·비용 무시라는 공백 공략
- 4.동일 지연시간을 유지하면서 정확도-비용 효용 최대 40% 개선 실험 결과
왜 중요한가?
모델 라우팅과 로드밸런싱이 따로 놀던 LLM 서빙 스택의 공백을 지적하고, TTFT 시뮬레이션 기반 추정기로 이를 통합했다. 멀티모델 인프라를 운영하는 팀이라면 라우팅 계층 재설계 시 참고할 만한 구체적 수치를 제시한다.
이 연구는 LLM 쿼리 라우팅에서 응답 속도(latency)를 고려하는 새로운 접근 방식을 제시하여, 정확도와 비용 외에 실제 서비스 경험을 개선할 중요성을 강조합니다. 한국 기업들이 대규모 언어 모델을 서비스에 적용할 때, 사용자의 즉각적인 피드백과 만족도를 높이기 위해 이러한 지연 시간 최적화 기술은 필수적인 고려 사항이 될 것입니다. 이는 서비스 품질 향상과 직결되어 고객 만족도를 높일 수 있습니다.
본문 미리보기
arXiv:2607.18253v1 Announce Type: new Abstract: Modern language query routers improve inference efficiency by assigning each query to a model that balances response quality and monetary cost. However, current query routers are largely latency-agnostic and do not consider the generation latency experienced by queries at model instances. In practice, latency is often controlled by load-balancing policies such as round-robin or join-the-shortest-queue, which do not account for model accuracy or in
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

