연구팀이 AI 추론 서비스 기업 추트스(Chutes)의 1년치 프로덕션 트레이스를 분석해 LLM 서빙 워크로드가 어떻게 진화하는지 규명하는 대규모 종단 연구를 발표했다. 기존 연구가 짧은 기간의 관측에 그쳐 실제 프로덕션 환경에서 사용자와 모델이 어떻게 상호작용하는지 충분히 보여주지 못했던 것과 달리, 이번 연구는 인기 모델뿐 아니라 롱테일 모델까지 포함한 전체 프로덕션 행태를 담고 있다. 연구팀은 전체적·시간적·모델별·사용자별 관점에서 워크로드를 분석해 기존의 총합 통계만으로는 드러나지 않던 워크로드 진화 양상과 사용자-모델 구조를 밝혔으며, 후속 연구를 위해 1년치 전체 트레이스 데이터를 논문과 함께 공개할 예정이다.
- •추트스의 1년치 프로덕션 트레이스를 활용해 LLM 서빙 워크로드의 장기 진화를 분석한 종단 연구.
- •기존 연구와 달리 인기 모델은 물론 롱테일 모델까지 포함한 전체 프로덕션 트래픽을 포착.
- •전체·시간·모델별·사용자별 다각도 분석으로 총합 통계로는 드러나지 않던 사용자-모델 구조를 규명.
- •후속 연구를 위해 1년치 전체 트레이스 데이터를 논문과 함께 공개할 예정.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
A Year in LLM Serving: Workload Evolution, Caching and Load-Balancing
본문 미리보기
arXiv:2608.13573v1 Announce Type: new Abstract: Large Language Model (LLM) serving has become a critical cloud workload, and realistic traces are essential for motivating and benchmarking serving systems. However, existing LLM serving workload studies remain limited in scale and scope. They often observe short time periods and provide limited visibility into how users interact with models in production. As a result, they do not fully capture how LLM serving workloads evolve over time or how use
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:21AI 초안

