IBM Research가 에이전트 시스템의 모델 라우팅이 단순 분류 문제가 아니라 시스템 최적화 문제임을 실측으로 보였다. AppWorld 417개 과제에서 토큰 단가가 더 싼 GPT-4.1이 과제당 $0.37로 Claude Sonnet 4.6($0.19)의 약 2배 비용이 들었는데, 에이전트 워크로드의 높은 캐시 적중률에서 Sonnet의 저렴한 캐시 읽기 단가가 단가 차이와 3배 긴 추론 스텝을 상쇄했기 때문이다. 과제 난이도는 라우팅 시점에 보이지 않는 경우가 많고, 실제 라우터는 비용·품질·지연·컴플라이언스·신뢰성을 동시에 저글링해야 한다. 이에 분류 대신 다목적 최적화로 접근한 자사 라우터는 비용-정확도 프런티어를 그려, 지연 최적화 구성에서 Opus 단독 대비 비용 21%·지연 9% 절감에 정확도 하락은 4%에 그쳤고, 라우팅 오버헤드는 과제당 약 6ms·2kB에 불과했다. 가격표만 보는 라우터는 잘못된 숫자를 최적화한다는 것이 핵심 교훈이다.
- •AppWorld 417과제 실측: 토큰 단가가 싼 GPT-4.1($0.37/과제)이 Claude Sonnet 4.6($0.19)보다 약 2배 비용 — 캐시 읽기 단가가 승부처
- •난이도는 라우팅 시점에 보이지 않으며, 비용·지연·컴플라이언스·신뢰성을 동시에 균형해야 함
- •지연은 모델 크기보다 서빙 인프라(캐시 웜업, 엔드포인트 부하)가 지배적
- •분류 대신 최적화 기반 라우터: Opus 단독 대비 비용 -21%, 지연 -9%, 정확도 -4%의 운영점 제공
- •라우팅 오버헤드 과제당 약 6ms·2kB로 병목 아님
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Model Routing Is Simple. Until It Isn’t.

- 1.IBM 연구팀이 LLM 라우팅을 분류 문제가 아닌 시스템 최적화 문제로 재정의해야 한다고 주장
- 2.AppWorld 417과제에서 단가 싼 GPT-4.1이 $155, 비싼 Sonnet 4.6이 $79 — 캐싱 효과가 역전 원인
- 3.과제 난이도는 라우팅 시점에 보이지 않고, 컴플라이언스·데이터 레지던시 제약도 라우터가 처리해야 함
- 4.최적화 기반 라우터로 Opus 단독 대비 비용 21%·지연 9% 절감, 정확도 하락은 4%에 그침
왜 중요한가?
"싼 모델에 쉬운 일, 비싼 모델에 어려운 일"이라는 통념적 라우팅이 캐싱·인프라·거버넌스 변수 앞에서 실제 비용을 오판한다는 것을 실측 데이터로 보여준다. 에이전트 워크로드의 비용 최적화를 설계하는 팀이라면 가격표가 아닌 캐시 히트율과 실행 궤적 기준으로 라우터를 다시 검토해야 한다는 실무적 교훈이다.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 03:38AI 초안

