CARGO는 별도 라우터 학습 없이 로컬 LLM과 클라우드 LLM 간 오프로딩을 결정하는 학습 불필요(training-free) 라우팅 프레임워크다. 로컬 모델이 프롬프트를 변형해 샘플링한 응답들 간의 일치도를 신뢰 신호로 사용하고, 베이지안 조기 종료로 샘플 효율을 높이며, 배포 시 가벼운 캘리브레이션만으로 임의의 협업 비율을 지원한다. 다양한 추론·QA 태스크와 여러 로컬 모델 계열에서 기존 학습 불필요 베이스라인을 일관되게 능가했고, 일부 설정에서는 지도학습된 라우터까지 앞섰다. 리소스 제약 환경에서 라우터 훈련 비용 없이 로컬-클라우드 협업을 구축할 수 있다는 실용적 시사점을 준다.
- •CARGO: 라우터 학습이나 파인튜닝 없이 로컬-클라우드 LLM 오프로딩을 결정하는 training-free 프레임워크
- •로컬 모델의 프롬프트 변형 샘플링 응답 간 일치도를 신뢰도 신호로 활용
- •베이지안 조기 종료로 샘플 효율적 불확실성 제어, 배포 시 경량 캘리브레이션으로 목표 협업 비율 조절 가능
- •여러 태스크·모델 계열에서 training-free 베이스라인을 상회하고 일부 설정에선 지도학습 라우터도 능가
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Routing Without Training: Controllable-Ratio LLM Offloading via Reliability Gating
- 1.CARGO 제안: 학습 없이 로컬 LLM의 응답 일치도만으로 클라우드 오프로딩을 결정하는 라우팅 프레임워크
- 2.프롬프트 변형 샘플링으로 일치도 추정, 베이지안 조기 종료로 샘플 효율적 불확실성 제어
- 3.배포 시 경량 캘리브레이션만으로 임의의 로컬-클라우드 협업 비율 지정 가능
- 4.다양한 추론·QA 과제에서 학습 없는 베이스라인을 능가, 일부 설정선 지도학습 라우터도 상회
왜 중요한가?
기존 로컬-클라우드 협업은 별도 라우터 학습이나 협업용 파인튜닝이 필요해 운영 환경에 종속됐는데, 로컬 모델 자체 신호만으로 라우팅이 가능함을 보여 온디바이스 LLM 배포 비용·복잡도를 크게 낮출 수 있는 접근이다.
언급 프로젝트
이 연구는 자원 제약 환경에서 LLM을 효율적으로 배포하는 '훈련 없는 라우팅' 방식을 제시합니다. 이는 국내 기업들이 제한된 인프라에서도 LLM 서비스를 유연하게 구축하고 운영하는 데 중요한 기술적 토대가 될 수 있어, 비용 효율적인 AI 도입을 고민하는 기업들에게 유용합니다.
본문 미리보기
arXiv:2607.20481v1 Announce Type: new Abstract: Local-cloud collaboration is a practical way to deploy large language models under resource constraints, but existing methods often rely on trained routers or collaboration-aware finetuning that tie routing behavior to a particular operating regime. In this work, we show that such training may be unnecessary: the local model's own inference-time agreement across sampled responses already provides a strong signal for deciding when to trust local ex
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

