멀티테넌트 기업 RAG에서 검색 계층(벡터 메모리·유사도 연산·임베딩 API) 비용이 테넌트별로 귀속되지 않는 거버넌스 공백을 해결하는 Cost-Governed RAG 아키텍처를 제안했다. 코드북 무관(codebook-oblivious) 벡터 인덱스 TurboVec의 결정론적 폐형 메모리 공식을 활용해 테넌트별 검색 비용을 거의 정확히 산정하고, 임베딩·검색·생성 비용을 통합 관측한다. Snowpark Container Services 배포 실험에서 100개 시뮬레이션 테넌트(1천만 벡터) 기준 99.96% 비용 귀속 정확도를 달성했고, 텔레메트리 오버헤드는 쿼리 지연의 0.04% 미만이었다. 관리형 벡터 DB 대비 검색 인프라 비용을 3.1~9.0배 절감해, 기업 RAG의 테넌트 간 비용 교차보조 문제에 실용적 해법을 제시한다.
- •기존 RAG는 생성 비용만 토큰 단위로 측정하고 검색 계층 비용은 미귀속 공유 비용으로 남아 테넌트 간 교차보조 발생
- •TurboVec의 결정론적 폐형 메모리 공식으로 테넌트별 검색 비용을 거의 정확히 산정 — 그래프 기반 인덱스에서는 불가능한 속성
- •100개 테넌트·1천만 벡터 실험에서 99.96% 비용 귀속 정확도, 오버헤드는 지연의 0.04% 미만
- •관리형 벡터 DB 서비스 대비 검색 인프라 비용 3.1~9.0배 절감
- •코드북 무관 양자화는 학습형 양자화의 공유 코드북 유출 표면도 제거(탐색적 관찰)
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Cost-Governed RAG: Unified Per-Tenant Cost Attribution Across Retrieval and Generation in Multi-Tenant LLM Systems
- 1.멀티테넌트 RAG의 검색 계층 비용을 테넌트별 귀속하는 Cost-Governed RAG 제안
- 2.코드북 무관 벡터 인덱스 TurboVec의 폐형 메모리 공식으로 정밀 비용 계산
- 3.Snowpark 배포서 100테넌트·1천만 벡터 귀속 정확도 99.96%, 오버헤드 0.04% 미만
- 4.관리형 벡터 DB 대비 검색 인프라 비용 3.1~9배 절감 주장
왜 중요한가?
LLM 생성은 토큰 단위로 과금되지만 벡터 검색·임베딩 계층은 공유 비용으로 남아 테넌트 간 보이지 않는 교차 보조가 발생하던 기업 RAG의 거버넌스 공백을 메운 아키텍처다. 사내 과금·쇼백 체계와 검색 인프라 비용 최적화에 직접 응용할 수 있다.
이 논문은 멀티테넌트 LLM 시스템에서 RAG(검색 증강 생성)의 검색 및 생성 단계 전반에 걸쳐 통합된 비용 할당 방식을 제안합니다. 국내 기업들이 LLM 기반 서비스를 도입하고 확장하면서, 단순히 토큰 기반의 생성 비용뿐만 아니라 벡터 데이터베이스, 임베딩 API 호출 등 검색 레이어의 숨겨진 비용 관리 문제가 점차 중요해질 것입니다. 이 연구는 한국 시장에서 AI 서비스의 효율적인 운영 및 정확한 비용 청구 모델 구축에 실질적인 도움을 줄 수 있는 인사이트를 제공합니다.
본문 미리보기
arXiv:2607.12188v1 Announce Type: new Abstract: Enterprise Retrieval-Augmented Generation (RAG) deployments face a critical governance gap: while LLM generation cost is metered per token, the retrieval layer - vector memory, similarity compute, and embedding API calls - remains an unattributed shared cost, enabling invisible cross-subsidization among tenants. We present Cost-Governed RAG, an architecture that integrates a codebook-oblivious vector index (TurboVec) with a multi-tenant LLM govern
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:40AI 초안

