아마존 베드락에서 RAG 비용을 줄이기 위한 '쿼리 인지 압축(query-aware compression)' 기법을 소개하는 글이다. 검색된 청크를 곧바로 대형 모델에 넣는 대신, 클로드 하이쿠 같은 소형 모델이 먼저 질의와 관련된 구간만 원문 그대로 추출해 압축한 뒤 이를 클로드 소네트 같은 주 모델에 전달해 답변을 생성하는 구조다. 50만 건 이상의 문서와 500개 질문으로 벤치마크한 결과, 압축만으로 비용 33%·토큰 8.6배 절감을, 리랭크와 결합하면 비용 36%·토큰 10.1배 절감을 달성했으며 답변 품질은 기준 대비 97.5% 수준을 유지했다. 특히 환각률이 기준 51%에서 압축 시 44%, 리랭크+압축 시 38%로 낮아지는 부수 효과도 확인됐다. 규제 산업 컴플라이언스, 대규모 지식베이스 기반 고객지원, 재무 리서치 등 검색 컨텍스트가 크고 질문이 좁은 영역에서 특히 효과적이라고 설명한다.
- •소형 모델(클로드 하이쿠)이 검색 청크에서 관련 구간만 원문 그대로 추출 후 주 모델(소네트)에 전달하는 2단계 구조
- •압축만으로 비용 33%·토큰 8.6배 절감, 리랭크 결합 시 비용 36%·토큰 10.1배 절감
- •답변 품질은 기준 대비 97.5~97.6% 유지, 정확도 편차는 0.07점 이내
- •환각률이 기준 51%에서 압축 44%, 리랭크+압축 38%로 감소하는 부수 효과 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Reduce RAG costs on Amazon Bedrock with query-aware compression
- 1.AWS, RAG 비용 절감 위한 '쿼리 인지 압축' 패턴 공개, Bedrock 기반 구현 소개
- 2.작은 모델(클로드 하이쿠)이 검색된 청크서 질의 관련 구절만 추출 후 큰 모델(소네트)에 전달
- 3.실측 결과 비용 33% 절감(재랭킹 병행시 36%), 토큰 최대 10배 감소, 품질 97.5% 유지
- 4.환각률도 기준 51%에서 압축 적용시 44%, 재랭킹+압축시 38%로 감소
왜 중요한가?
RAG 운영 비용의 핵심인 입력 토큰을 줄이면서도 답변 품질 저하를 최소화하는 구체적 아키텍처와 실측 수치를 제시해, 대규모 RAG 서비스를 운영하는 기업이 바로 적용할 수 있는 실용적 최적화 방안이다.
본문 미리보기
Input tokens are often a meaningful part of the cost of running Retrieval Augmented Generation (RAG) at scale. This post describes a query-aware context compression pattern on Amazon Bedrock: after retrieval, a smaller model filters retrieved chunks against the query before the primary model answers, reducing input tokens and cost while preserving answer quality.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:02AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
