블랙박스 검색증강생성(RAG) 시스템 뒤에 숨은 임베딩 모델을 질의만으로 식별하는 핑거프린팅 공격 TellTail이 공개됐다. 검색 결과가 노출되면 검색 중첩도를 비교하고, 최종 생성 답변만 노출되면 특정 모델에 특화된 질의를 최적화해 식별하는 방식이다. 53개 검색 모델을 대상으로 한 실험에서 전체 순위 노출 시 100%, 비정렬 상위 3개 노출 시 94.3%, 생성된 답변만으로도 92.5%의 식별 정확도를 기록했다. OpenWebUI 같은 실제 RAG 시스템에서도 공격이 성공해 지식재산권 노출과 후속 공격 정찰 위험을 보여준다.
- •검색 결과·생성 답변만으로 블랙박스 뒤 임베딩 모델을 식별하는 TellTail 공격 제안
- •53개 검색 모델 대상 실험에서 전체 순위 노출 시 100%, 상위 3개만 노출돼도 94.3% 식별
- •생성된 답변만 보이는 가장 제한적 설정에서도 92.5% 정확도
- •실제 RAG 시스템 OpenWebUI에서도 성공, 지재권 노출과 후속 공격 정찰로 이어질 수 있음
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
The TellTail of Embeddings: Fingerprinting Retrievers in Black-Box Systems
- 1.검색결과만 노출되는 블랙박스 RAG 시스템에서도 쿼리만으로 내부 임베딩 리트리버를 특정하는 공격 'TellTail' 제안
- 2.검색문서 노출 시 중첩도를 비교, 최종답변만 노출 시 특정 리트리버에서만 특정 검색거동을 유도하는 질의를 최적화
- 3.53개 리트리버 평가에서 전체랭킹 노출 시 100% 식별, top-3 노출 시 94.3%, 답변만으로도 92.5% 식별
- 4.실제 RAG 시스템 OpenWebUI를 대상으로도 핑거프린팅에 성공
왜 중요한가?
리트리버를 숨겨 안전하다고 여겨온 RAG 서비스가 실제로는 쿼리 패턴만으로 사용 모델이 드러나 지식재산 노출과 이후 모델 특화 공격의 정찰 수단이 될 수 있음을 실증한다.
본문 미리보기
arXiv:2610.04026v1 Announce Type: new Abstract: Dense embedding models are core to modern text retrieval, enabling systems ranging from web search to retrieval-augmented generation (RAG). Yet, retrievers are usually deployed within opaque systems, exposing only ranked results, cited sources, or generated answers. This opacity prevents users from verifying which retrievers providers serve and may create a false sense of robustness against retrieval attacks. We show that attackers can infer retri
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

