Sentence Transformers 라이브러리가 v6.0 업데이트로 ColBERT 방식의 지연 상호작용(late interaction) 검색을 지원하는 MultiVectorEncoder를 새로 추가했다. 기존 단일 벡터 임베딩과 달리 토큰별 벡터를 유지해 질의와 문서 사이의 유사도를 MaxSim 연산으로 계산하며, 정확한 식별자나 특정 조건 매칭에서 더 강한 검색 성능을 낸다. PyLate, Stanford-NLP ColBERT, colpali-engine 체크포인트를 동일한 API로 바로 불러올 수 있으며 텍스트뿐 아니라 페이지 이미지를 직접 매칭하는 시각 문서 검색에도 활용된다. 인덱스 크기가 커지는 비용이 있지만, 토큰 단위 매칭 정보를 보존해 다중 조건 질의나 도메인 외 데이터에서 밀집 임베딩보다 우수한 검색 품질을 제공한다.
- •v6.0에서 ColBERT 스타일 다중벡터 인코더(MultiVectorEncoder) 신규 지원
- •MaxSim 연산으로 질의-문서 토큰 간 최대 유사도 합산해 점수 계산
- •PyLate·ColBERT·colpali-engine 체크포인트를 동일 API로 로드 가능
- •OCR 없이 페이지 이미지를 직접 매칭하는 시각 문서 검색 지원
- •인덱스 용량 증가를 대가로 정확 매칭·다중조건 질의 성능 향상
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Multi-Vector (Late Interaction) Embedding Models with Sentence Transformers
- 1.Sentence Transformers v6.0에 ColBERT식 멀티벡터(late-interaction) 인코더 네이티브 지원 추가
- 2.토큰별 벡터 유지 후 MaxSim으로 채점, 단일벡터 대비 희귀개체·다중조건 질의에 강점
- 3.mLateOn은 MLDR에서 77.92점으로 단일벡터 mDenseOn(51.59) 크게 상회
- 4.PyLate·fast-plaid 결합 시 검색 지연 11~18ms 수준, ColPali 등 비주얼 문서 검색까지 지원
왜 중요한가?
그동안 별도 라이브러리가 필요했던 ColBERT류 late-interaction 검색을 Sentence Transformers 표준 API로 통합해, 정확 매칭·다중요구 질의·OCR 없는 이미지 문서 검색에 손쉽게 접근할 수 있게 됐다.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:58AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
