의료 등 전문용어 밀집 분야의 정보 검색은 복합 단어, 약어, 수치 제약, 합성 개념을 보존해야 하는데, 기존 방식은 단일 벡터 검색기가 지역적 관련성 신호를 과도하게 압축하거나 토큰 단위 후기 상호작용이 모든 서브워드를 저장해 색인·저장·스코어링 비용이 큰 양 극단에 있었다. 연구진은 가변 길이 구(phrase) 단위로 문맥 의존적 검색 단위를 예측하고, 미커버 토큰은 단일 단위로 남기며, 중요도 기반 단위 선택과 가중 MaxSim 상호작용을 적용하는 통합 다중 세분화 검색기 'H+ 임베딩'을 제안했다. 과학·의료·이중언어 16개 과제에서 구 검색 분기는 전역 검색 분기보다 매크로 nDCG@10 기준 6.91점 높았고, 문서 벡터를 13.7% 적게 쓰면서도 토큰 단위 검색과 거의 동등한 성능을 냈다.
- •H+ 임베딩, 전역 벡터 검색과 토큰 단위 후기 상호작용의 중간 지점인 '문맥 의존적 구(phrase)' 검색 단위 제안
- •가변 길이 구 분할 예측, 미커버 토큰은 단일 단위 보존, 중요도 기반 단위 선택과 가중 MaxSim 적용
- •과학·의료·이중언어 16개 과제에서 구 검색 분기가 전역 검색 분기 대비 매크로 nDCG@10 6.91점 향상
- •문서 벡터 13.7% 적게 사용하면서도 토큰 단위 검색 성능에 근접
- •내용 독립적 그룹화 규칙보다 중간 수준 벡터 예산에서 더 우수한 성능
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
H+ Embedding: Harmonizing Global and Token-Level Retrieval with Context-Dependent Phrases
본문 미리보기
arXiv:2608.00065v1 Announce Type: new Abstract: Terminology-intensive retrieval, especially in medical settings, depends on preserving multi-word entities, abbreviations, numerical constraints, and compositional concepts. However, existing representations lie at two extremes: single-vector retrievers often over-compress local relevance signals, while token-level late interaction retains every tokenizer subword at substantial indexing, storage, and scoring cost. This mismatch raises a natural qu
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:11AI 초안

