SemHash-LLM은 대규모 문서 중복 제거를 위한 다중 granularity 시맨틱 해싱 프레임워크다. 증류된 LLM 임베딩 공간에서 압축 이진 코드를 학습하는 시맨틱 프로젝션 해싱, 상용구를 억제하고 정보성 내용을 강조하는 어텐션 가중 MinHash, 대조 경계 학습, 선택적 LLM 판정을 통합하고, 문자·토큰·문서 수준 신호를 게이트 융합한 뒤 캐스케이드 필터링으로 후보를 효율적으로 줄인다. 적응형 결정 경계와 불확실성 추정으로 템플릿 오염, 짧은 텍스트 변형, 포함 관계, 바이럴 조각 같은 까다로운 사례에서도 강건함을 확보했다. 실험에서 신경망 검증 비용을 전체의 1% 미만으로 유지하면서 높은 중복 탐지 품질을 달성해, LLM 학습 코퍼스 정제 등 대규모 데이터 파이프라인에 실용적이다.
- •시맨틱 프로젝션 해싱·어텐션 가중 MinHash·대조 경계 학습·선택적 LLM 판정을 하나로 통합한 프레임워크
- •문자·토큰·문서 수준 신호를 게이트 융합하고 캐스케이드 필터링으로 후보 축소
- •어텐션 가중 MinHash가 상용구(boilerplate)를 억제해 템플릿 오염에 강건
- •적응형 결정 경계와 불확실성 추정으로 짧은 텍스트 변형·포함 관계·바이럴 조각 대응
- •비싼 LLM/신경망 검증은 전체의 1% 미만만 사용하면서 높은 탐지 품질 달성
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
SemHash-LLM: A Multi-Granularity Semantic Hashing Framework for Document Deduplication
- 1.다결입도 의미 해싱 프레임워크 SemHash-LLM으로 대규모 문서 중복 제거
- 2.의미 투영 해싱, 어텐션 가중 MinHash, 대조 경계 학습, 선택적 LLM 판정을 통합
- 3.문자·토큰·문서 수준 신호를 게이트 융합하고 캐스케이드 필터링으로 후보 축소
- 4.신경망 검증 비용 1% 미만으로 강한 중복 탐지 성능 달성
왜 중요한가?
웹 규모 코퍼스에서 의미적 동일성을 유지하며 중복을 걸러내는 일은 LLM 학습 데이터 품질과 직결되는데, SemHash-LLM은 값비싼 신경망 검증을 1% 미만으로 억제해 대규모 전처리에 실용적인 효율을 제시한다.
언급 프로젝트
본문 미리보기
arXiv:2607.01601v1 Announce Type: new Abstract: Large scale document deduplication must preserve semantic equivalence while remaining efficient over massive corpora. We present SemHash LLM, a multi granularity framework that unifies semantic projection hashing, attention weighted MinHash, contrastive boundary learning, and selective LLM based adjudication. The method combines character, token, and document level signals through gated fusion, then applies a cascaded filtering pipeline for effici
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

