대형언어모델은 비정형 문서에서 개체와 관계를 유창하게 추출하지만, 문서마다 유형 어휘가 갈라지고 동일 인물이 여러 이름으로 나타나며 동명이인이 조용히 뒤섞이는 등 일관성 문제를 안고 있다. 연구진은 카프카로 들어오는 실시간 문서 스트림을 PDF·스프레드시트·오피스·이미지별 전용 핸들러로 처리하고, 온톨로지에 맞춰 튜닝한 자체 호스팅 Qwen3.5-9B 모델로 2단계 추출을 수행하는 프로덕션급 지식그래프 구축 파이프라인을 제시했다. 핵심은 그래프 데이터베이스에서 임베딩 유사도로 관련 온톨로지 조각만 실시간으로 가져와 프롬프트에 주입하는 '온톨로지 가이드 추출'로, 정적 도메인 슬라이스 대비 카탈로그 부담을 약 94% 줄였다. 결정론적 정제, 청크 간 병합, 관계 재추출, 모델 추론 없는 6종 중복제거 알고리즘, 그리고 어떤 유사도 점수로도 무시할 수 없는 충돌 가드를 갖춘 임베딩 해상 5단계 정제 파이프라인을 거쳐, 정보기관 코퍼스 평가에서 검색 재현율을 약 70%에서 95%로 끌어올리면서도 잘못된 병합은 발생하지 않았다.
- •카프카 실시간 문서스트림을 형식별 핸들러로 처리하는 프로덕션급 지식그래프 구축 파이프라인
- •온톨로지 조각을 임베딩 유사도로 실시간 검색해 프롬프트에 주입, 카탈로그 부담 약 94% 절감
- •결정론적 정제·병합·관계재추출·6종 중복제거·충돌가드 임베딩 해상의 5단계 정제 파이프라인
- •정보기관 코퍼스에서 검색 재현율 70%→95% 개선, 잘못된 병합 없음
- •제목 접두사로 인한 개체 중복 등 7가지 유형의 은닉된 품질결함 교정
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
An Ontology-Guided, Deduplication-Aware Extraction Layer for Knowledge Graph Construction from Heterogeneous Documents
본문 미리보기
arXiv:2607.28662v1 Announce Type: new Abstract: Large language models extract entities and relationships from unstructured documents fluently but inconsistently: type vocabularies fracture across documents, the same person surfaces under several name variants, relationships duplicate, and distinct individuals who share a name risk silent conflation. This paper presents the design, implementation, and empirical refinement of a production extraction layer that converts a live document stream into
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:10AI 초안

