스키마 그래프는 정보 추출과 지식그래프 구축의 상류 병목이지만 대부분의 추출 시스템은 스키마가 이미 주어졌다고 가정한다. 연구진은 원문 코퍼스에서 스키마를 유도하고 선택적으로 융합하는 과제를 평가하기 위해, 15개 관계 추출·9개 이벤트 추출 등 24개 공개 소스를 정규화한 벤치마크 SCOPE를 공개했다. 함께 제시한 SCION은 새 추출 아키텍처가 아니라 감사 가능한 참조 파이프라인으로, 학습 텍스트에서 후보 공간을 만든 뒤 명명·병합·필터링·검증·보수적 융합을 엄격한 JSON 계약과 근거 연결 범위 안에서만 수행한다. SCOPE 코어 스위트에서 SCION-lite가 Literal·Fuzzy·Continuous·Graph 지표 전반에 걸쳐 기존 참조 및 LLM 단독 베이스라인 대비 최고 F1을 기록했고, 오픈 모델 기반 SCION-RL은 상용 LLM 의존도를 낮췄다.
- •SCOPE는 24개 공개 정보추출 소스(RE 15, EE 9)를 평가 전용 골드 스키마 그래프로 정규화한 벤치마크다.
- •핵심 평가 대상은 이벤트 유형과 이벤트 내 인자 역할이며 이벤트 간 연결은 별도 보고한다.
- •SCION은 후보 근거에 연결된 범위에서만 명명·병합·검증·융합을 수행하는 감사 가능한 참조 파이프라인이다.
- •SCION-lite가 Literal·Fuzzy·Continuous·Graph 네 지표 모두에서 공개된 참조·베이스라인 중 최고 F1을 기록했다.
- •근거 연결 출력, 파싱·폴백 로그, 후보 병합 로그, 실행 메니페스트, 코드가 함께 공개됐다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
SCOPE and SCION: A Benchmark and an Auditable Reference Pipeline for Schema Induction and Fusion from Text
본문 미리보기
arXiv:2607.21610v1 Announce Type: new Abstract: Schema graphs are an upstream bottleneck of schema-grounded information extraction and knowledge graph construction, yet most extraction systems assume the schema is already available. We introduce SCOPE (Schema Construction and Ontology-induction Pipeline Evaluation), a train-text-only benchmark for corpus-to-schema induction and optional schema fusion from raw text, built from 24 public information extraction sources (15 RE and 9 EE) normalized
전체 내용이 궁금하다면?
원문을 직접 읽어보세요