텍스트 속성 그래프(TAG)를 위한 반지도(semi-supervised) 데이터 증류 프레임워크를 제안한 논문이다. 기존 TAG 표현 학습은 LLM과 결합 시 확장성 병목이 심하고, 기존 증류 방법은 그래프-텍스트 모달리티 상호작용과 라벨 부족 문제를 다루지 못하며 사람이 읽을 수 있는 텍스트 속성도 생성하지 못했다. 제안 프레임워크는 그래프 인지·비인지 이중 경로 인코더의 협업 자기학습으로 신뢰할 수 있는 의사 라벨을 수확하고, Wasserstein 거리 기반 그래프 스케칭 알고리즘과 클러스터 키워드 추출 기반 LLM 텍스트 합성 모듈로 압축 노드에 가독성 있는 요약을 생성한다. 벤치마크 실험에서 GNN·LLM 다운스트림 태스크 모두에서 최고 수준의 성능-압축 트레이드오프를 달성해, 대규모 TAG 분석의 효율화 가능성을 보여준다.
- •TAG(텍스트 속성 그래프) 대상 반지도 데이터 증류 프레임워크—Wasserstein 거리(WSD) 기반 설계
- •그래프 인지/비인지 이중 경로 인코더의 협업 자기학습으로 라벨 부족 상황에서 의사 라벨 확보
- •WSD 기반 그래프 스케칭과 클러스터 키워드 추출 LLM 합성으로 압축 노드에 사람이 읽을 수 있는 텍스트 생성
- •GNN·LLM 다운스트림 태스크 모두에서 SOTA 성능-압축 트레이드오프 달성
Semi-Supervised Text-Attributed Graph Distillation
본문 미리보기
arXiv:2607.20477v1 Announce Type: new Abstract: {\em Text-Attributed Graphs} (TAGs) have emerged as an expressive data model for integrating graph topology with rich textual semantics. Existing representation learning methods over TAGs suffer from severe scalability bottlenecks, particularly together with {\em Large Language Models} (LLMs). While data distillation offers a promising data-centric solution, existing methods fail to capture the complex interplay between graph and text modalities,
전체 내용이 궁금하다면?
원문을 직접 읽어보세요