텍스트 속성 그래프(TAG)를 위한 반지도(semi-supervised) 데이터 증류 프레임워크를 제안한 논문이다. 기존 TAG 표현 학습은 LLM과 결합 시 확장성 병목이 심하고, 기존 증류 방법은 그래프-텍스트 모달리티 상호작용과 라벨 부족 문제를 다루지 못하며 사람이 읽을 수 있는 텍스트 속성도 생성하지 못했다. 제안 프레임워크는 그래프 인지·비인지 이중 경로 인코더의 협업 자기학습으로 신뢰할 수 있는 의사 라벨을 수확하고, Wasserstein 거리 기반 그래프 스케칭 알고리즘과 클러스터 키워드 추출 기반 LLM 텍스트 합성 모듈로 압축 노드에 가독성 있는 요약을 생성한다. 벤치마크 실험에서 GNN·LLM 다운스트림 태스크 모두에서 최고 수준의 성능-압축 트레이드오프를 달성해, 대규모 TAG 분석의 효율화 가능성을 보여준다.
- •TAG(텍스트 속성 그래프) 대상 반지도 데이터 증류 프레임워크—Wasserstein 거리(WSD) 기반 설계
- •그래프 인지/비인지 이중 경로 인코더의 협업 자기학습으로 라벨 부족 상황에서 의사 라벨 확보
- •WSD 기반 그래프 스케칭과 클러스터 키워드 추출 LLM 합성으로 압축 노드에 사람이 읽을 수 있는 텍스트 생성
- •GNN·LLM 다운스트림 태스크 모두에서 SOTA 성능-압축 트레이드오프 달성
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Semi-Supervised Text-Attributed Graph Distillation
- 1.텍스트 속성 그래프(TAG)용 준지도 데이터 증류 프레임워크 제안, Wasserstein 거리 기반 설계
- 2.그래프 인지·비인지 이중 인코더의 협업 자기학습으로 라벨 부족 상황서 신뢰할 수사 라벨 확보
- 3.클러스터 키워드 추출 기반 LLM 텍스트 합성으로 압축 노드에 사람이 읽을 수 있는 요약 생성
- 4.벤치마크에서 GNN·LLM 다운스트림 과제 모두 성능-압축 트레이드오프 최고 수준 달성
왜 중요한가?
LLM과 결합한 TAG 학습의 확장성 병목을 데이터 증류로 푸는 접근으로, 기존 증류가 못 하던 그래프-텍스트 양모달 상호작용 포착과 사람이 읽을 수 있는 텍스트 속성 생성을 동시에 해결해 대규모 그래프 분석 비용을 낮춘다.
텍스트 속성 그래프(TAG)의 확장성 문제를 해결하는 이 반지도 학습 연구는 국내 빅데이터 분석 및 지식 그래프 구축 분야에 큰 영향을 미칠 수 있습니다. 특히 방대한 양의 텍스트 데이터를 효율적으로 처리하고 복잡한 관계를 파악해야 하는 국내 기업들에게 실질적인 도움을 줄 것입니다.
본문 미리보기
arXiv:2607.20477v1 Announce Type: new Abstract: {\em Text-Attributed Graphs} (TAGs) have emerged as an expressive data model for integrating graph topology with rich textual semantics. Existing representation learning methods over TAGs suffer from severe scalability bottlenecks, particularly together with {\em Large Language Models} (LLMs). While data distillation offers a promising data-centric solution, existing methods fail to capture the complex interplay between graph and text modalities,
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

