DW-Bench는 데이터 웨어하우스 스키마의 그래프 토폴로지 추론 능력을 LLM에 대해 평가하는 새 벤치마크다. 외래키(FK)와 데이터 리니지 엣지를 모두 통합한 점이 특징이며, 5개 스키마에 걸쳐 1,046개의 자동 생성·검증 가능한 질문을 제공한다. 실험 결과 도구 보강 방식이 정적 방식을 크게 능가했으나 어려운 합성형(compositional) 하위 유형에서는 성능이 정체되었다.
- •FK와 데이터 리니지 엣지를 함께 다루는 그래프 토폴로지 추론 벤치마크
- •5개 스키마에 1,046개의 자동 생성·검증된 질문 포함
- •도구 보강 LLM이 정적 접근 대비 큰 성능 우위
- •어려운 합성 하위 유형에서는 모든 방식이 성능 한계를 보임
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
DW-Bench: Benchmarking LLMs on Data Warehouse Graph Topology Reasoning
- 1.FK와 데이터 계보 엣지를 포함하는 데이터웨어하우스 벤치마크 DW-Bench 공개
- 2.5개 스키마에서 1,046개 자동 생성 검증 가능 문제로 구성
- 3.도구 증강 방식이 정적 접근보다 우수하나 복합 난제에서 정체
- 4.데이터 계보 추론의 현실적 평가 기준을 제공
왜 중요한가?
데이터웨어하우스 스키마 기반 그래프 추론을 정량 측정하는 최초의 벤치마크로, 엔터프라이즈 데이터 에이전트 발전의 기준점 제공
언급 프로젝트
본문 미리보기
arXiv:2604.18964v1 Announce Type: new Abstract: This paper introduces DW-Bench, a new benchmark that evaluates large language models (LLMs) on graph-topology reasoning over data warehouse schemas, explicitly integrating both foreign-key (FK) and data-lineage edges. The benchmark comprises 1,046 automatically generated, verifiably correct questions across five schemas. Experiments show that tool-augmented methods substantially outperform static approaches but plateau on hard compositional subtyp
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

