DeFAb는 규칙 기반 논리 솔버가 50마이크로초 안에 100% 정확도로 푸는 문제를 최고 프런티어 언어모델은 잘해야 65%, 렌더링 견고 평가(네 표면 표기 중 최악)에서는 23.5%까지 떨어지는 격차를 드러내는 가설적 귀추(defeasible abduction) 벤치마크다. 40년간 공적 자금이 투입된 지식베이스를 형식적으로 근거화된 인스턴스로 변환해, 무관한 기대는 보존하면서 기본값을 무효화해 이상을 설명하는 가설을 구성하게 한다. 모든 가설이 유효 도출·보수성·최소성의 다항시간 검사를 통과해야 하므로, 논리적 엄밀성을 창의성·이론적 추론의 측정 도구로 삼는다. 분류 계층(OpenCyc·YAGO·Wikidata)과 행동 속성 그래프(ConceptNet·UMLS)를 짝지어 18개 출처·33.75M 규칙에서 372,648개 이상 인스턴스를 3단계로 생성했다. 네 프런티어 모델은 가설적 추론을 안정적으로 내재화하지 못했으며(레벨2 7.8~23.5%, CoT 분산 ~36pp), 저자들은 DeFAb-Hard와 Lean4 기반 CONJURE도 공개하고 동일 검증기를 DPO·RLVR/GRPO 보상으로 활용한다.
- •논리 솔버는 <50µs·100% vs 최고 LLM 65%, 렌더링 견고 평가 시 23.5%로 하락
- •지식베이스를 형식 근거 인스턴스로 변환, 다항시간 검증 가능한 가설적 귀추 과제
- •18개 출처·33.75M 규칙에서 372,648개 이상 인스턴스를 3단계로 생성
- •DeFAb-Hard·CONJURE 공개, 동일 검증기를 DPO·RLVR/GRPO 보상으로 활용
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
DeFAb: A Verifiable Benchmark for Defeasible Abduction in Foundation Models
- 1.DeFAb: 공적 자금으로 구축된 지식베이스를 변환한 반증 가능 알그의 추론 벤치마크
- 2.규칙 기반 논리 솔버는 50마이크로초 내 100% 정확도, 최고 프론티어 모델은 65%에 그침
- 3.렌더링 강건성 평가 시 최고 모델 정확도가 23.5%로 하락, CoT 분산이 모델간 격차 초과
- 4.18개 소스·3,375만 규칙에서 372,648개 이상 인스턴스 생성, MIT 라이선스 공개
왜 중요한가?
다항시간 검증으로 유도 타당성·보수성·최소성을 강제해 '유창하지만 이론 파괴적' 답변이 아닌 규율 있는 이론 수정을 채점하며, 같은 검증기를 DPO·GRPO의 정확한 보상으로 재활용할 수 있다.
언급 프로젝트
국내 파운데이션 모델 개발 및 활용이 가속화되는 시점에서, 모델의 추론 능력과 신뢰성을 객관적으로 평가하는 것은 매우 중요합니다. 본 벤치마크는 현재 LLM의 논리적 추론 한계를 명확히 보여주며, 이는 국내 기업들이 AI를 도입할 때 발생할 수 있는 잠재적 오류를 인지하고 보다 신뢰성 높은 시스템을 구축하는 데 필요한 고려사항을 제시합니다.
본문 미리보기
arXiv:2606.18557v1 Announce Type: new Abstract: A rule-based logic solver resolves every instance in our benchmark in under 50 microseconds with 100% accuracy; the best frontier language model reaches 65% at best and drops to 23.5% under rendering-robust evaluation (worst case over four surface renderings). We introduce DeFAb (Defeasible Abduction Benchmark), a dataset and generation pipeline that converts four decades of publicly funded knowledge bases into formally grounded instances for defe
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:23AI 초안

