LLM이 과학 문서를 요약할 때 수치·단위를 환각하는 오류를 '타입 검증' 문제로 재정의하고, 5개 클래스 오류 분류 체계와 1,500개 항목 벤치마크를 구축한 연구다. 이 벤치마크로 파인튜닝한 ModernBERT 인코더는 macro-F1 0.899로 기존 신경망 팩트체커를 크게 앞섰지만, 95°C와 368.15K처럼 물리적으로 동등한 표현에서는 정확도가 36.5%로 붕괴하는 맹점이 드러났다. 이를 해결하기 위해 심볼릭 검증기 모듈을 역방향으로 실행해 라벨 보존 증강 데이터를 만드는 'Symbolic Augmentation'을 제안, 동등 표현 강건성을 98.2%로 끌어올리고 SciFact-Open 전이 성능도 개선했다(0.791→0.828). 추론 비용 추가 없이 프론티어 LLM급 검증 성능을 얻는 심볼릭-신경망 결합 지점을 제시했다는 의미가 있다.
- •수치·단위 환각 검출을 5클래스 타입 오류 분류로 재정의, PMC·arXiv 기반 1,500개 벤치마크 구축(Krippendorff's α=0.882)
- •파인튜닝된 ModernBERT가 macro-F1 0.899로 기성 신경망 팩트체커 압도
- •95°C=368.15K 같은 단위 동등 표현에서 정확도 36.5%로 붕괴하는 구조적 맹점 발견
- •심볼릭 검증기를 역실행해 증강 데이터를 생성하는 Symbolic Augmentation으로 동등성 강건성 98.2% 달성
- •심볼릭 특징의 인코더 입력 추가는 무효과, 심볼릭 실버 라벨은 역효과라는 부정적 결과로 학습 시 증강이 올바른 결합 지점임을 입증
Symbolic Augmentation Closes a Canonical-Equivalence Blind Spot in Neural Fact-Checkers
- 1.과학 텍스트의 수치·단위 환각 검증용 5분류 오류 체계와 1500개 벤치마크 구축
- 2.파인튜닝한 ModernBERT가 macro-F1 0.899 달성했으나 단위 등가 변환(95°C=368.15K)엔 36.5%로 붕괴
- 3.심볼릭 검증기를 역방향으로 돌려 증강 데이터를 만드는 Symbolic Augmentation으로 등가 강건성 98.2% 달성
- 4.증강 인코더는 추론 비용 없이 프런티어 LLM급 성능, SciFact-Open에서도 F1 0.791→0.828 전이
왜 중요한가?
신경망 팩트체커가 물리적으로 같은 수치의 표기 변환에 취약하다는 구조적 맹점을 정량화하고, 심볼릭-신경망 결합의 올바른 접점이 추론 시가 아닌 '학습 시 데이터 증강'임을 보였다. 과학 문서 요약·검증 파이프라인의 신뢰성 개선에 직접 활용 가능하다.
🏷️ 언급 프로젝트
본문 미리보기
arXiv:2607.16212v1 Announce Type: new Abstract: Large language models hallucinate numbers and units when summarizing scientific text, a failure mode that can silently invert a scientific claim. We recast the detection of such errors as typed verification: we introduce a five-class typed-quantity error taxonomy and a 1500-item benchmark, rewritten from PMC and arXiv sources and labeled by two independent LLM annotators with adjudication (Krippendorff's alpha = 0.882). A ModernBERT encoder fine-t
전체 내용이 궁금하다면?
원문을 직접 읽어보세요