LLM의 복잡한 시간 추론 실패가 자귀 회귀 추론 결함이 아닌 비구조화된 텍스트-이벤트 표현 병목에서 비롯된다고 주장하는 연구이다. 비구조화된 텍스트를 명시적 이벤트 그래프와 구간 제약으로 변환하고 확률적 불일치 신호(PIS)로 지각 오류와 추론 실패를 격리하는 신경-기호 QA 프레임워크를 제안한다. 올바른 구조적 표현이 제공될 때 시스템은 4,000개 시간 산술 벤치마크에서 완벽한 1.0 정확도를 달성했다.
- •LLM의 복잡한 시간 추론 실패는 추론 능력 결함이 아닌 비구조화된 텍스트-이벤트 표현 병목에서 비롯된다.
- •PIS(확률적 불일치 신호)는 기호 신뢰 구간과 LLM 은닉 상태의 인식론적 불확실성을 통합해 구조적 단절을 탐지한다.
- •올바른 구조 표현 제공 시 4,000개 시간 산술 벤치마크에서 완벽한 1.0 정확도(거짓 양성/음성 0)를 달성했다.
- •광범위한 노이즈 주입 QA 설정에서도 75.1% 정확도를 유지하며 결정론적 단계별 실패 위치 파악이 가능하다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Temporal Reasoning Is Not the Bottleneck: A Probabilistic Inconsistency Framework for Neuro-Symbolic QA
- 1.LLM 시제 추론 실패의 원인이 추론 능력이 아닌 비구조화 텍스트-이벤트 표현에 있음을 발견
- 2.확률적 불일치 신호(PIS)로 지각 오류와 추론 실패를 명시적으로 분리하는 프레임워크 제안
- 3.올바른 구조적 표현 제공 시 시제 산술 벤치마크에서 완벽한 1.0 정확도(4000/4000) 달성
- 4.노이즈 주입 QA 환경에서 75.1% 정확도 유지하며 결정론적 단계별 실패 위치 파악
왜 중요한가?
시제 추론 실패가 LLM의 근본적 한계라는 통념을 반박하고, 표현 구조 정렬로 해결 가능함을 실증해 뉴로심볼릭 AI의 실용적 경로를 제시한다.
본문 미리보기
arXiv:2605.04243v1 Announce Type: new Abstract: Despite significant advances, large language models (LLMs) continue to exhibit brittle performance on complex temporal reasoning tasks. This failure mode is widely attributed to inherent deficits in autoregressive logical deduction. In this paper, we challenge this prevailing narrative, demonstrating that temporal reasoning is not the fundamental bottleneck; rather, the locus of failure lies in unstructured text-to-event representation. We introdu
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

