TREAT는 대형언어모델이 동치 변환된 수학적 표현으로부터 원래의 정리(theorem) 정체성을 인식할 수 있는지 평가하는 벤치마크다. 정리 텍스트를 바꿔 쓰는 대신 잔차방정식, 증인 진술, 최적화 항등식, 집합 관계, 연산자 형태, 증명 중간 특성화 등으로 정리 조건 자체의 수학적 형식을 변형해 737개의 정리 정체성과 2만 9,480개의 변환된 행으로 구성된 코퍼스를 구축했다. 테스트 패널에서 최고 성능 모델조차 정답 정리를 60.73%만 복원했으며, 기권·오탐지·형식 오류 등 다양한 실패 양상이 나타났다. 이는 형식적 지식이 표현 방식의 동치 변환에도 불구하고 취약해질 수 있음을 보여주며, 안정적 대상 객체와 명시적 동치 관계가 필요한 도메인 전반에 시사점을 준다.
- •동치 변환된 수학 표현에서 정리 정체성 인식 능력을 평가하는 벤치마크 TREAT
- •737개 정리, 2만 9,480개 변환 행으로 구성된 대규모 코퍼스 구축
- •최고 성능 모델도 정답 복원율 60.73%에 그침
- •기권·오탐지·형식오류 등 다양한 실패 양상, 형식지식이 표현변환에 취약함을 시사
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
TREAT: Evaluating Access to Formal Knowledge across Equivalent Mathematical Representations
본문 미리보기
arXiv:2608.07540v1 Announce Type: new Abstract: AI systems increasingly operate between flexible input representations and formal objects used by downstream tools. A key challenge is recognizing when an unfamiliar formulation denotes a known formal object. We study this challenge through theorem recognition: given an equivalence-preserving transformation of a theorem condition, a model must recover the theorem identity associated with the standard statement. We introduce TREAT, a benchmark for
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:39AI 초안

