연구진은 수학·코드·형식논리처럼 검증 가능한 보상이 있는 영역에서의 LLM 추론 발전이, 불완전하고 수정 가능한 정보 아래서 이뤄지는 '반박 가능 추론(defeasible reasoning)'에도 적용되는지 확인하기 위해 ArgGYM을 제안했다. ArgGYM은 반박 가능 추론을 12개 과제로 분해하고, 기호적 논증 엔진으로 모델 출력을 평가할 형식적 상태를 계산하는 절차적 벤치마크이자 RLVR(검증 가능 보상 강화학습) 호환 학습 환경이다. 15가지 커리큘럼 구성, 2가지 논증 선호 순서, 2가지 집합 순서를 반영한 1,440개의 검증된 고정 벤치마크 인스턴스를 포함한다. 프론티어 모델과 오픈웨이트 모델은 완전한 과제를 풀지 않고도 구조화된 답의 상당 부분을 복원할 수 있었지만, 의존관계가 길고 구조가 복잡해지는 후반 커리큘럼에서는 성능이 하락했다.
- •ArgGYM은 '반박 가능 추론'을 평가하는 절차적 밐용케이땴왔얘 RLVR 학연 환거일
- •반박 가능 추론을 12개 과제로 분룠, 기호적 뇌송엔진으로 형식적 평가 수행
- •1,440개 검증된 고정 밐용케이땴왔얘 인스탄스, 15개 커리큘떤 구성 포함
- •프놨트즈·오픈웨이트 모뎌 모두 완전한 과제 해거 없이도 벀사 답안 복원 가능
- •의존관게가 길고 구조가 뿔탁맸리 후반 커리큘떤에서 성과 하낙 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
ArgGYM: A Procedural, Engine-Verified Benchmark for Structured Defeasible Reasoning
- 1.ArgGYM은 반박 가능한 추론을 평가하는 절차적 벤치마크·RLVR 훈련 환경
- 2.12개 과제, 기호적 논증 엔진으로 모델 출력 정합성을 형식적으로 채점
- 3.1,440개 검증된 인스턴스, 15개 커리큘럼·선호/집합 순서 조합으로 구성
- 4.프론티어·오픈웨이트 모델 모두 의존관계 긴 후반 과제에서 성능 급락
왜 중요한가?
수학·코드 등 자동 검증 가능한 영역을 넘어, 증거가 번복되는 실세계형 추론을 측정할 표준 벤치마크가 드물었다는 점에서 RLVR 훈련·평가에 재사용 가능한 틀을 제공한다.
언급 프로젝트
본문 미리보기
arXiv:2609.38409v1 Announce Type: new Abstract: Recent progress in large language model reasoning has been driven by benchmarks and reinforcement learning environments with automatically verifiable rewards, particularly in mathematics, code, and formal logic. These settings make model accuracy easier to evaluate and optimize, but it remains unclear how far success under fixed problem specifications and stable evaluation criteria transfers to reasoning outside such domains. Real-world reasoning
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

