VERITAS는 CLI 코딩 에이전트를 중심으로 구축된 도메인 불문 범용 과학 연구 재현(replication) 프레임워크다. 논문이나 코드 저장소를 입력하면 논문의 주장을 추출하고, 문제를 해결해 가며 방법론을 실행한 뒤, 실험 결과 증거에 비추어 각 주장을 판정한다. 결과물로 중요도 가중 재현 점수(Replication Score), 적용된 수정의 심각도 등급 로그, 패치된 코드베이스를 반환한다. 컴퓨터과학·사회과학·의학·천체물리학 65편의 논문을 아우르는 CORE-Bench와 ReplicationBench에서 동일 모델·환경의 강력한 Claude Code 베이스라인 2종을 상대로 모든 지표에서 최고 성능을 기록했다. AI가 가속한 논문 출판 속도를 검증 시스템이 따라가지 못하는 상황에서 자동화된 독립 검증의 실용적 도구를 제시한다.
- •벤치마크 전용 파이프라인을 벗어난 최초의 범용 연구 재현 도구를 표방
- •주장 추출 → 방법론 실행(문제 즐석 해결) → 증거 기반 주장 판정의 3단계 파이프라인
- •중요도 가중 재현 점수, 수정 이력 로그, 패치된 코드베이스를 산출
- •CORE-Bench·ReplicationBench 65편 평가에서 Claude Code 베이스라인 2종 대비 전 지표 최고 성능
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
VERITAS: Towards a General-Purpose Replication Tool for Scientific Research
- 1.VERITAS 공개: CLI 코딩 에이전트 기반의 도메인 불문 과학 논문 재현(replication) 자동화 프레임워크
- 2.논문·코드에서 주장 추출→방법론 실행→증거 대조 후 중요도 가중 Replication Score 산출
- 3.CORE-Bench·ReplicationBench 65편(CS·사회과학·의학·천체물리)에서 Claude Code 베이스라인 대비 전 지표 1위
- 4.기존 벤치마크 전용 에이전트와 달리 범용 재현 도구로 설계, 수정 로그와 패치된 코드베이스도 반환
왜 중요한가?
AI가 논문 생산 속도를 높이는 동안 검증 시스템은 뒤처지는 상황에서, 벤치마크 파이프라인에 갇히지 않은 최초의 범용 재현 도구를 제시했다. 느리고 비싼 수동 재현을 코딩 에이전트로 대체해 학술 검증·재현성 위기 대응에 실제 적용 가능한 인프라가 될 수 있다.
본문 미리보기
arXiv:2607.02931v1 Announce Type: new Abstract: AI tools are accelerating scientific publication while the systems that review it struggle to keep up, and independent verification of published research has become both harder and more important. As manual replication is slow and expensive, a growing line of work uses coding agents to automate parts of the process. Existing efforts are largely packaged as benchmarks with companion agents that only run inside the benchmark's own pipeline, and no g
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

