이 연구는 AI 에이전트가 근거를 제대로 확인하지 않고 주장을 작성하는 문제를 해결하기 위해 각 주장에 증거 패킷을 짝짓고 지지 관계를 판정해 근거가 부족하거나 상충하는 주장을 저자에게 되돌려 보내는 '증거-원장(evidence-ledger) 판정' 워크플로를 제안한다. AVeriTeC, CLIMATE-FEVER, SciFact에서 수집한 독립적 외부 라벨 기반의 2335행 블라인드 벤치마크로 평가한 결과, 에이전트 증거-원장 방식은 관계 정확도 0.676과 매크로 F1 0.601을 기록해 최고 비에이전트 기준선의 정확도 0.383, 매크로 F1 0.303을 크게 앞섰다. 또한 상충·근거누락·혼재 증거로 라벨링된 1435개 주장 중 1270개를 적절히 반송했고, 지지되는 900개 주장 중 295개만 반송해 균형을 보였다. 이는 이질적인 증거 패킷을 AI 지원 글쓰기를 위한 감사 가능한 추적 계층으로 전환할 수 있음을 보여준다.
- •주장-증거를 짝짓고 지지 관계를 판정해 저자에게 되돌리는 '증거-원장 판정' 워크플로 제안
- •AVeriTeC·CLIMATE-FEVER·SciFact 기반 2335행 블라인드 벤치마크로 평가
- •관계 정확도 0.676, 매크로 F1 0.601로 최고 비에이전트 기준선(0.383/0.303) 크게 상회
- •상충·누락·혼재 증거 주장 1435개 중 1270개 정확히 반송, 지지 주장은 과반송 억제
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Evidence-Ledger Adjudication for Claim-Evidence Traceability
본문 미리보기
arXiv:2607.26512v1 Announce Type: new Abstract: AI agents can draft claims faster than authors can check whether the cited or retrieved evidence supports them. We study evidence-ledger adjudication: a claim-evidence traceability workflow that pairs each claim with an evidence packet, assigns a support relation, and routes unsupported, contradicted, or mixed-evidence claims back to the author. The empirical core is a 2,335-row blind benchmark built from independent external labels in AVeriTeC, C
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:49AI 초안

