이 논문은 에이전트 평가에서 보고된 주장이 남은 증거로부터 재계산 가능한지(충분성)와 기록이 약속된 실험 전체를 포괄하는지(커버리지)를 검증하는 ClaimReceipt를 제안한다. 이는 유형화된 트랜잭션 증거를 서명된 실험 매니페스트에 결속시켜 각 주장에 대해 PASS·INVALID·INCONCLUSIVE 판정을 내리는 클레임 단위 검증기다. 1,392건의 과거 거래 기록에 대해 CR-2 검증기는 5개의 수작업 감사 판정을 모두 재현했고, 600개 결정론적 기록과 792개 사후생성 기록을 정확히 재현했으며, 11개 의미론적 결함을 모두 탐지하면서 오탐은 0/8이었다. 이어진 실전 CR-3 실험에서는 터미널 영수증 하나를 누락시키면 INCONCLUSIVE_COVERAGE로 판정되어 사전 예측과 정확히 일치했다. 증거 계측 오버헤드는 모델 추론 시간의 0.021%, 거래당 9.9KB에 불과하다.
- •ClaimReceipt는 에이전트 평가 주장의 재계산 충분성과 실험 커버리지를 검증하는 클레임 단위 시스템이다.
- •1,392건 거래 기록에서 CR-2 검증기가 5개 수작업 감사 판정을 전부 재현하고 11개 의미 결함을 오탐 0건으로 탐지했다.
- •프로스페티브 CR-3 실험에서 증거 누락 시 INCONCLUSIVE 판정이 사전 예측과 정확히 일치했다.
- •계측 오버헤드는 추론 시간의 0.021%, 거래당 9.9KB로 매우 낮다.
- •저자들은 자체 명세조차 독립적 독자에게 아직 완전히 명확하지 않다고 지적한다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
ClaimReceipt: Verifying Evidence Sufficiency and Coverage in Agent Evaluations
- 1.ClaimReceipt: 에이전트 평가 주장의 재현성(충분성)과 실험 커버리지를 검증하는 명세·검증기 제안
- 2.CR-2 검증기가 1,392건 실기록에서 수작업 감사 판정 5건 모두 재현, 기록 전체 재생 성공
- 3.13개 필드 그룹 모두 비중복 확인, 11/11 의미 오류 탐지에 오탐 0/8
- 4.영수증 계측 오버헤드는 추론 시간의 0.021%, 거래당 9.9KB에 불과
왜 중요한가?
에이전트 평가 결과를 사후 검증 가능한 형태로 남겨, 신뢰할 수 없는 로그나 벤치마크 주장의 신빙성 문제를 구조적으로 해결하는 감사 인프라를 제시한다.
언급 프로젝트
본문 미리보기
arXiv:2609.01992v1 Announce Type: new Abstract: Agent evaluations face two distinct evidentiary questions: whether a reported claim is recomputable from retained evidence (sufficiency), and whether the retained records cover the committed experiment set (coverage). Generic logs and hash-linked transcripts answer neither reliably. We introduce ClaimReceipt, a claim-relative receipt specification and selective verifier that binds typed transaction evidence to a signed experiment manifest and retu
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
