툴을 사용하는 에이전트는 인용과 실행 로그를 함께 제시하지만, 사용자에게 보여진 주장이 실제로 커밋된 실행에서 나온 것이며 인용된 출처가 뒷받침하는지에 대한 핵심 연결고리는 감사되지 않은 채 남는 경우가 많아, 유효한 인용과 유효한 추적 기록이 각각은 형식적으로 문제없어도 서로 다른 주장·행동·실행·출처 버전 사이에서 바꿔치기될 수 있다. 연구팀은 발행된 주장, 정확한 출처 범위, 그 주장을 만든 순서화된 실행 접두부, 해당 실행이 관찰한 출처 버전과 접근 상태를 함께 결속하는 '주장 결속 실행 계약'을 제시한다. 각 영수증은 식별자·오프셋·해시·인용문·도메인 분리된 실행 커밋먼트와 함께, 커밋된 답변이나 주장을 담은 행동 내부에서 주장을 결정론적으로 찾아내는 발행 앵커를 포함하며, 결정론적 무결성 검증기가 의미·과제 라벨이 결합되기 전에 이 결속을 재구성한다. 1280건의 크로스 오브젝트 공격 실험에서 전체 계약은 1275건(99.61%)의 치환을 탐지했으며, 특정 속성을 제거하면 해당 속성의 탐지율이 1.56~6.25%로 급락해 각 속성의 필요성을 입증했다.
- •툴 사용 에이전트의 인용과 실행 로그가 각각 유효해도 주장, 행동, 실행, 출처 버전 간 바꿔치기가 감사되지 않을 수 있다는 문제를 제기.
- •발행된 주장, 출처 범위, 실행 접두부, 출처 버전과 접근 상태를 함께 결속하는 주장 결속 실행 계약을 제안.
- •결정론적 무결성 검증기가 의미와 과제 라벨 결합 전에 이 결속을 재구성해 일곱 가지 독립적으로 테스트 가능한 속성을 노출.
- •1280건 크로스 오브젝트 공격 실험에서 99.61퍼센트 치환 탐지, 속성 제거 시 탐지율이 1.56에서 6.25퍼센트로 급락해 각 속성의 필요성을 확인.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Actions with Receipts: Jointly Binding Claims, Evidence, and Execution for Replayable Tool-Agent Auditing
- 1.도구 사용 에이전트의 답변·인용·실행 로그 간 불일치(치환 공격)를 막는 '주장 고정 실행 계약' 제안
- 2.1280건의 교차 객체 치환 공격 실험에서 1275건(99.61%) 탐지, 핵심 속성 제거 시 탐지율 1.56~6.25%로 급락
- 3.7가지 독립 검증 속성(주장-방출 결합, 출처 결합, 실행순서 결합 등)으로 구성해 각 속성의 기여도를 검증
- 4.독립 평가셋(384쌍)에서 F1 0.8865·오탐율 0.0729, 미학습 실패 유형에서도 0.8679/0.0938 유지
왜 중요한가?
에이전트가 제시하는 인용과 실행 로그가 각각은 '유효'해 보여도 서로 다른 작업에서 가져온 것일 수 있다는 감사 사각지대를 지적하고, 이를 구조적으로 탐지하는 기법을 수치로 검증했다.
본문 미리보기
arXiv:2610.00327v1 Announce Type: new Abstract: Tool-using agents can expose citations and execution logs while leaving a critical association unaudited: whether the claim shown to a user is the claim emitted by the committed execution and supported by the cited source. A valid citation and a valid trace can therefore remain individually well formed while being transplanted across claims, actions, runs, or source versions. We introduce a claim-anchored execution contract that jointly binds the
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

