멀티모달 에이전트에서 환각이 단순 답변 품질 오류를 넘어 권한 승인 실패로 이어지는 문제를 형식화했다. ECA(증거 담지 멀티모달 에이전트)는 도구 호출의 행동-핵심 술어를 분해해 DOM/OCR/AX 검증기로 타입 지정 인증서를 획득하고, 결정론적 게이트가 인증서가 지지하는 권한만 부여한다. 1,900건 레드팀 공격에서 4단계 강화 후 게이트 우회율을 15%에서 1.3%로 감소시켰고, 200개 엔드투엔드 파이프라인에서 안전하지 않은 행동 발생률 0%를 달성했다.
- •환각이 행동 인가 실패로 이어지는 HACR 실패 모드 형식화, 순진한 에이전트의 경우 100% 발생
- •ECA는 도구 호출을 술어로 분해하고 외부 검증기 인증서로만 권한을 부여하는 아키텍처
- •1,900건 레드팀 공격에서 4단계 강화 후 게이트 우회율 15% → 1.3%로 대폭 감소
- •200개 태스크 파이프라인에서 안전하지 않은 행동률 0% 달성(Wilson 95% 상한 2.67%)
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Hallucination as Exploit: Evidence-Carrying Multimodal Agents
- 1.멀티모달 에이전트 환각이 인증 실패(행동 권한 취득)로 이어지는 취약점을 ECA 아키텍처로 해결
- 2.DOM/OCR/AX 검증기에서 타입드 인증서를 발급받아 에이전트 행동을 결정론적으로 제어
- 3.200개 태스크 파이프라인에서 비안전 행동 0% 달성, 게이트 우회율 15%→1.3% 감소
왜 중요한가?
AI 에이전트가 스크린샷과 문서를 분석해 실제 행동을 취하는 환경에서 환각 기반 보안 취약점을 체계적으로 차단하는 실용적 프레임워크다.
언급 프로젝트
본문 미리보기
arXiv:2605.19192v1 Announce Type: new Abstract: Multimodal agents use screenshots, documents, and webpages to choose tool calls. When a false visual claim triggers a click, email, extraction, or transfer, hallucination becomes an authorization failure rather than an answer-quality error. We formalize this failure mode as hallucination-to-action conversion: an unsupported perceptual claim supplies the precondition that makes a privileged action appear permitted. We propose evidence-carrying mult
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

