이 논문은 SHAP·LIME 같은 설명가능AI(XAI) 기법에 대한 제3자 감사인을 무조건 신뢰하는 기존 관행의 허점을 지적하며, 감사인이 출력 셔플링이나 분포 외(OOD) 스캐폴딩 등 조작 공격으로 모델 편향을 은폐한 '페어워시' 설명을 만들 수 있음을 근거로 제로트러스트 방어 프레임워크 ExplainGuard를 제안했다. XAI 설명 공급망에 정책결정지점(PDP)을 두어 행동지문 기반 자산 무결성 검증, 공리적 일관성 검사로 수학적으로 불가능한 설명 배제, 순위 안정성 기반 특성 충실도 검증이라는 세 축을 설명 공개 전에 강제한다. 이를 통해 '감사인은 신뢰할 수 있다'는 암묵적 가정을 '검증 후 신뢰'라는 지속적 검증 방식으로 대체하고, 최신 설명 조작 공격을 효과적으로 무력화하면서도 계산 오버헤드는 최소화했다.
- •SHAP·LIME 등 XAI 설명의 제3자 감사인을 무조건 신뢰하는 기존 관행이 조작 공격에 취약함을 지적
- •제로트러스트 아키텍처 기반 방어 프레임워크 ExplainGuard 제안, 설명 공급망에 정책결정지점(PDP) 도입
- •행동지문 자산검증·공리적 일관성검사·순위안정성 특성검증 3대 축을 설명 공개 전 강제
- •'감사인 신뢰' 가정을 '검증 후 신뢰'로 전환, 최소 오버헤드로 최신 설명조작 공격 무력화
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
ExplainGuard: A Zero Trust Framework for Post-Hoc Explanation Integrity Guarantees in Blackbox XAI Models
- 1.SHAP·LIME 등 XAI 설명을 조작하는 '공정성 세탁' 공격에 대응하는 제로트러스트 방어 프레임워크 ExplainGuard 제안
- 2.감사자를 무조건 신뢰하던 관행을 정책결정지점(PDP)의 '검증 후 신뢰' 구조로 대체
- 3.행동 지문으로 모델 치환을 탐지하는 자산 무결성 검증을 3대 축 중 하나로 도입
- 4.공리적 일관성 검사(의미적 타당성)와 순위 안정성 기반 특성 충실도 검증을 나머지 두 축으로 결합
왜 중요한가?
규제·신뢰 목적으로 쓰이는 XAI 설명 자체가 출력 셔플링·OOD 스캐폴딩 같은 조작 공격에 취약하다는 점을 짚고, 감사 과정을 검증 가능한 연산으로 전환해 XAI 기반 컴플라이언스의 신뢰성을 구조적으로 강화한다.
본문 미리보기
arXiv:2608.21803v1 Announce Type: new Abstract: As machine learning (ML) models are increasingly deployed in high-stakes environments, explainable AI (XAI) methods like SHAP and LIME have become essential for regulatory compliance and trust. However, the current auditing paradigm relies on an implicit "chain of trust" where third-party auditors are assumed to be trusted. Recent research demonstrates that this assumption is flawed and adversarial auditors can manipulate XAI explanations through
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
