연구진이 멀티모달 대조학습(MCL) 모델의 백도어 공격 탐지를 위한 새로운 프레임워크 CASCADE를 제안했다. 기존 CLIPScore 기반 탐지 방식은 정상 쌍과 오염된 쌍의 점수 분포가 크게 겹치고 고정 임계값이 모호한 샘플에 통계적 보장을 제공하지 못한다는 두 가지 한계가 있었다. CASCADE는 컨포멀 예측(CP)을 도입해 비순응 점수를 통해 오염된 이미지-캡션 쌍 탐지에 증명 가능한 신뢰 구간을 부여하는 2단계(coarse-to-fine) 탐지 방식이다. 대규모 CC3M 데이터셋 실험에서 평균 100% 재현율(TPR) 기준 오탐률(FPR) 5.79%, 평균 AUROC 0.9867을 달성했으며 적응형 공격에도 효과를 유지했다. 통계적 보장이 부족했던 기존 백도어 탐지의 신뢰성 문제를 해결하는 실용적 접근을 제시한다.
- •기존 CLIPScore 기반 탐지의 분포 중첩·고정 임계값 문제를 지적했다
- •컴포머 예측(CP)으로 오염 쌍 탐지에 증명 가능한 신뢰 구간을 부여하는 2단계 프레임워크 CASCADE를 제안했다
- •대규모 CC3M 데이터셋에서 TPR 100% 기준 FPR 5.79%, AUROC 0.9867을 기록했다
- •적응형(adaptive) 공격에 대해서도 탐지 효과가 유지됨을 확인했다
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
When Modalities Fail to Tango: Conformal Backdoor Detection in Multimodal Contrastive Learning
본문 미리보기
arXiv:2608.04052v1 Announce Type: new Abstract: Backdoor attacks in multimodal contrastive learning (MCL) have garnered growing attention in recent years, as many downstream tasks critically depend on pre-trained MCL models. Existing detection-based defenses predominantly rely on the CLIPScore metric, under the assumption that poisoned pairs exhibit lower semantic similarity between the image and the caption. However, we identify two critical flaws remaining in existing methods: (1) the substan
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:57AI 초안



