이 연구는 배포 후 입력이 적대적으로 패치됐는지 모르는 상황에서, 기존 스무딩 기반 방어는 정확도를 크게 떨어뜨리고 마스킹 기반 방어는 패치된 입력이 반환한 레이블의 양성 여부를 검증하지 못한다는 이중 한계를 지적한다. 이를 동시에 해결하는 최초의 마스킹 기반 인증 복구 방어기 MRCert를 제안하는데, 양성·패치 입력에 공통 조건을 적용하던 기존 방식과 달리 두 유형별로 필요한 속성을 추론하고 새로운 유형별 레이블 복구·인증 함수 쌍으로 레이블 양성을 공식적으로 검증한다. 스무딩으로 인한 정확도 저하 없이, ImageNet에서 패치 크기 16픽셀 기준 35.1%의 적대적 인증 정확도를 달성했으며, 이는 기존 최고 기법인 PatchCURE가 완전히 실패하는 조건에서 거둔 결과다.
- •기존 스무땅·마스킹 방어의 정확도 저하·양성 검증 실패 한계를 동시에 국믵한 MRCert 제안
- •양성·패지 입력별로 필요 속성을 다르게 추뇨하는 유형별 믵늤 설지
- •ImageNet 패지 16픽셀에서 35.1% 적대적 인증 정확도 달성
- •동일 조거에서 기존 최고 기법 PatchCURE는 완전히 실패
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
MRCert: Towards Post-deployment Patch Robustness Certification for Adversarially Patched Samples via Type-specific Masking
- 1.마스킹 기반으로 정확도 저하 없이 적대적 패치 입력 라벨 양성성까지 검증하는 최초 방어 MRCert 제안
- 2.정상·패치 입력별 특화 속성을 추론해 라벨 복원·인증 함수를 타입별로 다르게 설계
- 3.ImageNet, 패치 16픽셀 기준 적대적 인증 정확도 35.1% 달성
- 4.기존 SOTA인 PatchCURE는 같은 조건에서 완전히 실패
왜 중요한가?
스무딩 기반 방어가 정확도를 크게 희생하고 마스킹 기반 방어는 라벨 양성성을 검증하지 못하던 딜레마를, 두 목표를 동시에 달성하는 방식으로 해결해 배포 후 적대적 패치 방어의 실용성을 높인다.
언급 프로젝트
본문 미리보기
arXiv:2610.10617v1 Announce Type: new Abstract: In post-deployment time, inputs to deep learning models may or may not be adversarially patched. Patch robustness certification on such inputs within a patch bound can verify their label benignity and should retain high prediction accuracy. However, existing smoothing-based and masking-based recovery defenders cannot achieve both simultaneously: they degrade the prediction accuracy much and cannot verify the benignity of the returned label of an a
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안



![[Tech Insight] "AI 해킹, 보안 문제로만 보는 건 위험한 착각"](https://cdn.digitaltoday.co.kr/news/photo/202610/706229_653947_485.jpg)