이미지와 텍스트 분류기에 대한 적대적 회피 공격의 효과가 모달리티별로 크게 다르다는 것을 재현 가능한 실험으로 보였다. MNIST 소형 CNN은 깨끗한 정확도 98.63%에서 FGSM epsilon 0.30일 때 1.72%, PGD에서는 0.41%까지 급락했고 비트 심도 축소 방어는 손실의 일부만 복구했다. 반면 SMS 스팸으로 미세조정한 DistilBERT(정확도 98.75%)는 문자 치환 등 교란에 대부분 확률 변화가 미미했고 스팸이 햄으로 뒤집힌 사례는 전혀 없었다. MNIST 실험은 명확한 회피 공격 사례인 반면 텍스트 실험은 통제된 강건성 평가에 가까웠으며, 적대적 강건성은 깨끗한 정확도로 추론할 수 없고 반드시 경험적으로 검증해야 한다는 결론이다.
- •MNIST CNN은 FGSM epsilon 0.30에서 정확도가 98.63%에서 1.72%까지 급락하는 강한 취약성 확인
- •PGD 공격은 FGSM보다 더 치명적으로 동일 조건에서 정확도를 0.41%까지 떨어뜨림
- •비트 심도 축소 방어는 손실된 정확도의 일부만 복구하는 데 그침
- •DistilBERT 기반 스팸 분류기는 교란에도 스팸→햄 전환 사례가 전혀 없어 상대적으로 강건
- •적대적 강건성은 모달리티에 따라 크게 달라지므로 반드시 경험적 테스트가 필요하다는 결론
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Evasion Attacks: How Adversarial Noise Bypasses ML Classifiers
- 1.MNIST CNN(정상정확도 98.63%)이 FGSM ε=0.15서 60.20%, ε=0.3서 1.72%로 급락
- 2.PGD는 더 강력해 정확도 32.47%·0.41%까지 하락, 비트심도 축소 방어는 일부만 회복
- 3.DistilBERT 스팸분류기(정확도 98.75%, F1 94.96%)는 텍스트 교란에 상대적으로 견고
- 4.문자치환·공백노이즈 등 교란에도 스팸→정상 전환(flip) 사례는 없음
왜 중요한가?
이미지와 텍스트 분류기의 적대적 취약성이 모달리티에 따라 크게 다르다는 점을 교육적 실험으로 보여, '클린 정확도가 높다고 안전한 것은 아니다'는 점과 모달리티별 맞춤 방어 필요성을 강조한다.
본문 미리보기
arXiv:2610.00136v1 Announce Type: new Abstract: This paper presents a reproducible, educational study of evasion attacks in image classification and text classification. A compact convolutional network trained on MNIST reached 98.63% clean test accuracy and was evaluated under two white-box attacks. Under FGSM, accuracy fell to 60.20% at $\epsilon$ = 0.15 and 1.72% at $\epsilon$ = 0.30; under PGD it fell to 32.47% and 0.41%, and a bit-depth-reduction defense recovered only part of the loss. In
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

