이 논문은 토큰 프루닝, 조기 종료 등 입력 적응형 추론에 의존하는 비전 트랜스포머(ViT)를 겨냥해 정확도는 유지한 채 연산량만 늘리는 적대적 효율 저하 공격을 다룬 서베이다. 보편적 적대적 패치인 SlowFormer와 이미지별 섭동인 DeSparsify라는 두 대표 공격을 A-ViT, ATS, AdaViT 세 가지 토큰 프루닝 프레임워크에 걸쳐 통합·비교한다. GFLOPs, 정확도 손실, 모델의 연산 절감분을 얼마나 빼앗는지 측정하는 공격 성공(AS) 지표로 보고 기준을 표준화했다. 저전력 모바일·임베디드 환경에 흔히 배포되는 만큼, 위험을 완화하면서도 가벼움을 유지하는 대응책 설계가 중요하다고 강조하며, 입력 적응형 최적화가 어떻게 공격면을 만드는지, 어떤 최적화가 가장 취약한지, 현존 방어가 공격 아래서도 효율을 의미 있게 회복시키는지를 세 가지 질문으로 정리한다.
- •SlowFormer(보편 패치)와 DeSparsify(이미지별 섭동) 공격을 통합 비교
- •A-ViT, ATS, AdaViT 세 토큰 프루닝 프레임워크에 걸쳐 평가
- •GFLOPs·정확도 손실·공격 성공(AS) 지표로 보고 기준 표준화
- •저전력 모바일·임베디드 배포 환경에서 경량 방어 설계 필요성 강조
- •AIIoT 2026 채택 논문
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
A Survey of Adversarial Efficiency Degradation for Vision Transformer by Exploiting Input-adaptive Optimization
본문 미리보기
arXiv:2608.05217v1 Announce Type: new Abstract: Vision Transformers (ViTs) increasingly rely on input-adaptive inference, such as token pruning and early halting, to meet energy and latency budgets. This survey examines a recent class of adversarial efficiency degradation attacks that target these mechanisms to increase computation without necessarily degrading accuracy. We unify and compare two representative attacks, SlowFormer (a universal adversarial patch) and DeSparsify (per-image perturb
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:58AI 초안



