이 논문은 생성형 OCR 비전-언어모델인 Deep-OCR(DeepSeek-OCR)을 대상으로 한 최초의 순수 블랙박스 적대적 공격을 제시한다. 그래디언트나 로짓 등 모델 내부 정보 없이 디코딩된 문자열만 조회 가능한 조건에서, 시퀀스 유사도로 정의한 스칼라 손실을 최소화하는 제로차 최적화 문제로 공격을 재구성하고, 이미지 차원과 무관한 쿼리 비용을 갖는 무작위 방향 유한차분법으로 그래디언트를 추정했다. Adam 업데이트와 ℓ∞ 투영을 적용해 눈에 띄지 않는 미세 섭동만으로 반복 출력, 절단, 프롬프트 유출 등 심각한 디코더 오류를 유발할 수 있음을 예비 실험으로 검증했다. 다만 목표 지향적(targeted) 재작성 공격은 목표 없는 성능 저하 공격보다 훨씬 어려워, 관련 성공 여부는 사전 등록된 평가가 끝날 때까지 단정하지 않는다고 밝혔다.
- •생성형 OCR VLM Deep-OCR을 대상으로 한 최초의 순수 블랙박스 적대적 공격 제시
- •문자열 출력만 조회 가능한 상황을 제로차 최적화 문제로 재구성, 이미지 크기와 무관한 쿼리 비용으로 그래디언트 추정
- •이미지를 거의 변형시키지 않고도 반복, 절단, 프롬프트 유출 등 심각한 디코더 오류 유발
- •목표 지향적 재작성 공격은 비목표 성능 저하보다 난이도가 높아 성공 단정을 유보
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Adversarial Attacks on Deep OCR Systems
본문 미리보기
arXiv:2608.07636v1 Announce Type: new Abstract: Deep-OCR (DeepSeek-OCR) advances document recognition by treating the visual modality as an optical compression medium, enabling long-context OCR at low token cost. However, its increased complexity may introduce new security vulnerabilities. In this paper, we present, to the best of our knowledge, the first pure black-box adversarial attack against a generative OCR vision-language model, where only the decoded string can be queried and no gradien
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:59AI 초안



