MAMJ(메타-적응적 멀티모달 탈옥)는 기존 탈옥 공격이 이미지-텍스트 배치나 공격 전략을 고정한 채 콘텐츠만 바꾸던 한계를 넘어, 공격 전략 프롬프트와 공격자 자체의 가중치까지 함께 최적화하는 새로운 방식이다. LLM 기반 비평 모델이 공격 전략을 다듬고, 그룹 단위로 집계한 공격 성공률(ASR) 보상이 공격자 가중치를 업데이트하는 이중 축 구조로 작동한다. MM-SafetyBench 벤치마크에서 GPT-4o, Gemini-3-Pro-Preview, Seed 2.0을 상대로 각각 81.0%, 78.9%, 82.3%의 공격 성공률을 기록해 기존 최강 샘플 단위 기준선보다 최대 24.1%포인트 높은 성능을 보였다. 학습된 공격 전략과 가중치는 재학습 없이 처음 보는 모델에도 그대로 전이되고 대표적 방어 기법에도 여전히 효과적이어서, 최신 비전-언어 모델의 구조적 취약점과 메타 수준 방어의 필요성을 드러낸다.
- •공격 전략 프롬프트(θ)와 공격자 가중치(φ)를 동시에 최적화하는 이중 축 메타-적응 구조 제안
- •MM-SafetyBench에서 GPT-4o·Gemini-3-Pro-Preview·Seed 2.0 대상 공격 성공률 각각 81.0/78.9/82.3% 달성
- •기존 최강 샘플 단위 기준선 대비 최대 24.1%포인트 높은 성능
- •학습된 공격자는 재학습 없이 미지의 모델에 전이되고 대표적 방어 기법도 우회
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Fully Unleashing the Multimodal Attacker: Meta-Adaptive Jailbreaking of Vision-Language Models
- 1.공격 전략과 파라미터를 함께 최적화하는 메타적응형 멀티모달 탈옥 공격 'MAMJ' 제안
- 2.MM-SafetyBench에서 GPT-4o 81.0%, 제미나이3프로 78.9%, Seed 2.0 82.3% 공격성공률 달성
- 3.최고 샘플단위 기존 공격 대비 최대 24.1%p 높은 성공률로 앞서
- 4.재학습 없이 미확인 대상 모델로 전이되고 대표적 방어책에도 여전히 효과적
왜 중요한가?
이미지·텍스트 레이아웃을 고정하지 않고 공격 전략 자체를 학습시키는 접근이 최상위 상용 VLM들에 광범위하게 통하는 것을 보여, 메타 수준 적대자에 대한 방어가 시급함을 경고한다.
본문 미리보기
arXiv:2608.27531v1 Announce Type: new Abstract: The safety of large vision-language models is increasingly stress-tested by multimodal jailbreaks, yet existing attacks remain largely static at the meta level: template-based attacks freeze the image--text layout, while iterative attacks adapt only the image--text content with fixed attack strategies and frozen attacker parameters. We propose Meta-Adaptive Multimodal Jailbreaking (MAMJ), which instead optimizes the attacker itself along two axes:
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
