연구진이 멀티모달 대형언어모델(MLLM)의 취약점을 자동으로 찾아내는 레드팀 기법 HACA(계층적 원자 조합 공격)를 제안했다. 텍스트-이미지 탈옥 전략 공간을 구조적·의미적·구문적 3단계로 분해하고 텍스트와 이미지 양 모달리티를 아우르는 원자 전략 집합을 구성했다. 6차원 전략 공간을 기반으로 교차모달 결합 플래너가 원자 전략을 선택·조합해 탈옥 명령을 생성하고, 통합 생성 실행기가 이를 실제 공격 지시로 변환한다. 실험 결과 5개 주요 MLLM에 대해 평균 95.48%라는 높은 공격 성공률을 달성했다. 사람이 수작업으로 설계하던 탈옥 전략을 체계적·자동화된 방식으로 대체할 수 있음을 보여준다.
- •텍스트-이미지 탈옥 전략을 구조·의미·구문 3단계로 분해한 원자 전략 공간을 구축했다
- •교차모달 결합 플래너가 전략을 조합하고 실행기가 실제 공격 명령으로 변환한다
- •5개 주요 멀티모달 LLM 대상 평균 95.48%의 공격 성공률을 기록했다
- •사람의 수작업 경험에 의존하지 않는 자동화된 레드팀 프레임워크를 제시했다
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
A Multimodal Automatic Redteaming Evaluation based on Atomic Jailbreak Strategy Decoupling and Combination
본문 미리보기
arXiv:2608.04034v1 Announce Type: new Abstract: Multimodal Large Language Models (MLLMs) have achieved impressive progress in image-text comprehension and generation, yet they remain susceptible to jailbreak attacks that can trigger harmful outputs and pose serious safety concerns. Existing multimodal jailbreak attacks have shown the feasibility of such attacks, but they still face two fundamental challenges: the lack of a atomic multi-modal strategy space, the absence of a concise and efficien
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:57AI 초안



