다중모달 대형언어모델(MLLM)이 스크린샷·스캔 문서·다이어그램 같은 시각 입력을 처리할 때, 프롬프트나 이미지 각각은 무해하지만 모델이 요약·번역 같은 무해한 작업을 특정 시각적 대상에 결합하는 순간에만 위험한 행동이 나타나는 새로운 유형의 탈옥이 존재한다는 점을 이 연구는 지적한다. 기존 방어는 프롬프트-이미지 쌍 전체를 심사할 뿐 실제 보안에 중요한 단위인 '접지된 작업-대상 쌍'을 놓쳐 근거화 이후에만 활성화되는 위협에 취약하다. 저자들은 요청된 작업과 참조 유형을 추론하고, OCR과 개방어휘 제안으로 후보 대상을 구성해 근거화한 뒤 명시적 작업-대상 쌍에 대해 안전성을 평가하는 사전생성 안전 게이트 COMIC을 제안했다. 여러 오픈소스 MLLM과 다중모달 탈옥 벤치마크에서 평가한 결과 COMIC은 무해한 유용성과 효율성을 유지하면서 견고성을 일관되게 향상시켰다.
- •무해한 프롬프트·이미지가 결합해서만 위험해지는 '참조 의존적' 탈옥 유형 규명
- •기존 방어는 프롬프트-이미지 쌍 전체만 심사, 접지된 작업-대상 쌍은 놓침
- •COMIC은 작업·참조 추론 후 OCR·개방어휘로 후보 대상을 근거화해 안전성 평가
- •여러 MLLM·벤치마크에서 무해한 유용성 유지하며 견고성 일관되게 향상
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
COMIC: Reference-Aware Safety Gating for Multimodal Large Language Models
- 1.멀티모달 LLM에서 프롬프트와 이미지 각각은 무해해도 특정 시각 대상과 결합할 때만 위험해지는 탈옥 유형을 지적
- 2.기존 방어는 프롬프트-이미지 쌍 전체를 판단해 그라운딩 이후에만 활성화되는 위험을 놓침
- 3.COMIC은 요청 작업과 참조 유형을 추론하고 OCR·개방어휘 탐지로 후보 대상을 구성해 안전성 평가
- 4.모호한 경우 최대위험 집계와 품질 기반 라우팅을 결합해 보수적으로 차단 여부 결정
왜 중요한가?
이미지 속 특정 텍스트나 영역을 지칭하는 방식으로 우회하는 새로운 멀티모달 탈옥 유형에 대응하는 방어 기법으로, 스크린샷·문서 기반 AI 어시스턴트의 안전성 강화에 실질적으로 기여할 수 있다.
언급 프로젝트
본문 미리보기
arXiv:2608.17234v1 Announce Type: new Abstract: Multimodal large language models (MLLMs) are increasingly used to interact with screenshots, scanned documents, diagrams, and other visually grounded inputs. This shift introduces a new safety risk: in many multimodal jailbreaks, neither the prompt nor the image is harmful in isolation. Unsafe behavior emerges only when the model binds an apparently benign operation, such as summarizing, translating, or following, to a localized visual target. Thi
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:02AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
