텍스트-투-이미지(T2I) 모델이 텍스트 렌더링과 시각 구성 능력에서는 발전했지만 안전장치가 이를 따라가지 못하는 틈을 겨냥한 공격이 등장했다. CollageAttack은 맥락에 맞는 장면, 장면에 어울리는 텍스트 캐리어, 공간적으로 흩어놓은 텍스트 조각을 조합해 이미지 자체에서 유해한 의미를 조립하는 단일 프롬프트 블랙박스 공격이다. 여러 오픈웨이트·상업용 T2I 모델 실험에서 공격 성공률 최대 86.0%를 기록하며 기존 최강 기법을 18.5%p 앞섰고, 분산된 텍스트 조각은 생성 후 원래 의도를 재조합해 전달하는 것으로 확인됐다. 개별 요소는 노골적이지 않아도 조합되면 유해해지는 교차 모달 안전 공백을 드러낸다.
- •CollageAttack: 장면, 텍스트 캐리어, 분산 텍스트 조각을 결합한 단일 프롬프트 블랙박스 T2I 공격
- •여러 오픈웨이트·상업용 T2I 모델에서 공격 성공률 최대 86.0%, 최강 베이스라인 대비 +18.5%p
- •분산된 텍스트 조각이 생성 후 재조합되어 원래 유해 의도를 복원
- •개별 요소는 덜 노골적이어도 이미지 구성 시 유해해지는 교차 모달 안전 공백 발견
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
CollageAttack: Exploiting Cross-Modal Alignment Flaws in T2I Models through Spatial Text Composition
- 1.텍스트-이미지(T2I) 모델을 이미지 평면에서 공격하는 단일 프롬프트 블랙박스 탈옥 CollageAttack 제안
- 2.맥락 장면·장면 기반 텍스트 운반체·공간 분산 텍스트 조각을 조합해 유해 의미를 이미지 구성으로 숨김
- 3.공개·상용 T2I 모델 다수에서 공격 성공률 최대 86.0%, 최강 기준선 대비 18.5%p 앞섬
- 4.분산된 텍스트 조각들이 생성 후 재조합돼 의도한 유해 의미를 복원함을 확인
왜 중요한가?
텍스트 자체는 평범해 보여도 이미지로 합성되는 순간 유해 의미가 드러나는 교차양식 안전 공백을 입증해, 프롬프트 수준 필터링만으로는 T2I 안전장치가 불충분함을 보여준다.
언급 프로젝트
본문 미리보기
arXiv:2609.38253v1 Announce Type: new Abstract: Text-to-image (T2I) models have substantially improved in language understanding, in-image text rendering, and visual composition, while their safety mechanisms do not always keep pace with these capabilities. This creates a cross-modal attack surface in which harmful semantics can remain inconspicuous in a serialized prompt yet emerge through image-level composition. We propose CollageAttack, an automated single-prompt black-box jailbreak that sh
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

