DiSCO는 텍스트-이미지 생성 모델이 안전해 보이는 프롬프트에서도 유해 콘텐츠를 만드는 '양성적 적대(benign adversarial)' 문제를 막는 블랙박스 방어 기법이다. 모델 재학습이나 내부 접근 없이 프롬프트 수준에서만 작동하며, 대상 모델이 직접 생성한 안전·비안전 이미지 풀을 대조 점수화해 빔서치로 접미사를 확장하고, 안전한 결과가 나올 때까지 반복 피드백을 적용한다. I2P 벤치마크에서 여러 레드팀 공격에 대해 무방비 모델과 기존 방어 모델 각각의 공격 성공률(ASR)을 37.7%, 25.13% 낮추면서도 이미지의 의미적 충실도와 일관성은 유지했다. 모델 구조에 무관하게 어떤 텍스트-이미지 시스템에도 그대로 적용 가능한 플러그인 방식이다.
- •안전해 보이지만 유해 콘텐츠를 유발하는 '양성적 적대' 프롬프트 문제 해결
- •모델 재학습·내부 접근 없이 프롬프트 수준에서만 작동하는 블랙박스 방어
- •I2P 벤치마크서 공격 성공률을 무방비 모델 37.7%, 기존 방어 모델 25.13% 감소
- •이미지 의미적 충실도·일관성을 유지하며 모든 텍스트-이미지 모델에 적용 가능
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
DiSCO: Defending text-to-image generation through distribution-guided contrastive prompt optimization
- 1.DiSCO 제안, 모델 수정 없이 프롬프트 단계에서만 동작하는 제로샷 블랙박스 text-to-image 방어 모듈
- 2.언어적으로는 안전하지만 유해 콘텐츠를 유발하는 '양성 적대적' 문제를 새롭게 정의
- 3.안전·위험 이미지 풀 대비 대조 점수 기반 빔서치로 접미어를 반복 확장해 안전 콘텐츠 유도
- 4.I2P 벤치마크 멀티 레드팀 공격에서 무방어/방어 모델 각각 공격성공률(ASR) 37.7%, 25.13% 감소
왜 중요한가?
기존 방어가 화이트박스 접근이나 언어적 위험 탐지에 의존해 독점 모델이나 언어적으로 안전해 보이는 프롬프트에는 취약했던 반면, DiSCO는 모델 내부 접근 없이 플러그앤플레이로 어떤 text-to-image 시스템에도 적용 가능하다는 점에서 실용성이 크다.
본문 미리보기
arXiv:2608.17067v1 Announce Type: new Abstract: As text-to-image generative models advance, they raise critical safety concerns, particularly the generation of Not-Safe-For-Work (NSFW) content such as violence and nudity, further exacerbated by red-teaming adversarial attacks. Existing defenses predominantly operate under white-box assumptions, relying on text encoder optimization, weight editing, or inference-time intervention, and fundamentally cannot scale to proprietary models. Black-box al
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:59AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
