연구진은 텍스트-이미지 생성의 학습 없는(training-free) 안전장치가 흔히 사용하는 '전역 위험 방향·독성 부분공간' 가정을 기하학적으로 분석해, 압축된 위험 부분공간은 다양한 위험 의미를 포괄하지 못하고 넓게 집계할수록 안전에 가까운 정상 프롬프트를 왜곡한다는 '포괄성-선택성 트레이드오프'를 밝혔다. 이에 대한 대안으로 프롬프트별 반사실적 보정을 수행하는 학습 없는 안전장치 'CALM(Counterfactual Adaptive Local Modulation)'을 제안했으며, 위험-정상 매칭 앵커를 이용해 각 프롬프트를 해당 위험 범주로 라우팅하고 위반 토큰 표현만 최소한으로 안전 방향으로 수정한다. 광범위한 평가에서 CALM은 전역 제거 방식보다 정상 프롬프트의 유용성을 유지하면서도 위험 콘텐츠 억제 성능을 크게 개선했다.
- •전역 위험 방향/부분공간 방식의 '포괄성-선택성 트레이드오프'를 기하학적으로 입증
- •위험-정상 매칭 앵커로 프롬프트를 위험 범주에 라우팅하는 프롬프트별 보정 방식 CALM 제안
- •위반 토큰 표현만 최소 수정하고 위험 방향 성분을 억제하는 학습 없는(training-free) 접근
- •전역 제거 대비 정상 프롬프트 유용성 유지와 위험 콘텐츠 억제를 동시에 개선
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Keep It CALM: Analyzing the Limits of Global Unsafety in Text-to-Image Generation
- 1.텍스트-이미지 생성의 안전장치가 쓰는 '전역 비도덕 방향' 가정을 기하학적으로 분석해 한계를 밝힘
- 2.비도덕 서브스페이스를 좁게 잡으면 다양한 위험 표현을 못 걸러내고, 넓게 잡으면 정상 프롬프트까지 왜곡되는 트레이드오프를 발견
- 3.CALM은 프롬프트별로 해당하는 위험 카테고리만 골라 토큰 표현을 최소한으로 수정하는 학습 없는 방법
- 4.위험 콘텐츠 억제력은 높이면서 정상 프롬프트의 품질 손상은 줄이는 결과를 보임
왜 중요한가?
하나의 전역 안전 신호로 모든 프롬프트를 거르던 기존 방식의 구조적 약점을 짚고, 프롬프트별 맞춤 보정이 안전성과 사용성을 모두 지키는 대안이 될 수 있음을 보여준다.
언급 프로젝트
본문 미리보기
arXiv:2610.02300v1 Announce Type: new Abstract: Training-free safeguards for text-to-image generation often rely on a reusable safety signal, such as an unsafe direction or global toxic subspace, applied broadly across prompts. We provide a controlled geometric analysis of this global-unsafety assumption and reveal a consistent coverage-selectivity trade-off: compact unsafe subspaces fail to cover heterogeneous unsafe semantics, whereas broader aggregation increasingly distorts safety-adjacent
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

