대형 멀티모달 모델(LMM)이 네이티브 통합 아키텍처로 전환되면서 이미지와 텍스트가 결합해 각 요소를 합친 것보다 더 큰 해악을 만드는 '시너지 위험'을 평가하는 일이 중요해지고 있다. 연구팀은 멀티모달 잠재력이 큰 샘플과 새로 합성한 허위정보 질의 서브셋을 포함한 벤치마크 'UnifiedAttack'을 제시해 크로스모달 시너지로 얻는 유해성 증폭을 측정한다. 식별된 취약점을 검증하기 위해 맥락 내 재스킨화(ICR)와 인지적 계획 주입(CPI)을 결합한 시너지 하이재킹 프레임워크도 제안한다. ICR은 퓨샷 학습으로 적대적 의도를 무해한 가상 포장 속에 감싸 안전 필터를 무력화하고, CPI는 '계획 후 실행' 패러다임을 강제해 시스템이 중립적인 논리 계획에 먼저 전념하게 만들어 일관성 유지 본능을 역이용해 유해한 멀티모달 콘텐츠를 동시에 생성하도록 유도한다. 최신 아키텍처에 대한 광범위한 평가에서 UnifiedAttack은 현대적인 정렬(alignment) 방어를 지속적으로 우회했다.
- •LMM의 네이티브 통합 아키텍처에서 이미지와 텍스트가 결합해 개별 요소보다 더 큰 해악을 만드는 시너지 위험을 평가하는 벤치마크 UnifiedAttack을 제시.
- •멀티모달 잠재력이 큰 샘플과 합성 허위정보 질의 서브셋을 포함해 크로스모달 시너지로 얻는 유해성 증폭을 측정.
- •맥락 내 재스킨화로 안전 필터를 무력화하고 인지적 계획 주입으로 추론 경로를 하이재킹하는 공격 프레임워크를 제안.
- •최신 아키텍처 평가에서 UnifiedAttack이 현대적 정렬 방어를 지속적으로 우회해 구조적 도움성과 논리적 일관성이 무기화될 수 있음을 시사.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
UnifiedAttack: Evaluating the Safety of Large Multimodal Models in Synergistic Harmful Image-Text Generation
- 1.텍스트·이미지가 결합할 때만 발생하는 '시너지 위해성'을 평가하는 벤치마크 'UnifiedAttack' 공개
- 2.무해한 예시로 공격 의도를 감싸 안전필터를 무력화하는 ICR(인컨텍스트 리스키닝) 기법 제안
- 3.'계획 후 실행' 패턴을 악용하는 CPI(인지적 계획 주입) 기법으로 일관성 추구 성향을 무기화
- 4.최신 통합 멀티모달 아키텍처들의 정렬(alignment)을 지속적으로 우회하는 데 성공, 코드 공개
왜 중요한가?
텍스트와 이미지를 동시에 생성하는 통합형 멀티모달 모델이 각 모달리티별로는 안전해 보여도 결합 시 위해성이 증폭될 수 있음을 실증해, 모달리티 간 정합성을 고려한 안전 설계의 필요성을 제기한다.
언급 프로젝트
본문 미리보기
arXiv:2610.00341v1 Announce Type: new Abstract: As Large Multimodal Models (LMMs) transition toward natively unified architectures, evaluating their safety in synergistic harmful image-text generation tasks becomes a critical challenge. Unlike unimodal threats, synergistic risks emerge when text and image modalities are coordinated to produce harm that significantly exceeds their individual components. We introduce UnifiedAttack, a novel benchmark designed to evaluate LMM safety in collaborativ
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

