FlowGuard는 멀티모달 LLM 내부의 교차 모달 일관성을 감시해 악의적 입력을 탐지하는 경량 추론 시점 방어 기법이다. 정상 입력은 텍스트 전용 추론과 비전 전용 추론이 서로 양립하는 예측을 만들어 융합 시 안정되지만, 공격은 이 일관성을 무너뜨린다는 관찰에서 출발한다. 부분 정보 분해(Partial Information Decomposition)에서 착안한 FlowVector로 모달 간 중복성·시너지·특정 모달 우세를 정량화하고, 정상 데이터만으로 학습한 단일 클래스 분류 문제로 푼다. 처음 보는 공격에 대해 공격 성공률을 90% 초과에서 15% 미만으로 낮추면서 유용성 손실은 3% 미만, 지연은 최대 6배 감소했다. 입력·출력만 검사하던 기존 방어의 취약성과 비용 문제를 내부 융합 과정 관측으로 우회했다.
- •공격자는 악의적 의도를 여러 모달리티에 분산해 단일 모달리티 방어를 우회할 수 있다는 문제에서 출발한다.
- •스칼라 신뢰도 대신 PID 기반 FlowVector로 중복성·시너지·모달리티 우세를 정량화한다.
- •정상 데이터만으로 학습하는 단일 클래스 분류 설정이라 공격 샘플 보유가 필요 없다.
- •미지 공격의 공격 성공률을 90% 초과에서 15% 미만으로 낮췤다.
- •유용성 손실은 3% 미만, 지연은 최대 6배 감소해 실서빙 적용이 가능하다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Securing Multimodal AI through Internal Information Decomposition
본문 미리보기
arXiv:2607.21600v1 Announce Type: new Abstract: Multimodal large language models introduce attack surfaces absent in unimodal systems: adversaries can distribute malicious intent across modalities to evade unimodal safeguards. This motivates using cross-modal consistency as a detection signal rather than inspecting each modality in isolation. Our key observation is that benign inputs induce compatible predictive behavior from text-only and vision-only reasoning that stabilizes when fused, where
전체 내용이 궁금하다면?
원문을 직접 읽어보세요