이 연구는 기존 VLM(비전-언어 모델) 백도어가 하나 또는 소수의 고정된 트리거-타깃 매핑에 국한된다는 한계를 넘어, 단 한 번의 오염 단계로 추론 시점에 공격자가 이전에 본 적 없는 임의의 타깃 캡션을 선택하고 그에 맞는 은밀한 트리거를 즉석에서 합성할 수 있는 '프로그래머블 백도어'를 제시한다. 연구진은 모델이 특정 백도어 패턴을 암기하는 대신 '트리거를 지시문으로 해석'하는 일반적 규칙을 학습하도록 다양한 트리거-캡션 쌍에 노출시키는 휴리스틱 오염 전략과, 임의의 타깃 캡션을 노름 제한 섭동이나 비의미적 패치 형태의 은밀한 시각적 트리거로 매핑하는 특징 공간 스테가노그래피 기법을 결합했다. 실험 결과 이 공격은 높은 임의-임의 캡션 제어 성공률을 보였고 정상 모델 성능을 유지했으며, 기존의 대표적인 백도어 방어 기법들을 우회하는 것으로 나타났다.
- •한 번의 오염으로 추론 시점에 임의의 타깋 캐션을 선택 가능한 '프로그래머블 백도어' 제시
- •휴리스틱 오염 전략으로 '트리거=지시문' 일반 규칙을 학습시켜 특정 패턴 암기를 방지
- •특징 공간 스테가노그래피로 임의 타겟을 은밀한 시각적 트리거로 변환
- •높은 공격 성공률과 정상 성능 유지, 기존 백도어 방어 기법 다수를 우회
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Once Poisoned, Arbitrarily Controlled: A Programmable Backdoor in VLMs
본문 미리보기
arXiv:2608.10959v1 Announce Type: cross Abstract: Existing vision-language model (VLM) backdoors are usually treated as static vulnerabilities: one-to-one and N-to-N attacks bind one or more triggers to a finite set of targets before victim training. This assumption substantially underestimates the threat. We show that a single poisoning phase can implant a programmable backdoor into a VLM, allowing an attacker to choose previously unseen target-caption semantics at inference time and synthesiz
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:23AI 초안



