이 연구는 비전-언어 모델이 답변을 그대로 유지하면서 이미지만 조작하는 화이트박스 공격 아래에서 신뢰도(confidence) 출력이 얼마나 조작 가능한지 분석했다. 4개 모델·3개 VQA 벤치마크·5개 배포된 신뢰도 채널·2개 방어 기법을 조합한 84개 사례 전부에서 균일 진폭 기준을 무너뜨리는 공격이 가능했고, 정답 라벨을 인지한 협조 공격은 배포 채널 60개 사례 전부에서 판별력을 답변 정확도 하한(0.617) 이하로 떨어뜨렸다. 테스트한 4개 방어 기법 중 어느 것도 견고한 대안이 되지 못했으며, 신뢰도 게이트 시뮬레이션에서는 하나의 협조 공격이 기존에 거부됐던 오답의 최대 84.8%를 통과시켰다. 배포된 신뢰도 기반 감독 시스템이 적대적 조작에 취약할 수 있음을 실증한 결과다.
- •답변을 유지한 채 이미지만 바꾸는 공격으로 신뢰도 조작 가능성 검증
- •84개 추정기 조합 전부에서 균일 진폭 기준이 무너짐을 확인
- •정답 인지 협조 공격은 60개 배포 채널 전부에서 판별력을 정확도 하한 이하로 저하
- •신뢰도 게이트 시뮬레이션에서 거부된 오답의 최대 84.8%가 통과
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Model Confidence Under Answer-Preserving Attacks: An Informativeness-Manipulability Frontier
본문 미리보기
arXiv:2608.06571v1 Announce Type: new Abstract: Deployed vision-language systems often gate their answers on confidence, making confidence robustness relevant to oversight. We study confidence readouts under white-box, image-only attacks constrained to preserve the generated answer byte-identically. Under a reachability assumption, an unmovable readout cannot outperform the answer-string accuracy prior, whose pooled value is 0.617. Independently of that assumption, a uniform amplitude certifica
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:58AI 초안



