시각-언어 모델(VLM)의 신뢰성이 어텐션 맵의 선명도보다 히든 상태 기하학·레이어별 마진 형성·희소 후기 레이어 회로에서 더 잘 읽힌다는 점을 실험으로 입증했다. LLaVA-1.5, PaliGemma, Qwen2-VL 3개 오픈 웨이트 VLM 계열에서 어텐션 구조가 정확성의 거의 제로에 가까운 예측 변수임을 밝혔다. 히든 상태 마진(R_pb≥0.95)이 가장 강력한 정적 신뢰성 예측 변수이며, K=10 자기 일관성이 가장 강력한 행동 예측 변수지만 추론 비용이 10배 증가한다. 초기 융합과 후기 융합 아키텍처 간에 신뢰성 분포 방식이 크게 다른 것으로 나타났다.
- •어텐션 맵의 선명도는 VLM 정확성의 거의 제로에 가까운 예측 변수임이 실험으로 입증되었다
- •히든 상태 마진(R_pb≥0.95)이 가장 강력한 정적 신뢰성 예측 변수로 확인되었다
- •K=10 자기 일관성이 가장 강력한 행동 예측 변수이나 추론 비용이 10배 증가한다
- •초기 융합(PaliGemma, Qwen2-VL)과 후기 융합(LLaVA) 아키텍처 간에 신뢰성 분포 방식이 크게 다르다
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Where Reliability Lives in Vision-Language Models: A Mechanistic Study of Attention, Hidden States, and Causal Circuits
- 1.주의 맵 선명도가 VLM 답변 정확도를 거의 예측하지 못함을 R=0.001로 실증함으로써 통념 반증
- 2.숨겨진 상태 기하학과 레이어별 마진 형성이 주의 맵보다 신뢰성을 훨씬 정확히 예측
- 3.LLaVA는 취약한 후기 병목에 집중, PaliGemma·Qwen2-VL은 신뢰성을 광범위하게 분산하는 아키텍처 차이 발견
왜 중요한가?
VLM 신뢰성 평가의 통념을 뒤집고 실제 예측 가능한 신뢰성 지표를 제시하여, 의료·자율주행 등 고위험 배포 환경에서 VLM 모니터링 설계에 중요한 기반을 제공한다.
본문 미리보기
arXiv:2605.08200v1 Announce Type: new Abstract: A pervasive intuition holds that vision-language models (VLMs) are most trustworthy when their attention maps look sharp: concentrated attention on the queried region should imply a confident, calibrated answer. We test this Attention-Confidence Assumption directly. We instrument three open-weight VLM families (LLaVA-1.5, PaliGemma, Qwen2-VL; 3-7B parameters) with a unified mechanistic pipeline -- the VLM Reliability Probe (VRP) -- that compares a
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

