비전-언어모델(VLM)이 목표 지향적 언어를 만났을 때 시각 표현을 어떻게 재코딩하는지는 잘 규명되지 않았으며, 기존 연구는 대체로 VLM의 시각 표현을 언어가 조작하는 정적인 정보 저장소로 취급해왔다. 연구진은 언어가 유도하는 시각 표현 재코딩의 두 가지 구체적 사례를 제시했다. 첫째, 자연어 프롬프트 아래 어떤 객체가 목표와 관련 있는지를 나타내는 추상적 '참조 표현'을 발견하고, 이에 대응하는 대조적 스티어링 벡터가 모델 예측에 인과적으로 관여함을 보였으며 이 표현은 다른 객체·과제 맥락·심지어 합성 이미지에서 실제 이미지로도 일반화된다. 둘째, 후반 레이어가 목표와 관련된 속성을 선택적으로 증폭하는 '언어 유도 속성 변조' 현상을 다양한 프롬프트에서 입증했고, 인과적 개입 실험을 통해 이 속성 변조가 VLM의 응답 분포를 매개함을 확인했다. 연구진은 이 결과가 시각 토큰이 정적 정보 저장소가 아니라 언어로 표현된 질의를 지원하도록 동적으로 조절된다는 관점을 뒷받침한다고 결론지었다.
- •VLM의 시각 표현이 목표 지향적 언어에 의해 재코딩되는 두 가지 구체적 메커니즘을 실증
- •'참조 표현': 프롬프트상 목표 관련 객체를 나타내는 추상 표현, 대조적 스티어링 벡터로 모델 예측에 인과적 영향 확인
- •참조 표현은 다른 객체·과제·합성→실제 이미지로도 일반화되는 추상성을 가짐
- •'언어 유도 속성 변조': 후반 레이어가 목표 관련 속성을 선택적으로 증폭하는 현상을 다양한 프롬프트에서 입증
- •인과적 개입으로 속성 변조가 VLM 응답 분포를 매개함을 확인, 시각 토큰이 동적으로 조절됨을 시사
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Linguistic Context Recodes Visual Representations in Vision-Language Models
본문 미리보기
arXiv:2608.00035v1 Announce Type: new Abstract: Goal-directed visual processing is a hallmark of human visual intelligence, resulting in representations that support downstream tasks such as categorization or search. Though vision-language models (VLMs) are often faced with these same tasks, their ability to recode visual representations when presented with goal-directed language remains poorly characterized. Indeed, prior work largely treats visual representations in VLMs as static repositorie
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:11AI 초안

