비전-언어 모델(VLM) 실패의 근본 원인이 잘못된 인식(나쁜 시각)인지 잘못된 논리(나쁜 사고)인지를 구분하는 강화학습 프레임워크를 제안한다. 생성 과정을 인식과 추론 단계로 분리하고, 맹목 추론 프록시를 활용한 Perception Verification(PV)으로 인식 정확도를 추론 결과와 독립적으로 보상한다. Modality-Aware Credit Assignment(MoCA) 메커니즘으로 오류 출처에 보상을 정확히 라우팅하여 광범위한 과제에서 인식과 추론을 동시에 향상시켰다.
- •VLM 실패를 인식 오류와 추론 오류로 분리하는 강화학습 기반 접근법 제안
- •맹목 추론 프록시로 추론 결과와 독립적으로 인식 충실도에 보상을 부여하는 PV 도입
- •MoCA 메커니즘으로 오류 원인에 보상을 직접 라우팅하여 인식-추론 시소 효과 문제 해결
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Bad Seeing or Bad Thinking? Rewarding Perception for Vision-Language Reasoning
- 1.VLM 실패 원인을 지각 오류(bad seeing)와 추론 오류(bad thinking)로 명확히 분리·진단
- 2.Perception Verification(PV)으로 추론 결과와 독립적으로 지각 충실도에 보상을 부여하는 RL 프레임워크
- 3.MoCA 메커니즘으로 지각·추론 각각의 오류 원인에 보상을 정확히 라우팅해 동시 성능 향상
왜 중요한가?
시각-언어 모델의 성능 병목이 지각인지 추론인지를 명확히 분리해 더 효율적인 VLM 개선 경로를 제시하며, 단일 모델로 광범위한 작업에서 동시 성능 향상을 달성한다.
언급 프로젝트
본문 미리보기
arXiv:2605.14054v1 Announce Type: new Abstract: Achieving robust perception-reasoning synergy is a central goal for advanced Vision-Language Models (VLMs). Recent advancements have pursued this goal via architectural designs or agentic workflows. However, these approaches are often limited by static textual reasoning or complicated by the significant compute and engineering burden of external agentic complexity. Worse, this heavy investment does not yield proportional gains, often witnessing a
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

