Vision-Language Model(VLM)의 물리 추론 능력은 아직 인간 수준에 크게 못 미치며, 어떤 보상 설계가 VLM의 물리 추론 행동을 어떻게 형성하는지 체계적으로 분석됐다. PhyX 벤치마크(3,000문제, 6도메인) + IBM Granite Vision 3.3 (2B)에서 형식 준수·정답·복합 루브릭·모델 주의 가중치 기반 내부 보상 4종을 GRPO로 비교했다. 정확도 보상이 가장 강력하고 루브릭은 구조적 추론을, 주의 기반 내부 보상은 공간 관계 정확도를 0.27에서 0.50으로 크게 끌어올렸다.
- •VLM 물리 추론에 대한 GRPO 보상 설계 체계적 실험
- •PhyX 3,000문제 6도메인 + IBM Granite Vision 3.3 (2B)
- •정확도 보상이 전체적 최강 — 대부분 도메인에서 SFT 능가
- •주의 가중치 기반 내부 보상으로 공간 관계 정확도 0.27→0.50
- •보상 유형별로 도메인 특화 추론 행동 유발
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Reward Design for Physical Reasoning in Vision-Language Models
- 1.VLM 물리 추론 성능은 보상 설계에 강하게 의존
- 2.주의 기반 내부 보상이 공간 관계 능력 급등 유도
- 3.SFT+GRPO 파이프라인에서 보상 커스텀의 영향력 실증
왜 중요한가?
VLM이 자율주행·로봇·산업 검사에 투입되는 맥락에서 물리 추론 능력이 핵심. 이 논문은 보상 설계가 도메인별 추론 행동을 어떻게 형성하는지 체계적으로 보여준다.
본문 미리보기
arXiv:2604.13993v1 Announce Type: new Abstract: Physical reasoning over visual inputs demands tight integration of visual perception, domain knowledge, and multi-step symbolic inference. Yet even state-of-the-art Vision Language Models (VLMs) fall far short of human performance on physics benchmarks. While post-training algorithms such as Supervised Fine-Tuning (SFT) and Group Relative Policy Optimization (GRPO) have demonstrated strong reasoning gains in language models, how reward design shap
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 15:12AI 초안

