비전-언어 시스템은 이미지와 검색된 텍스트를 결합하지만 두 소스가 서로 불일치하거나 함께 답을 뒷받침하지 못할 수 있어, 신뢰할 수 있는 모델은 믿을 만한 소스를 식별하고 둘 다 부적절할 때는 답을 보류해야 한다. 이 논문은 기존 사후학습 목적함수가 사례를 독립적으로 채점해 반사실적 증거 변화에서 일관된 행동을 강제하지 못한다는 문제를 지적하며, 정렬·이미지만 정답·텍스트만 정답·둘 다 오답(A/V/T/N)인 매칭된 변형을 하나의 묶음으로 최적화하는 그룹 상대적 프레임워크 CARGO-VL을 제안했다. 조건별 정답성에 답변 불변성·소스 등가성·정답-보류 전환에 대한 전이 보상을 결합하고, 주-쌍대 제어기로 안전하지 않은 답변과 과도한 보류 사이 균형을 맞춘다. 4개 조건 충돌 학습 자원 XMC를 구축하고 CMC-Bench와 Modality-Bias에서 전이 성능을 평가한 결과, CARGO-VL은 여러 시드에서 포인트단위 베이스라인 대비 충돌 처리, 근거 없는 답변 회피, 모달리티 균형을 모두 개선했다.
- •이미지·텍스트 근거가 충돌할 때 신뢰 소스를 식별하고 답변을 보류하는 CARGO-VL 제안
- •A(정렬)/V(이미지 정답)/T(텍스트 정답)/N(둘 다 오답) 4가지 증거 상태를 하나의 묶음으로 그룹 최적화
- •답변 불변성·소스 등가성·정답-보류 전환에 대한 전이 보상을 조건별 정답성과 결합
- •주-쌍대 제어기로 안전하지 않은 답변과 과도한 보류 사이 균형 조절
- •4조건 충돌 학습자원 XMC 구축, CMC-Bench·Modality-Bias에서 포인트단위 베이스라인 대비 개선 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
CARGO-VL: Counterfactual Arbitration with Risk-Constrained Group Optimization for Vision-Language Models
본문 미리보기
arXiv:2608.04509v1 Announce Type: new Abstract: Vision-language systems combine images with retrieved text, but these sources can disagree or jointly fail to support an answer. Reliable models must identify the trustworthy source and abstain when neither is adequate. Existing post-training objectives score instances independently and therefore do not enforce coherent behavior under counterfactual evidence changes. We introduce CARGO-VL, a group-relative framework that optimizes matched variants
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:11AI 초안

