멀티모달 생성 모델의 인간 선호도 정렬을 위해 'Auto-Rubric as Reward(ARR)' 프레임워크를 소개한다. ARR은 쌍별 비교 전에 VLM의 내재화된 선호도 지식을 프롬프트별 루브릭으로 외부화하여 암묵적 선호 구조를 검사 가능한 제약으로 변환함으로써 포지셔널 바이어스를 억제한다. 이를 생성 훈련으로 확장하는 루브릭 정책 최적화(RPO)와 함께 텍스트-이미지 생성 및 이미지 편집 벤치마크에서 기존 보상 모델과 VLM 판사를 능가하는 성능을 보였으며, 병목이 지식 부족이 아닌 인수분해된 인터페이스의 부재임을 밝혔다.
- •ARR은 쌍별 비교 전 VLM의 선호도 지식을 루브릭으로 외부화해 평가 편향을 억제한다
- •루브릭 기반 접근은 포지셔널 바이어스를 줄이고 제로샷 및 소수샵 배포를 모두 가능하게 한다
- •루브릭 정책 최적화(RPO)가 ARR의 다차원 평가를 생성 훈련으로 확장한다
- •텍스트-이미지 생성과 이미지 편집 벤치마크에서 기존 보상 모델과 VLM 판사를 능가했다
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Auto-Rubric as Reward: From Implicit Preferences to Explicit Multimodal Generative Criteria
본문 미리보기
arXiv:2605.08354v1 Announce Type: new Abstract: Aligning multimodal generative models with human preferences demands reward signals that respect the compositional, multi-dimensional structure of human judgment. Prevailing RLHF approaches reduce this structure to scalar or pairwise labels, collapsing nuanced preferences into opaque parametric proxies and exposing vulnerabilities to reward hacking. While recent Rubrics-as-Reward (RaR) methods attempt to recover this structure through explicit cri
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

