OPPO(Omni-Perception Policy Optimization)는 감정 추론용 옴니모달 LLM이 멀티모달 단서를 충분히 활용하지 못하고 다른 모달리티의 진술을 환각하는 문제를 강화학습으로 해결한 프레임워크다. 정답 추론을 시각·음향·감정의 세밀한 단서로 분해해 이를 의미적으로 복원하는 궤적에 보상을 주는 Omni-Perception Reward와, 전체 입력과 단일 모달 마스킹 입력의 정책을 비교해 모달리티별 증거 토큰에만 KL 페널티를 적용해 교차 모달 환각을 억제하는 Omni-Perception Loss로 구성된다. 활용도와 충실성을 정량화하는 진단 벤치마크 MEP-Bench도 함께 제안했다. MER-UniBench와 MME-Emotion에서 최고 성능을 달성했으며 ICML 2026에 채택돼, 감정 인식 AI의 신뢰성 개선에 기여한다.
- •감정 지향 Omni-MLLM의 두 결함 규명: 멀티모달 단서 활용 부족과 교차 모달 환각
- •정답 추론을 시각·음향·감정 단서로 분해해 복원 굤적에 보상하는 Omni-Perception Reward
- •단일 모달 마스킹 비교 + 증거 토큰 한정 KL 페널티로 환각 억제하는 Omni-Perception Loss
- •활용도·충실성 정량화 진단 벤치마크 MEP-Bench 제안
- •MER-UniBench·MME-Emotion에서 SOTA 달성, ICML 2026 채택
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Omni-Perception Policy Optimization for Multimodal Emotion Reasoning
- 1.멀티모달 감정추론을 위한 강화학습 프레임워크 OPPO 제안
- 2.Omni-Perception Reward로 시각·청각·감정 단서 복원 궤적에 보상 부여
- 3.Omni-Perception Loss로 모달리티별 증거 토큰에 KL 페널티 적용해 교차모달 환각 억제
- 4.MER-UniBench·MME-Emotion에서 SOTA, 진단 벤치 MEP-Bench로 충실도 개선
왜 중요한가?
기존 Omni-MLLM이 멀티모달 단서를 충분히 활용하지 못하고 환각하던 문제를 지각 자체를 명시적으로 최적화해 해결, 감정 인식 멀티모달 모델의 신뢰성을 높인다.
본문 미리보기
arXiv:2606.25325v1 Announce Type: new Abstract: We find that current emotion-oriented Omni-MLLMs still lack reliable omni-modal perception: they (i) underutilize multimodal cues in their reasoning trajectories and (ii) exhibit unfaithful behavior, often hallucinating modality-specific statements from other modalities. Building on these insights, we propose OPPO (Omni-Perception Policy Optimization), a reinforcement learning framework that explicitly optimizes multimodal perception. First, an Om
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

