멀티모달 감정 인식(MER)에서 명시적 추론이 오히려 정확도를 떨어뜨릴 수 있다는 관찰에서 출발한 연구다. 추론형 MLLM에서 즉답하는 빠른 사고(fast thinking)가 숙고 후 답하는 느린 사고(slow thinking)를 자주 능가했는데, 분석 결과 빠른 사고는 폭넓고 확신 있는 예측으로 재현율을 높이고 느린 사고는 보수적 필터링으로 정밀도를 높이는 상보 관계였다. MER-R1은 이 상보성을 명시적 최적화로 전환하는 강화학습 프레임워크로, 재현율과 정밀도를 분리해 트레이드오프 없이 공동 최적화하는 이중 목적 분리와, 느린 사고의 최종 답을 빠른 사고의 직관에 정렬하는 신뢰도 보정을 결합했다. 이 시너지가 최적화 중 분산 유발 간섭을 완화한다는 이론적 근거도 제시했으며, MER-UniBench와 MME-Emotion에서 최고 성능을 달성해 추론이 감정 인식에 실질적 이득을 주게 만들었다.
- •추론형 MLLM의 감정 인식에서 즉답(fast thinking)이 숙고(slow thinking)보다 자주 우수하다는 반직관적 발견
- •빠른 사고는 재현율(recall), 느린 사고는 정밀도(precision)에 강하다는 상보성을 실증 분석으로 규명
- •재현율·정밀도를 분리해 공동 최적화하는 이중 목적 분리 + 느린-빠른 신뢰도 보정의 RL 프레임워크 MER-R1 제안
- •시너지가 분산 유발 간섭을 완화한다는 이론적 정당화 제시
- •MER-UniBench·MME-Emotion에서 SOTA 달성, 추론이 감정 인식에 실제 이득을 주도록 개선
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy
- 1.멀티모달 감정인식에서 명시적 추론(느린 사고)이 항상 정확도를 높이지 않음을 발견
- 2.빠른 사고는 재현율, 느린 사고는 정밀도에 유리하다는 실증 분석 제시
- 3.재현율·정밀도를 분리 최적화하는 강화학습 프레임워크 MER-R1 제안
- 4.MER-UniBench·MME-Emotion에서 SOTA 달성, 추론이 감정인식에 실질 기여
왜 중요한가?
추론이 늘 정확도를 높인다는 통념과 달리, 빠른·느린 사고의 상보성을 명시적으로 최적화해 둘을 트레이드오프 없이 결합. 멀티모달 감정인식 성능을 SOTA로 끌어올린 점에서 의의가 있다.
본문 미리보기
arXiv:2606.27652v1 Announce Type: new Abstract: We find that explicit reasoning does not necessarily translate into better multimodal emotion recognition (MER) accuracy, even though it makes predictions more interpretable. Specifically, for reasoning-based MLLMs, fast thinking by triggering direct answers often outperforms slow thinking after deliberative reasoning. Our empirical analyses show that fast thinking improves recall with broader and more confident predictions, whereas slow thinking
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

