개별 발화 수준에서만 작동하는 기존 감정 인식의 한계를 넘어, 대화의 해석 가능한 감정 호를 추적하는 경량 프레임워크를 제안합니다. 비디오·오디오·텍스트의 발렌스-어라우잘 표현으로부터 sticky factorial HDP-HMM을 이용해 잠재 감정 레짐 시퀀스를 모델링합니다. 가우시안 HMM 기준 대비 더 해석 가능한 레짐 시퀀스를 낮은 계산 비용으로 생성하며, 임상 데이터셋에서 불안정 감정 레짐 컨텍스트 증강으로 LLM 응답 품질을 향상시켰습니다.
- •Sticky HDP-HMM으로 대화의 지속적 감정 레짐을 멀티모달 신호로 추적
- •비디오·오디오·텍스트 발렌스-어라우잘 표현을 통합한 멀티모달 입력 활용
- •가우시안 HMM 대비 더 해석 가능한 레짐 시퀀스를 훨씬 낮은 계산 비용으로 생성
- •임상 대화에서 감정 레짐을 LLM 컨텍스트로 활용해 응답 품질 향상 가능성 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Multimodal Hidden Markov Models for Persistent Emotional State Tracking
- 1.비디오·오디오·텍스트 멀티모달 입력으로 대화의 감정 국면 변화를 추적하는 경량 프레임워크 제안
- 2.Sticky HDP-HMM이 기준 가우시안 HMM보다 해석 가능한 감정 구간 시퀀스 생성
- 3.LLM 기반 대화 상태 추적 대비 훨씬 낮은 계산 비용으로 유사 성능 달성
- 4.임상 데이터셋에서 감정 국면 정보가 LLM 응답 품질 향상에 기여함을 확인
왜 중요한가?
대화 감정 역학을 경량으로 실시간 추적하는 해석 가능한 프레임워크를 제시해, 임상·교육·고객 서비스 등 대화형 AI 응용에 실용적 기반을 마련한다.
본문 미리보기
arXiv:2605.12838v1 Announce Type: new Abstract: Tracking an interpretable emotional arc of a conversation via the sentiment of individual utterances processed as a whole is central to both understanding and guiding communication in applied, especially clinical, conversational contexts. Existing approaches to emotion recognition operate at the utterance level, obscuring the persistent phases that characterize real conversational dynamics. We propose a lightweight framework that models conversati
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

