Dual-Scale State-Space Modeling with Speaker-Wise Dynamic CRF for Speech Emotion Recognition in Conversation
DSSM-CRF achieves 75.81% UA on IEMOCAP, addressing cross-speaker influence in conversational emotion recognition.
Guan-Hua Wen, Hou-Chiang Tseng, Kuan-Yu Chen