2026年09月18日:DCAF: Dynamic Affective Consistency-Aware Fusion with Disentangled Modality Representations for Multimodal Sentiment Analysis

  • 主页 /
  • 通知公告 /
  • 通知公告

2026年09月18日:DCAF: Dynamic Affective Consistency-Aware Fusion with Disentangled Modality Representations for Multimodal Sentiment Analysis

【报告内容】

汇报人: 丁安宁

汇报单位:福建理工大学

主题:DCAF: Dynamic Affective Consistency-Aware Fusion with Disentangled Modality Representations for Multimodal Sentiment Analysis

1、Introduction

2、Method

3、Experiments

4、Conclusion

【报告总结】

1.待解决的问题描述

态异质性:文本(离散语义)、语音(韵律音高)与视觉(表情动作)在特征分布与时序对齐上存在显著差异,直接融合易导致空间对齐困难。

跨模态情感冲突:现实场景中常出现模态间表达不一致的情况(如反语/讽刺,口头称赞但表情冷淡)。

静态解耦的局限性:传统解耦方法(如 MISA、ConFEDE)采用统一的静态分离策略,导致一致样本“过分离”(损失判别信息),而冲突样本“分离不足”(噪声泄漏破坏决策边界)。

2.相关创新方案

轻量化时序编码(RWKV):文本采用 BERT,连续的语音和视觉信号采用轻量级 RWKV 编码器,实现高效时序依赖建模。

跨模态正交解耦学习(CODL):结合对称的三模态交叉注意力(TMCA)与正交正则化对比损失,严格解耦模态不变特征与模态特有特征。

一致性引导单模态标签衍生(CULD):构建基于 PCA 的正/负双参考平面动态量化实例级情感一致性,衍生弹性伪标签进行辅助监督,无需人工单模态标注即可抑制冲突噪声。

6-Token Transformer 融合:将 3 个不变特征与 3 个特有特征结合角色位置编码(Role Embedding),输入 Transformer 进行深层交互与最终预测。

3.实验总结

SOTA 性能:在 CMU-MOSI、CMU-MOSEI 及 CH-SIMS 三大基准数据集上均取得 SOTA 表现(如 CH-SIMS 上 Acc-2 达 84.90%、F1 达 85.10%,MAE 相较于基线降低 9.1%)。高计算效率:引入 RWKV 使模型计算量(FLOPs)相较于标准 Transformer 降低 86.6%(从 26.35G 降至 3.53G),训练速度明显加快。

反超大语言模型:仅约 0.07B 参数量,在特定多模态情感分析任务上击败了 LLaVA-v1.6-13B、ChatGPT 及 ChatGLM2 等大模型。

4.未来工作

进一步诊断跨模态冲突信息到底是纠正信号、冗余还是有害噪声,建立显式的诊断与增强机制。

报告时间:2026091819:30

腾讯会议:311-5999-8176

点我下载本讨论课相关文献或PPT吧~(提取码:iipr)