AI真的能读懂你的情绪吗?西浦研究让AI学会“察言观色”

2026年10月06日

“我没事。”

如果一个人这样说,但声音低落、表情疲惫,你会相信哪一种信息?

在人与人的交流中,我们会下意识地结合语言、语气和表情来判断对方的真实情绪。但对人工智能来说,同时处理这些不同来源、甚至互相矛盾的信息并不容易。

来自西交利物浦大学人工智能与先进技术学院的研究团队提出了一种新的多模态情感分析模型SCEF,尝试让人工智能不只“听懂”人说的话,还能综合语言、声音和面部表情等多模态信息,更准确地识别交流中的情绪。

相关论文《Semantic Purification and Time-Causal Stabilization with Energy-Inspired Arbitration for Multimodal Sentiment Analysis》于2026年8月21日在线发表于情感计算领域期刊《IEEE情感计算汇刊》(IEEE Transactions on Affective Computing)。论文第一作者为西浦人工智能与先进技术学院博士生朱铭徽,通讯作者为潘昱杉博士,合作单位包括西交利物浦大学、郑州轻工业大学、挪威科技大学和浙江大学。

当不同信息“打架”,AI该相信谁?

多模态情感分析并不是简单地把文字、声音和画面放在一起。

潘昱杉博士指出:“文字、声音和视频都可能包含干扰信息,且彼此之间可能相互矛盾。如果模型无法分辨哪种信息更可靠,简单地把它们堆砌在一起,反而可能增加误判。”

SCEF的关键就在于让AI学会判断不同信息的可靠程度。

例如,一个人说“我很好”,但声音低落、表情疲惫。面对这样的情况,SCEF不会把三种信息简单地等量处理,而是会关注每一种信息分别提供了什么线索,再进一步分析不同信息之间的关系,并根据当前情况调整它们对最终判断的影响。

为了验证模型的表现,团队在4个公开的中英文情感分析数据集上进行了测试。其中,CMU-MOSI和CMU-MOSEI主要用于英文多模态情感分析,CH-SIMS和CH-SIMS-V2则聚焦中文情感分析。这些数据集都包含语言、声音、面部表情等多种信息,可以帮助研究人员检验AI综合不同信息判断情绪的能力。

研究结果显示,SCEF在4个数据集上取得了具有竞争力的表现。以国际常用的CMU-MOSI数据集为例,在判断积极和消极情绪的二分类任务中,SCEF准确率达到90.85%,较此前表现最好的TEDT模型的89.30%提高了1.55个百分点。

从统计物理学中获得研究灵感

SCEF的这一重要设计来自人工智能与统计物理的交叉。

研究团队将物理学中的“能量”概念引入模型,用它来衡量不同模态信息之间的匹配程度,赋予了模型判断这些信息放在一起是否合理的能力。

当文字、声音和表情相互一致时,模型可以更容易形成判断;当它们出现冲突时,模型则可以根据不同信息之间的关系,动态调整它们的影响,输出更准确的结果。

这种来自统计物理的思路,为解决多模态信息之间的冲突提供了一种新的方法,也成为SCEF的重要创新之一。

让AI从“处理信息”走向“理解人”

随着人工智能越来越多地参与人们的日常服务和交流,机器理解情绪的能力也变得越来越重要。更准确地识别和理解人的情绪,有助于让人工智能与人的互动更加自然、有效。

例如,智能客服可以根据用户的情绪变化调整交流方式;数字人和社交机器人可以结合语言与非语言信号,让互动更加自然;在老年照护、数字健康等远程服务场景中,多模态情感分析也有望帮助系统更全面地了解用户状态,为后续服务或专业人员提供参考。

“人工智能正在从‘识别文字和图像’进一步走向‘理解人’。”潘昱杉博士表示,“我们希望AI不仅能够识别单一信息中的情绪线索,还能够理解不同信息之间的关系与冲突,这也是多模态情感理解走向更自然、更可靠人机交互的重要一步。”

记者:金画恬 编辑: 寇博

2026年10月06日