人类与大模型对拼接面孔情绪识别的能力差异
Differences in Emotion Recognition Capabilities Between Humans and Multimodal Large Language Models for Spliced Faces
-
作者:
李婧婷
1,2
赵琳
1,2
刘烨
1,2
王甦菁
1,2
马骏驰
1,3
-
作者单位:
- 通讯作者:
李婧婷
Email:lijt@psych.ac.cn
-
提交时间:2026-04-13 15:29:07
摘要: 面孔是传递情绪等社会信息的重要载体。人类依赖整体与局部加工等多层次的认知机制高效、准确地识别面部基本情绪;而多模态大语言模型(Multimodal Large Language Models, MLLMs)虽整合了视觉编码组件与语言推理机制,但其加工策略与人类的知觉加工在原理上存在显著差异。将二者的情绪识别能力进行对比有助于理解两者在情绪感知与推理策略上的差异。同时,已有研究提示文本提示词会显著影响MLLM的输出,但其在面孔情绪识别情境中的[1]作用仍缺乏系统检验。
基于上述原因,本文旨在探讨面孔情绪识别中的整体与局部特征加工优势,并进一步考察该加工模式在人类与MLLM生成的“虚拟参与者”之间是否具有一致性。文章共包含四个实验,结果表明:MLLMs在识别拼接情绪面孔时表现出区别于人类的局部特征偏好:协调比率低且倾向将图片判断为互斥;提示词的细节化程度与示例图片会显著改变模型的判断倾向与协调比率。综上,研究结果加深了对人类与人工智能在情绪理解路径上的差异的认识,并为人工智能在情绪识别与人机交互领域的应用提供了新的理论参考。
版本历史
| [V1] |
2026-04-13 15:29:07 |
ChinaXiv:202604.00200V1
|
下载全文 |