← 最新论文
🤖 AI

LLM-Based Selection of Incongruent Verbal and Nonverbal Behavior for Virtual Humans

本文基于埃克曼(Ekman)的框架提出了言语与非言语不一致性的分类法,研究了利用大语言模型为虚拟人选择符合语境的不一致行为的方法,并通过一项人类受试者研究验证了这些行为在产生预期观察者效应方面的有效性。

原作者: Parisa Ghanad Torshizi, Stacy Marsella

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Parisa Ghanad Torshizi, Stacy Marsella

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在言语交谈间的静默空间里,人类的沟通往往正在进行着最复杂的运作。当我们交谈时,我们不仅仅是在传递信息;我们还通过面部表情、眼神和姿态,投射出我们的情感、社会地位以及隐藏的意图。这些被称为非语言行为的无声信号,既可以强化我们所说的话,也可以与其相矛盾。一个人可能会说着“我很好”,但脸部却因忧虑而紧绷;或者在给予赞美时,语气中却透着嘲讽。这种让身体背叛嘴巴,或是在礼貌的微笑背后掩饰真实感受的能力,是人类处理人际关系、管理冲突以及传递信任的基本方式。几十年来,研究人员一直试图教会计算机模仿这种复杂性,构建能够像人类一样移动和做手势的虚拟代理。然而,大多数这类数字角色都受限于一个简单的规则:如果话语是快乐的,那么脸部也应该是快乐的。它们难以理解,有时一个人最诚实的表现,就是说着一回事,而身体表达的是另一回事。

东北大学的一个研究小组致力于改变这一局限。他们想看看是否可以教导一个虚拟人自动生成这些微妙且具有矛盾性的行为,并使用一种被称为大语言模型的人工智能技术。这些模型是强大的系统,经过海量文本训练,能够理解语境和细微差别。研究人员提出了一个具体的问题:如果给计算机一段对话和对情境的描述,它能否判断出说话者何时应该在说好话时显得不悦,或者在传递坏消息时显得友好?他们不仅希望计算机能够进行猜测,更希望看到计算机能否以一种让观察者感到真实的方式做出这些选择。

为了测试这一点,团队首先绘制了一张关于人们如何使言语与行动不一致的地图。他们确定了人们产生这种现象的四个主要原因。有时是讽刺,即说话者利用赞美来侮辱他人,或利用批评来表达喜爱。另一些时候则是为了“留面子”,即一个人通过温暖的微笑来软化严厉的批评以避免伤害感情,或是强颜欢笑以掩饰内心的愤怒。此外还有欺骗,即一个人试图隐藏某种秘密情绪;以及情绪调节,即某人试图压抑内心涌动的某种感觉。利用这些类别,研究人员设计了八个特定的场景,例如一名初级员工面对刚刚增加了其工作量的上司,或是一位母亲向她的青少年儿子提供反馈。

随后,研究人员测试了三种向计算机请求生成行为的方法。第一种方法中,他们只给计算机提供的句子本身。第二种方法中,他们加入了导致该句子的对话历史。第三种也是最详细的方法,他们提供了对话历史,以及关于说话者之间关系和社交环境的书面描述。由名为 Claude 的模型驱动的计算机被要求决定角色的面部和眼睛在每一句话时应有的反应。结果显而易见:当计算机仅获得文字时,它大多会让角色在话语快乐时表现得快乐,在话语悲伤时表现得悲伤。但当研究人员提供完整的语境——权力动态、历史背景和社交压力时——计算机开始选择与文字相矛盾的行为。在初级员工必须同意一位苛刻上司增加其工作量的场景中,计算机选择了一个微小且克制的微笑,并伴随着短暂的目光回避和嘴唇紧绷。它理解了这位员工是在说“是”的同时,内心在说“不”。

为了观察这些计算机生成的选择是否真的有效,研究人员将数字指令转化成了虚拟人的视频片段,并展示给人们观看。在第一项研究中,他们要求参与者观看成对的视频,并判断哪位说话者的态度更积极。当虚拟人说着积极的话语却表现出消极的神态时,人们对态度的评价始终低于说话人表现出快乐时的评价。而当人类说着消极的话语却露出温暖的微笑时,人们对态度的评价则比人类表现出愤怒时更高。第二项研究更深入一步,要求人们评价具体的感受。结果显示,计算机选择的非语言线索足以改变人们对说话者情绪的感知。如果计算机选择用皱眉来配合一句快乐的话,人们会觉得说话者实际上是在愤怒或讽刺。如果计算机选择用温暖的微笑来配合一句悲伤的话,人们感受到的则是同情而非愤怒。

这项研究证实,为人工智能提供完整的社交语境,能使其生成的非语言行为比仅基于文字的行为更具人性化。计算机不仅仅是重复句子中的情绪,它解读了情境,并判定这种“不匹配”才是最诚实的反应。虽然研究人员指出,他们的系统在处理手势和语音语调方面仍需改进,且视频时长较短,但核心发现具有重要意义。它表明,对于虚拟人而言,若要使其真正具有说服力(特别是在担任心理治疗师培训或谈判专家等角色时),它们必须能够让身体讲述一个与嘴巴不同的故事。计算机学会了:有时,真相不在于言语,而在于言语间的留白。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →