Multimodal Rapport Estimation in Real-World HRI
这项研究表明,将零样本大语言模型(具体为 Gemini 2.5 Flash)与预训练音频和视觉模型(HuBERT 和 V-JEPA)进行多模态融合,能够有效评估真实人机交互场景中第三方评定的亲密度(rapport),其表现优于单一模型,并凸显了考虑交互时长和群体规模等上下文变异性的必要性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人机交互这个繁忙的世界里,研究人员长期以来一直在寻求一种方法,来衡量连接人与机器的那条无形的纽带。这种连接通常被称为“共鸣”(rapport),它不是一种静态的人格特质,而是一种动态的感觉,产生于双方相互关注、协调行动并分享一种温暖感之时。虽然科学家们已成功地在变量受控、安静且受控的实验室中研究了这种纽带,但现实世界要混乱得多。在繁忙的商店或公共广场上,人们会按照自己的节奏进出对话,朋友群体可能会同时聚集在机器人周围,而且没有人会被迫留下。现代机器人技术面临的核心问题是:在环境不受控且参与者可以随时离开的情况下,用于在实验室中衡量连接感的工具是否仍然有效。
为了回答这个问题,一组研究人员在日本的一家药店设置了一个社交机器人,在这个环境中,顾客可以自由靠近,无需任何事先指令。在六天的时间里,这个名为 Sota 的小型桌面机器人与访客进行了随意的交谈,期间由一名人类操作员在远处引导其言语和姿态。研究团队记录了其中的 62 次互动,捕捉了从独自购物者到小型朋友团体的视频和音频资料。随后,他们邀请了三位独立的真人评判员观看这些录像,并使用标准化的量表对每个人与机器人之间关系的质量进行评分。该量表衡量了互动感在多大程度上体现了关注与协调,从而为每一个瞬间所达成的共鸣提供了一个可靠的分数。
在掌握了这些现实世界的数据后,研究人员测试了计算机是否可以学会自动预测这些人类评分。他们比较了两种不同的方法。第一种方法使用经过海量文本、音频和视频数据训练的专门计算机模型,从录像中提取特定特征。第二种方法则利用了被称为“大语言模型”的强大通用人工智能系统。这些系统被给予了对话转录文本,并在某些情况下还包括音频和视频文件,并被要求扮演第三方评判员的角色,对共鸣进行评分,就像人类专家所做的那样。
结果显示,通用人工智能展现出了令人惊讶的实力。当仅提供对话文本时,其中一个此类大模型表现得异常出色,它捕捉到的互动细微差别甚至优于那些仅依赖音频或视觉数据的专门化模型。这种仅基于文本的模型能够以极高的准确度预测共鸣分数,这表明人们使用的词汇以及对话的流向,携带了关于他们与机器人之间连接感的最重要线索。然而,专门化模型并非毫无用处。研究人员发现,虽然基于文本的模型很强大,但它会遗漏一些音频和视觉模型能够捕捉到的细节。当研究人员将基于文本的模型与音频及视觉模型的预测结果相结合时,得到的结果是所有系统中最为准确的一个。这种组合方法优于任何单一方法,表明不同类型的数据提供的是互补性的见解,而非竞争性的信息。
研究还强调了互动时长和参与人数如何影响测量共鸣的能力。在受控的实验室环境中,互动通常较长且仅涉及两人。而在药店中,互动非常短暂,平均仅为 54 秒左右,并且经常有多人加入其中。研究人员发现,随着参与人数的增加,专门化模型表现得更加吃力,这可能是因为群体对话的复杂动态使得分离个体信号变得更加困难。相比之下,通用人工智能模型则保持了稳健性,即使在三个人同时与机器人交谈时,仍能保持其高准确度。这表明,这些先进的系统比在实验室中开发的传统方法更擅长处理现实世界遭遇中那种混乱的多人性质。
最终,这项工作证明,在现实世界中评估人机关系的质量是可能的,但这需要一种与过去不同的策略。研究结果表明,当用户可以自由地参与或脱离时,仅仅依靠为特定任务训练的专门化模型可能是不够的。相反,一种结合了通用人工智能的广泛理解,并辅以特定音频和视觉线索的混合方法,提供了最可靠的前行之路。这一洞察对于社交机器人的未来至关重要,因为它指向了能够真正适应公共空间中人类生活那不可预测且多变本质的系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。