← 最新论文
💬 NLP

FriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Language Models

该论文介绍了 FriendBench,这是一个用于从 20 秒破冰视频片段中推断二元熟悉度的基准测试,研究揭示了虽然顶尖的多模态模型在准确度上能与人类相匹配,但它们依赖的线索有所不同,并且存在将配对分类为陌生人的偏见,而人类则能独特地利用除言语之外的可视行为线索。

原作者: Jeffrey M. Girard, Jason Z. Zheng, Jacqueline R. Vertino, Antony D'Avirro, Benjamin Peloquin

发布于 2026-08-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Jeffrey M. Girard, Jason Z. Zheng, Jacqueline R. Vertino, Antony D'Avirro, Benjamin Peloquin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你走进一个房间,看到两个人正在交谈。你不知道他们的名字,也没有听到他们在说什么。然而,就在几秒钟之内,你通常就能判断出他们是正在叙旧的好友,还是正在尴尬破冰的陌生人。这种超能力被称为社交智能。它是通过观察人们如何移动、停顿以及眼神交流来解读情境“氛围”的能力,而不仅仅是听取他们的言语。几十年来,科学家们一直在研究人类是如何做到这一点的,但现在,我们提出了一个大问题:计算机也能做到吗?随着我们开始构建AI伴侣、会议助手和护理机器人,这些机器需要像我们一样理解人类的关系。但为了教会它们,我们首先需要一个公平的测试,来观察它们究竟是在真正“阅读”现场,还是仅仅在瞎猜。

于是有了 FriendBench,这是一个旨在测试这一点的全新实验。研究人员设计了一个数字化的“破冰”挑战。他们选取了96对人,并录制了他们回答同一个搞怪问题时的20秒片段:“你宁愿会飞还是会隐身?”其中一些组合是已经熟悉的朋友或家人(熟人),而另一些则是初次见面(陌生人)。因为每个人回答的问题都一样,所以他们使用的词汇并不会泄露答案。唯一的线索在于他们说话和行动的方式

随后,研究人员要求两组对象来解开这个谜团:一大群人类志愿者和来自七家主要科技公司的26个不同的AI模型。他们通过三种方式对AI和人类进行了测试:仅阅读文本转录、通过音频聆听,以及通过视频观看。

以下是他们的发现。首先,仅靠文本的版本对所有人来说都是死路一条。如果没有看到或听到这些人,无论是人类还是AI,表现都并不比随机猜测好多少。这很合理,因为对话主题经过了控制,从而隐藏了关系。

当加入声音后,情况有所好转。人类和最优秀的AI模型都有了进步,这表明语调和停顿携带了真实的线索。但真正的魔力发生在加入视频之后。当人类能够看到人们的面部表情和肢体语言时,他们的判断力显著提升。他们利用这些视觉线索进一步提高了准确率。然而,AI模型却遇到了瓶颈。虽然最优秀的AI模型在视频片段中的准确率能达到人类群体的水平,但它们实现这一目标的方式却完全不同。

AI模型并没有像人类那样真正“看到”友谊。相反,它们过度依赖一种模式:它们几乎一直猜“陌生人”。由于测试中熟人和陌生人的比例相等,这种偏差意外地维持了它们的整体得分,但这同时也意味着它们在识别“朋友”方面是失败的。相比之下,人类的表现则保持了平衡,能够正确识别出朋友和陌生人。

简而言之,目前最优秀的AI模型可以在这项任务上达到人类的准确度,但它们是依靠一种假设每个人都是陌生人的策略来完成的,而不是通过真正理解社交中的互动。它们听到了声音,但还不太会“阅读”肢体语言。这表明,尽管AI在处理社交任务方面正变得日益出色,但要真正像我们一样理解人类关系,它还有很长的路要走。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →