← 最新论文
💻 computer science

SIV-Bench: A Video Benchmark for Social Interaction Understanding and Reasoning

本文介绍了 SIV-Bench,这是一个包含 2,792 个视频片段和 5,455 个问答对的综合视频基准,旨在评估多模态大语言模型在社交互动任务上的表现,结果表明,尽管当前模型在场景理解方面表现出色,但由于与人类思维过程存在偏差,它们在社交状态推理和动态预测方面仍面临困难。

原作者: Fanqi Kong, Weiqin Zu, Xinyu Chen, Yaodong Yang, Song-Chun Zhu, Xue Feng

发布于 2026-04-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Fanqi Kong, Weiqin Zu, Xinyu Chen, Yaodong Yang, Song-Chun Zhu, Xue Feng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何成为一个好朋友。你可以给它看一张狗的照片,它能告诉你“那是一只狗”。你可以给它看一段车祸视频,它能说“车撞到了树上”。但是,当你给它看两个人争吵的视频,或者一群朋友因笑话而大笑的视频时,会发生什么呢?机器人能理解他们为什么争吵,或者他们感觉如何,甚至预测他们接下来会做什么吗?

这正是论文SIV-Bench试图解决的问题。

问题:机器人“缺乏社交常识”

作者认为,虽然人工智能模型(机器人和聊天机器人背后的“大脑”)在观察和描述世界方面变得越来越出色,但在理解人类社交互动方面却表现糟糕。

可以这样想:人工智能或许能完美地描述一段生日派对的视频(“有一个蛋糕,一个孩子正在吹蜡烛,人们戴着帽子”)。但如果你问它:“这个孩子是开心还是尴尬?”或者“为什么叔叔皱着眉头看着孩子?”,人工智能往往会答错。它看到了动作,却错过了动作背后的故事

解决方案:为社交人工智能颁发“驾照”

为了解决这个问题,研究人员建立了一个名为SIV-Bench的新测试。你可以把它想象成一场严格的“驾照”考试,只不过它测试的不是汽车能否在街道上行驶,而是人工智能能否在复杂的社交情境中“驾驶”。

该测试基于一个简单理念:社交关系就像不同类型的游戏。

  • 家人/朋友: 你们自由地分享事物(就像分享披萨)。
  • 老板/员工: 一个人发号施令,另一个人服从(就像教练和运动员)。
  • 陌生人/商务: 你们基于价值交换事物(就像买咖啡)。

该测试使用了来自互联网(如 TikTok 和 YouTube)的2,792 个真实视频片段,涵盖了 14 种不同类型的关系(父母、情侣、同事等)。针对每个视频,他们创建了5,455 个问题,以测试人工智能能否通过考试。

考试的三个等级

测试分为三个等级,难度逐级递增:

  1. 等级 1:“你看到了什么?”测试(社交场景理解)

    • 任务: “那个男人穿着什么?”或者“那个女人用手在做什么?”
    • 结果: 人工智能在这部分表现相当不错。这就像一个能读懂菜单的机器人。它能清晰地看到文字和物体。
  2. 等级 2:“他们在想什么?”测试(社交状态推理)

    • 任务: “为什么老师对学生微笑?”或者“这两个人是朋友还是敌人?”
    • 结果: 人工智能在这里遇到了困难。它经常感到困惑。例如,它看到老板对员工大吼,可能会认为他们只是“同事”在进行大声交谈,而忽略了其中的权力动态。这就像一个看到了暴风雨却不懂人们为何害怕的机器人。
  3. 等级 3:“接下来会发生什么?”测试(社交动态预测)

    • 任务: “如果老板没有大吼,员工本来会做什么?”或者“接下来会发生什么?”
    • 结果: 这是最难的部分。人工智能必须想象一个不同的现实,或者基于社交规则预测未来。它经常在这里失败,因为它并没有真正“懂得”人类规则。

发现:测试揭示了什么

当研究人员用当今最先进的人工智能模型进行这项测试时,他们发现了一些令人惊讶的事情:

  • 大脑越大越好,但无法解决所有问题: 最大、最强大的人工智能模型比小型模型表现更好,但即使是“最聪明”的模型,在社交问题上也经常失败。它们就像一个背熟了教科书却从未在现实生活中生活过的学生。
  • “关系”混淆: 人工智能犯的最大错误是混淆了关系。它经常把“老板和员工”与“同事”混淆,或者把“父母和孩子”与“朋友”混淆。它无法区分严厉的老师与严厉的父母。
  • 语言很重要: 研究人员发现,如果给人工智能提供音频(人们在说什么)或字幕,它在回答难题时的表现会好得多。这就像给学生一张提示纸;如果没有语言信息,人工智能往往会在视觉噪音中迷失。
  • “人类差距”: 即使是最好的人工智能模型,也远远落后于真实的人类。当人类参加这项测试时,正确率约为74%。而最好的人工智能正确率约为62%。这一差距表明,人工智能仍然缺失人类天生具备的关键“社交直觉”。

结论

该论文得出结论:虽然人工智能在观察世界方面变得越来越好,但它仍在学习如何理解人类。它能描述场景,但往往错过了情感和社会故事。

作者希望,通过发布这项测试(SIV-Bench),其他科学家能利用它来构建不仅聪明,而且具有社交智能的人工智能——这种人工智能能够真正理解人类的情感、关系和行为,而不仅仅是根据表面所见进行猜测。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →