← 最新论文
💬 NLP

VideoNorms: Benchmarking Cultural Awareness of Video Language Models

本文介绍了 VideoNorms,这是一个通过人机协作创建的、包含来自美国和中国电视剧的 3,000 多个文化规范标注的数据集,该数据集揭示了当前的视频大语言模型(VideoLLMs)在处理中国文化语境和非语言证据方面更为困难,从而强调了进行具有文化根基的训练与评估的必要性。

原作者: Nikhil Reddy Varimalla, Yunfei Xu, Meng Fan Wang, Arkadiy Saakyan, Smaranda Muresan

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Nikhil Reddy Varimalla, Yunfei Xu, Meng Fan Wang, Arkadiy Saakyan, Smaranda Muresan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人理解人类行为。你给它看一段两个人相遇的视频,并问它:“他们表现得有礼貌吗?”在人工智能的世界里,这是一个巨大的挑战。我们已经构建了“视频大语言模型”(VideoLLMs)——这些超级聪明的计算机可以观看视频并谈论它们所看到的内容。但大多数这类机器人仅针对来自世界一个特定角落的数据进行了训练,主要是美国。它们擅长识别猫或汽车,但在面对社会中那些“隐形规则”时却经常出错:即我们在握手、道歉或道别时所遵循的那些不成文的剧本。就像一个不知道在某些国家用左手指点是失礼的游客一样,这些 AI 模型可能会认为某种行为是正常的,而在另一种文化中,这实际上是一个严重的失礼行为。这篇论文提出了一个关键问题:这些看视频的机器人能否理解不同社会的文化“氛围”,还是仅仅根据它们看过的美国电影在进行猜测?

为了回答这个问题,研究人员创建了一个名为 VIDEONORMS 的新测试。把这个数据集想象成一个巨大的、全球性的“找不同”游戏,但不是寻找隐藏的物体,而是让 AI 判断人们是在遵循还是在打破社会规则。研究人员不仅仅是让 AI 去猜测;他们构建了一个“人机协作团队”。首先,一个超强大的 AI(被称为 Gemini)观看了来自美国和中国热门电视剧的数千段 15 秒短片,并写下了它认为的社会规则。然后,真正的专家——在这些特定文化中成长的人——介入其中担任编辑。他们检查 AI 的工作,修正错误,并添加关于肢体语言和语调的细节,而这些是机器人可能会忽略的。这个过程产生了一个包含超过 3,000 条经由人类验证的判断的庞大库,记录了电视剧中的角色是在表现得有礼貌还是无礼。

当研究人员在这一新数据集上测试七种不同的开源视频 AI 模型时,他们发现机器人的文化智能存在一些令人惊讶的差距。首先,模型对理解美国社会规范的表现远好于中国规范。这就像机器人为了美国文化的考试刻苦钻研,却几乎没翻开过关于中国文化的教科书。具体来说,模型在预测中国角色何时“遵循”规则方面表现挣扎,经常会对在那种语境下“有礼貌”究竟是什么样子感到困惑。其次,如果线索是非言语性的,机器人很难解释某事为何无礼或有礼。如果一个角色交叉双臂或避免眼神接触,AI 往往会错过信号,而它在捕捉诸如“对不起”或“谢谢”之类的言语线索方面则要好得多。

该研究还测试了仅仅通过让 AI 变得“更大”或更聪明是否能解决这些问题。他们尝试使用更大的模型并输入更多的视频帧,但结果并没有改善多少。这表明,问题不仅仅在于机器人记住了多少数据,而在于它拥有“什么样的”数据。研究人员还证明,你不能仅仅通过阅读剧本(所说的文字)来理解场景;你实际上需要观看视频。视觉线索对于掌握正确的文化背景至关重要。

简而言之,这篇论文揭示了虽然我们的视频观看 AI 在观察世界方面变得越来越好,但要真正理解人类在不同文化中表现出的多样化行为方式,仍有很长的路要走。目前的机器人就像是掌握了词典但还没学会当地习俗的游客,仅仅让它们变得更大并不会教会它们交通规则。为了构建真正具有文化意识的 AI,我们需要用更多样化的人类故事来训练它们,而不仅仅是那些来自好莱坞的故事。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →