← 最新论文
💻 computer science

MINERVA-Cultural: A Benchmark for Cultural and Multilingual Long Video Reasoning

该论文提出了名为 MINERVA-Cultural 的多文化多语言长视频推理基准,该基准包含 18 个全球地区的原生语言高质量人工标注数据,旨在揭示当前顶尖视频大模型在理解文化视觉语境方面的显著不足,并提出了基于证据图的迭代策略以识别细粒度推理错误。

原作者: Darshan Singh, Arsha Nagrani, Kawshik Manikantan, Harman Singh, Dinesh Tewari, Tobias Weyand, Cordelia Schmid, Anelia Angelova, Shachi Dave

发布于 2026-04-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Darshan Singh, Arsha Nagrani, Kawshik Manikantan, Harman Singh, Dinesh Tewari, Tobias Weyand, Cordelia Schmid, Anelia Angelova, Shachi Dave

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 MINERVA-Cultural 的新项目,你可以把它想象成给现在的 AI 视频理解能力举办的一场"全球文化奥林匹克运动会"。

以前的比赛(基准测试)大多只关注西方文化,而且题目全是英语。这就像只让会英语的人参加奥运会,或者只考足球,完全忽略了篮球、乒乓球等其他项目。这导致 AI 模型虽然看起来很强,但一旦到了非英语、非西方文化的真实世界里,就经常“水土不服”,甚至闹笑话。

为了解决这个问题,Google DeepMind 的团队设计了 MINERVA-Cultural,以下是它的核心亮点:

1. 这是一个“全球村”的考试

想象一下,你正在看一场来自世界各地的视频考试:

  • 地点:覆盖了全球 18 个不同的地区(从墨西哥的西班牙语到印度的泰米尔语,再到埃及的阿拉伯语等)。
  • 内容:视频里不是好莱坞大片,而是真实的当地生活——比如印度的卡巴迪(Kabaddi)比赛、墨西哥的节日庆典、泰国的街头美食。
  • 题目:题目不是简单的“这是谁?”,而是像侦探破案一样复杂。例如:“在视频的第 5 分钟,当那个穿红衣服的人摔倒后,接下来发生的三次空袭(比赛术语)中,有多少次是对方得分的?”
  • 关键点:所有的题目、答案和解题思路,都是由当地母语专家当地语言亲手写的,而不是机器翻译的。这就像请了当地的老爷爷老奶奶来出题,确保没有文化隔阂。

2. AI 现在的表现:像“近视眼”游客

论文测试了目前世界上最先进的 AI 模型(比如 Gemini, GPT-5 等),结果让人大跌眼镜:

  • 人类专家:在这个考试中,人类能拿到 95% 以上的分数。
  • 顶级 AI:最好的模型只能拿到 45% 左右,甚至在一些小语种地区(如泰米尔语、泰卢固语),分数跌到了 20-30%

为什么 AI 这么笨
论文发现,AI 并不是“不懂逻辑”,而是**“看不懂文化”**。

  • 比喻:这就好比一个外国游客去印度看一场传统的舞蹈表演。他可能认得出来那是“跳舞”(视觉识别),但他看不懂舞者手部的特定手势代表什么含义(文化理解),也听不懂背景音乐里的歌词在讲什么故事(音频理解)。
  • 主要错误:75% 的错误都出在**“视觉文化感知”**上。AI 把印度的传统服饰认成了普通衣服,把特定的节日仪式认成了普通聚会。它们就像是一个拿着放大镜却戴着眼罩的观察者,看得很仔细,却完全不懂眼前的东西意味着什么。

3. 给 AI 做“体检”的新方法:证据树

以前的考试只看最后答案对不对(对/错)。但这篇论文发明了一种更厉害的方法,叫**“证据图”(Evidence Graph)**。

  • 比喻:想象 AI 在解题时是在爬一棵树。以前的考试只看它有没有爬到树顶。现在的考试,会检查它每一步踩的树枝对不对。
  • 过程
    1. 如果 AI 第一步就认错了树枝(比如把时间看错了),后面的推理全都会错。
    2. 研究人员会告诉 AI:“你刚才那步看错了,其实是那个时间点。”
    3. 然后让 AI 重新爬,看看它能不能在修正错误后继续爬上去。
  • 发现:通过这种“迭代纠错”,他们发现很多 AI 其实逻辑没问题,只是第一步的“文化视觉感知”卡住了。一旦帮它纠正了第一步,它往往能解开后面的谜题。

4. 为什么这很重要?

这就好比我们要造一辆能在全球任何地方行驶的自动驾驶汽车。

  • 如果只在美国的公路上训练,它可能认得红绿灯,但到了印度的街头,它可能分不清那是牛在过马路还是人在跳舞,或者听不懂当地的喇叭声意味着什么。
  • MINERVA-Cultural 就是为了让 AI 学会**“入乡随俗”**。它告诉我们,未来的 AI 不能只是“懂英语的聪明人”,而必须是“懂世界各地文化的本地通”。

总结

这篇论文就像给 AI 行业敲了一记警钟:现在的 AI 太“西方中心”了,太“英语依赖”了。 它们在面对丰富多彩的真实世界时,就像是一个只会说英语的游客,虽然能看懂路牌,却看不懂当地的风土人情。

MINERVA-Cultural 不仅是一个更难、更公平的考试,更是一面镜子,照出了 AI 在文化理解上的巨大短板,并指引了未来让 AI 真正变得“全球通用”的方向。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →