← 最新论文
💬 NLP

Multimodal Evaluation of Russian-language Architectures

本文介绍了 MERA Multi,这是首个针对俄语架构的开放式多模态评估框架,其特点是包含涵盖文本、图像、音频和视频模态的 18 个具有文化特异性的任务,旨在评估模型能力并为多种语言建立可复制的方法论。

原作者: Artem Chervyakov, Ulyana Isaeva, Anton Emelyanov, Artem Safin, Maria Tikhonova, Alexander Kharitonov, Yulia Lyakh, Petr Surovtsev, Denis Shevelev, Vildan Saburov, Vasily Konovalov, Elisei Rykov, Ivan
发布于 2026-01-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Artem Chervyakov, Ulyana Isaeva, Anton Emelyanov, Artem Safin, Maria Tikhonova, Alexander Kharitonov, Yulia Lyakh, Petr Surovtsev, Denis Shevelev, Vildan Saburov, Vasily Konovalov, Elisei Rykov, Ivan Sviridov, Amina Miftakhova, Ilseyar Alimova, Alexander Panchenko, Alexander Kapitanov, Alena Fenogenova

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一群非常聪明的新型机器人,它们能同时看图片、听声音、看视频并阅读文本。这些被称为多模态大语言模型(MLLMs)。它们每天都在变得更加强大,但直到现在,我们只有一种通过英语来测试它们的方法。

如果你想测试一个机器人的理解俄罗斯文化、民俗或特定俄罗斯笑话的能力,你没有任何尺子可以用来衡量它。现有的测试就像是用一个仅为撒哈拉沙漠校准过的温度计来测量俄罗斯的严冬。

这篇论文介绍了 MERA Multi,这是一个全新的、开放的“考试”,专门设计用于测试人工智能机器人对俄语及其跨越文本、图像、音频和视频等所有感官的理解能力。

以下是他们工作的详细分解,使用了简单的类比:

1. 问题所在:“仅限英语”的盲点

把当前的人工智能世界想象成一座巨大的图书馆。大多数书籍(基准测试/测试集)都是用英语编写的。如果你想知道一名学生是否能读懂俄语,你不能只是递给他们一本英文书并说,“读一下这个。”你需要一个用俄语编写、且理解俄语语境的测试。

  • 差距: 之前的俄语测试仅关注文本。它们没有检查人工智能是否能理解一段俄罗斯电影片段、一首俄罗斯歌曲或一张俄罗斯街景的照片。
  • 解决方案: 作者构建了 MERA Multi,这是第一个针对 AI 的“俄语驾驶执照考试”,它检查了所有的四种感官。

2. 考试内容:18 项不同任务

他们没有只创建一个大测试,而是创建了 18 个不同的微型考试。想象一下一个拥有 18 个不同站点的健身房:

  • “耳朵”站点(音频): AI 能分辨出俄罗斯民歌和流行歌曲的区别吗?它能理解像“打开加热器”这样的语音指令吗?
  • “眼睛”站点(图像): AI 能看着一张俄罗斯数学题的照片并解出题目吗?它能从照片中读出俄罗斯餐厅的菜单吗?它能发现图片是否“奇怪”(比如一只企鹅在开车)吗?
  • “视频”站点: AI 能观看一段俄罗斯烹饪节目的短片并按顺序解释步骤吗?
  • “大脑”站点(推理): AI 能观察一张图片并理解背后的“故事”,而不仅仅是物体本身吗?(例如:基于视觉线索判断“这个人为什么难过?”)。

3. “文化翻译官”

作者并没有只是将英语测试翻译成俄语。那就像是将一个关于美国棒球的笑话翻译成俄语;对于俄语使用者来说,这根本讲不通。

  • 定制构建: 他们从零开始构建这些测试,使用了俄罗斯文化元素(如苏联电影、俄罗斯民俗和当地历史)。
  • “图灵测试”的巧思: 一些任务旨在观察 AI 是否能进行自然、像人类一样的俄语对话,理解讽刺、习语和文化细微差别,就像真实的人类一样。

4. 评分系统:“聪明的老师”

如何给一个给出冗长、啰嗦答案的 AI 打分?

  • 人类基准: 首先,真实的人类参加了测试,以设定一个“黄金标准”分数。
  • “裁判”AI: 由于人类无法立即为数千个 AI 答案打分,作者训练了一个特殊的“裁判 AI”。把这个裁判想象成一位严格但公正的老师。它不仅寻找准确的单词,还会检查含义是否正确。
  • 两个分数: 他们给 AI 两个分数:
    1. 精确匹配: 它是否说了完全正确的词?
    2. 语义分数: 即使措辞略有不同,它是否抓住了意思

5. 保持公平(防作弊)

AI 测试中的一个大问题是“数据泄露”。这就像是一个学生在考试前就背下了测试题,因为测试题在无意中被用于教导这个学生。

  • 水印: 作者在他们的测试数据上放置了不可见的“水印”(就像绘画中的隐藏签名),以追踪 AI 模型是否在训练期间偷偷学习了测试数据。
  • 泄露检测: 他们构建了一个“测谎仪”工具,可以识别模型是否见过这些测试题目。如果模型试图作弊,系统可以捕捉到它。

6. 结果:谁通过了?

他们测试了 50 多个不同的 AI 模型(包括免费/开源和付费/闭源模型)。

  • 获胜者: 表现最好的模型是来自 Qwen 系列的“全能模型”(尝试做所有事情的模型)。它们获得了最高总分,因为它们在所有不同的站点都表现出色,而不仅仅是某一个。
  • 专家型模型: 一些模型在某一方面很擅长(比如只理解音频),但在其他方面表现糟糕。
  • 现实检查: 即便是最好的模型,在处理复杂的俄罗斯文化细微差别和困难的推理任务时仍然感到吃力。人类的表现与 AI 的表现之间仍然存在巨大的差距。

总结

MERA Multi 是一份全面的、具有文化意识的俄罗斯语 AI “成绩单”。它证明了要真正理解一种语言,AI 需要理解其文化、历史和语境,而不仅仅是字典里的定义。它为研究人员提供了一种公平、透明的方式,来观察哪些 AI 模型是真的聪明,而哪些只是在瞎猜。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →