← 最新论文
💬 NLP

VMMU: A Vietnamese Multitask Multimodal Understanding and Reasoning Benchmark

本文介绍了 VMMU,这是一个包含 2,500 个跨越七个任务的多模态问题越南语基准测试,旨在评估视觉语言模型在英语之外进行真实视觉-文本推理的能力,并揭示了尽管当前模型在特定语言表现上很强,但其主要困难在于多模态接地而非 OCR。

原作者: Vy Tuong Dang, An Vo, Emilio Villa-Cueva, Quang Tau, Duc Dm, Thamar Solorio, Daeyoung Kim

发布于 2026-01-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Vy Tuong Dang, An Vo, Emilio Villa-Cueva, Quang Tau, Duc Dm, Thamar Solorio, Daeyoung Kim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一个非常聪明、精通多种语言的机器人助手。你想看看它是否能帮助一名越南学生解决一张图片中出现的难题。这张图片不仅仅是一张照片,它可能是一页教科书或驾驶考试试卷,其中包含了越南语文本,并混合了图表、图示和交通标志

这篇论文介绍了一个名为 VMMU 的新“测试”,旨在观察这些机器人在处理这类特定任务时的表现。以下是研究结果的详细拆解,使用了简单的类比:

1. 测试:一个“多任务”障碍赛

把 VMMU 想象成一个 AI 健身房,但机器人不是在举重,而是在解决 2,548 个不同的谜题。这些谜题涵盖了七个领域:数学、物理、化学、生物、地理、驾驶考试和智商测试。

难点在于?问题不仅仅是显示在屏幕上的文字。它们是嵌入在图像中的。为了回答问题,机器人必须:

  • 阅读图片中的越南语单词(就像读路牌一样)。
  • 观察图片部分(例如图表或地图)。
  • 将两者联系起来,从而得出答案。

2. 大惊喜:阅读并不是问题所在

研究人员首先问道:“机器人表现不佳是因为它不会读越南语吗?”
他们测试了机器人单纯转录(朗读出来)图像内文本的能力。

  • 结果: 机器人在阅读越南语文本方面表现得非常出色。它们的准确率几乎达到了 95%。
  • 类比: 想象一个学生可以完美地读出页面上的每一个字,但仍然做错了数学题,因为他们不理解这些数字是如何与图片相关的。问题不在于眼睛,而在于大脑。

3. 真正的挣扎:连点成线

当机器人尝试解决完整的题目(阅读 + 观察 + 推理)时,它们的得分显著下降。

  • 结果: 即使是最智能的商业机器人,也只能答对约 66% 的题目。
  • “思考”因素: 研究人员发现“快速型”机器人与“思考型”机器人之间存在巨大差异。
    • 快速型机器人: 它们反应迅速,得分在 50–70% 左右。
    • 思考型机器人: 这些模型会停下来通过步骤进行“思考”。它们的得分要高得多(73–86%)。
  • 类比: 这就像是一个学生脱口而出第一个想到的答案,与另一个停下来、画出图表并逐步梳理逻辑的学生之间的区别。“思考型”的学生表现得好得多。

4. “杂乱”问题

研究人员注意到,当文本和图片挤在一起形成一个混乱的图像时,机器人会感到困惑。

  • 实验: 他们将文本从图片中提取出来,以干净列表的形式交给机器人,同时单独把图片交给机器人。
  • 结果: 机器人在解决问题时变得更好了。
  • 类比: 这就像是在你试图解开一个谜题时,有人在房间另一头对着你大喊指令。如果他们把指令递给你一张干净的纸,让你专注于谜题碎片,你的表现会好得多。当文本与图像混合在一起时,机器人很难忽略掉这些“噪音”。

5. 翻译并无帮助

研究人员想知道:“也许机器人对越南语了解不够,如果我们把问题翻译成英语呢?”

  • 结果: 没有。将问题翻译成英语反而让机器人的表现变差了。
  • 类比: 想象一场驾驶考试,路标是越南语的,但指令是英语的。机器人会感到困惑,因为路标用越南语写着“停止”,但英语指令与视觉语境并不匹配。机器人需要理解整个越南语语境才能解决谜题。

6. “猜测”的习惯

最后,他们尝试完全去掉图片,只把文本问题交给机器人。

  • 结果: 机器人的得分下降了,但并没有降到零。它们仍然能答对约 51%(相比之下,随机猜测的正确率是 25%)。
  • 类比: 事实证明,机器人就像是背下了考试“套路”的学生。即使没有图片,它们也能仅凭问题的措辞来猜出正确答案,利用它们之前见过的模式。它们并不是真的在“看”答案,而是在靠优秀的猜测能力。

总结

论文得出结论:目前的 AI 模型非常擅长阅读图像中的越南语文本,但在连接这些文本与视觉证据以及进行推理方面仍然面临困难。它们需要学习如何更深入地“思考”,并学会如何处理文本与图像混合在一起的复杂现实,而不是仅仅依赖捷径或猜测。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →