← 最新论文
💻 computer science

Vision-Language Models are Fragile Multilingual Associators

本文引入了 M2^2BIND 基准测试,旨在证明视觉语言模型表现出脆弱的、依赖于语言的概念绑定能力,这种能力在跨语系和跨文字的多语言设置下会显著崩溃,从而挑战了在不同语言间性能保持一致性的假设。

原作者: Ritabrata Chakraborty, Rajatsubhra Chakraborty, Shivakumara Palaiahnakote, Angelo Cangelosi, Umapada Pal

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Ritabrata Chakraborty, Rajatsubhra Chakraborty, Shivakumara Palaiahnakote, Angelo Cangelosi, Umapada Pal

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正走在一个繁忙的国际市场里。你看到一个鲜红色的苹果。在你的脑海中,“红色”这个词与那个苹果的图像融合成了一个单一且不可动摇的概念。无论摊主称它为 rougehong 还是 ahmar,你的大脑都会瞬间明白它们指的都是同一个闪亮的果实。这种将我们所见的景象与所听到的语言联系起来的能力——无论所使用的语言是什么——是人类自出生以来就拥有的超能力。

现在,想象一下教一个机器人也做到这一点。我们已经制造出了强大的“视觉-语言模型”(VLMs)——这些人工智能系统可以观察图片并回答关于图片的问题。我们假设,如果这些机器人学会了将一个圆锥体的图像与英语中的“yellow”联系起来,它们也会自动知道“jaune”(法语)或“huang”(中文)的意思是一样的。这看起来显而易见,对吧?但在人工智能的世界里,“显而易见”往往是出错的地方。这篇论文提出了一个简单但令人惊悚的问题:如果我们教人工智能将一个视觉物体与一种语言的描述联系起来,当我们将语言切换到另一种时,这种联系还能存续吗?或者说,这种连接是否会断裂,导致机器人即便给出了正确的答案,却依然陷入混乱?

伟大的语言大转场

由 Ritabrata Chakraborty 及其同事领导的研究人员决定对这一假设进行测试。他们创造了一个新的游戏,叫做 M2BIND。把它想象成一个魔术:他们向人工智能展示两个 3D 形状——一个圆锥体和一个立方体。然后,他们用一种语言给出“秘密规则”(上下文),并用一种完全不同的语言提出问题(查询)。

这个魔术的操作流程如下:

  1. 场景: 人工智能看到一个青色的立方体和一个黄色的圆锥体。
  2. 规则(上下文): 用法语告诉人工智能:“The cyan object contains item P. The yellow object contains item I.”(青色的物体包含物品 P。黄色的物体包含物品 I。)
  3. 问题(查询): 用英语问人工智能:“Which item does the cone contain?”(圆锥体包含哪件物品?)

为了得到正确答案,人工智能必须进行一场“脑力体操”:它必须观察圆锥体,意识到它是黄色的,记住法语规则说“黄色 = I”,然后回答“I”。如果人工智能能做到这一点,就证明它成功地将视觉形状与颜色、以及颜色与物品进行了跨语言的“绑定”。

重大发现:“无声崩溃”

结果令人震惊。论文发现,这些 AI 模型是脆弱的多语言关联者。虽然它们在大多数情况下仍能给出正确答案,但当语言差异过大时,它们获取答案的方式却瓦解了。

研究人员使用一个名为**因子分解边际(Factorization Margin, FM)**的指标来衡量这一点。你可以把它理解为一个“置信度分数”,用于衡量 AI 将概念粘合在一起的强度。

  • 当 AI 对规则和问题使用同一种语言时(例如英语到英语),这种“胶水”非常强韧。得分达到了健康的 5.45
  • 但当他们混合使用不同语系的语言时——比如用中文作为规则,用阿拉伯语作为问题——这种胶水就变成了尘土。得分骤降至 2.80

这是一种“绑定崩溃”。这意味着,即使人工智能猜对了答案,它也并没有像人类那样真正地将各个点连接起来。这就像是一个背下了答案解析、却并不理解数学逻辑的学生。论文指出,对于差异巨大的语言(如跨语系或使用不同脚本,如拉丁字母与阿拉伯字母),人工智能会失去维持这种关联的能力。

为什么会这样?“Token”瓶颈

作者深入挖掘以寻找原因。他们发现了两个主要元凶:

  1. 分词器(Tokenizer)问题: 想象人工智能阅读文本就像人读书一样,但它看到的不是单词,而是“token”(字符块)。有些语言是“贪婪”的吞噬者。论文发现,要写出同样的句子,阿拉伯语需要的 token 比英语多出 27.6%。这膨胀了人工智能的记忆,迫使它截断句子(截断)或仅仅是被压垮。这就像试图把一头大象塞进一辆小汽车里;空间极其紧凑,东西被挤扁了。
  2. “深夜突击”的大脑: 研究人员使用了一种特殊的“因果干预”技术来窥探 AI 的大脑层。他们发现,当语言相同时,AI 在思考过程的中段就能理清逻辑。但当语言不同时,AI 必须将工作推迟到最后时刻,就像一个在考试前最后一刻临时抱佛脚的学生。这种“后层”计算能力较弱,且不够可靠。

好消息:亲戚之间相处融洽

不过也有好消息!论文发现,如果语言是“亲戚”,人工智能的表现会好得多。

  • 日耳曼语族: 英语、荷兰语和德语是近亲。当 AI 在这些语言之间切换时,连接保持稳固(得分在 5.00–5.30 左右)。
  • 罗曼语族: 法语、意大利语和西班牙语也表现良好。
  • 陌生人: 但当人工智能尝试将英语与中文,或法语与阿拉伯语混合使用时,性能显著下降。

这表明,人工智能的内部“字典”是根据语言之间的相似度来组织的。如果语言共享同一个家族树,AI 可以轻松翻译概念。如果它们是陌生人,AI 就会难以架起沟通的桥梁。

这对未来意味着什么

论文总结道,我们不能仅仅因为人工智能通过了某种语言的测试,就假设它们是真正的“多语言”模型。如果你在全球化环境中部署一个混合语言的人工智能,你得到的答案可能看起来是正确的,但其背后的逻辑基础却是摇摇欲坠、破碎不堪的。

作者警告说,仅仅依赖“准确率”(是否得到了正确答案?)是危险的。一个模型的准确率可能高达 90%,但其内部逻辑可能已经完全崩溃。他们建议,为了让这些模型在全世界范围内真正可靠,我们需要修复它们处理不同脚本和语言的方式,而不是仅仅寄希望于它们能自行解决问题。目前来看,那个能够毫不费力地在每种人类语言间融合视觉与语言的梦想,依然只是一个梦想,其根基上还存在着几道裂痕。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →