← 最新论文
💻 computer science

Why Vision Fails as a Universal Bridge: Rectifying Modality Asynchrony in Multilingual MLLMs

本文识别了“幽灵锚点”(Ghost Anchor)现象,即早期层级的以英语为中心的翻译过程使得视觉信号在功能上变得不可见,并提出了具有主动视觉锚定(Proactive Visual Anchoring)功能的 ANCHOR 框架,以恢复视觉-语言对齐并显著提升非英语视觉推理性能。

原作者: Yihang Du, Juhao Liang, Zhengzhao Lai, Siyu Li, Yan Hu

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Yihang Du, Juhao Liang, Zhengzhao Lai, Siyu Li, Yan Hu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下这样一个世界:计算机可以观察一张照片,并用任何人类使用的语言对其进行完美的描述。这就是现代人工智能的承诺,具体而言是一种被称为“多模态大语言模型”的系统。这些系统通过将强大的文本处理大脑与视觉之眼相结合而构建,使其能够同时理解文字和图像。多年来,研究人员一直认为视觉是一种通用的桥梁。其逻辑很简单:无论你称之为“giraffe”、“jirafa”还是“zhǎngjǐnglù”,长颈鹿的图像都是同一个物体。因此,计算机的视觉部分应该能帮助它在不同语言之间转换概念,将抽象的词汇锚定在具体的现实中。然而,尽管这些系统在英语方面表现出色,但当被要求用其他语言对图像进行推理时,它们往往会出错,未能达到真正通用理解的理想状态。

一个研究小组致力于了解为什么会出现这种脱节。他们怀疑问题不在于缺乏数据,而在于计算机内部处理过程中的一个时间问题。通过窥视这些模型的内部层级,他们发现了一种被称为“幽灵锚点”(Ghost Anchor)的现象。在一个完美同步的系统中,视觉信息和语言信息会同时到达并融合,从而让图像能够引导翻译。然而,研究人员发现,计算机的语言中心几乎会立即将非英语单词翻译成英语的思想框架。与此同时,系统的视觉部分处理实际所见内容的速度仍然很慢。当语言已经稳定在以英语为中心的含义时,视觉细节仍然过于模糊,无法提供任何帮助。图像在物理上存在于计算机的内存中,但在语义上却是不可见的,就像一个无法参与对话的幽默幽灵。

为了证明这一点,研究人员进行了一系列实验,他们用看起来像电视雪花般的随机静态噪声替换了实际图像,但保持了相同的大小和形状。他们发现,在处理的早期阶段,即使图像消失了,计算机对文本的翻译也不会发生任何变化。这证实了在关键时刻,视觉信号并没有影响语言翻译。计算机实际上是在“盲目”地进行文本翻译,依赖于其内在的英语习惯,而不是面前的图片。这种延迟创造了一个错失的机会窗口,在这个窗口期内,图像本可以锚定词汇的含义,防止系统产生偏差。

随后,研究人员提出了一种名为 ANCHOR 的解决方案,这是一个旨在修复这种时间不匹配问题的框架。与其等待视觉信息自然追赶,他们引入了一种方法,强制计算机在其处理链的更早阶段关注图像。他们使用一个独立的、经过高度训练的视觉系统来充当老师,在语言翻译开始之前,向主模型展示图像究竟代表什么。这种主动引导确保了视觉细节在翻译开始时就已经准备就绪,并能随时影响文本。这好比确保翻译人员在开口说话之前,就已经打开了字典并将图片摆在了桌上,而不是等到话说到一半时才意识到需要查看参考资料。

当在涉及复杂推理和文化问题的广泛基准测试中进行测试时,这种新方法显示出了明显的结果。经过该方法训练的模型在回答关于图像的其他语言问题(包括困难的低资源语言)时,表现显著提升。至关重要的是,它们并没有丧失理解英语的能力;事实上,它们在英语方面的表现保持稳定甚至略有提高。这项研究表明,通过同步视觉和语言信息的到达,计算机可以建立起一种跨越国界的更稳健的理解能力。这一发现挑战了“仅仅喂入更多数据是唯一途径”的观点,转而强调了信息在机器内部如何进行时间同步和组合的重要性。这项工作为实现能够真正看懂并用世界各种语言流畅表达的通用人工智能提供了一条更清晰的路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →