← 最新论文
💬 NLP

Language-Conditioned Visual Grounding with CLIP Multilingual

本文将视觉编码器隔离为跨越十三种语言的一致因素,以证明多语言视觉接地差异主要源于文本分支的局限性和空间错位而非信号坍缩,揭示扩大视觉模型规模虽能改善部分低资源语言的表现却会加剧其他语言的问题,并证实该方法的能效可行性。

原作者: J. de Curtò, Mauro Liz, I. de ZarzÃ

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: J. de Curtò, Mauro Liz, I. de ZarzÃ

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一个非常聪明的机器人,它可以查看图片并找出其中的特定物体,比如“汽车”或“行人”。你可以用多种不同的语言告诉这个机器人该寻找什么。但是,这篇论文的研究人员发现,当你用一种不太常见的语言(如巴斯克语或卢森堡语)与机器人交流时,它往往会指向图片中错误的位置,尽管它看起来在“努力观察”的程度与使用英语时并无二致。

以下是他们所做的工作及其发现的一个简单拆解,并借助一些日常类比来说明。

实验:受控测试

研究人员想要弄清楚为什么机器人会在某些语言中犯错。是因为机器人的“眼睛”(视觉部分)与某些语言配合不佳?还是因为机器人的“大脑”(理解单词的文本部分)在这些语言中能力较弱?

为了测试这一点,他们构建了一个特殊的设置:

  • 眼睛:他们对每一种语言都使用了完全相同的相机和视觉系统。
  • 大脑:他们仅替换了理解单词的部分,将其针对 13 种不同的语言进行了调整(从西班牙语和法语等常见语言,到巴斯克语和卢森堡语等罕见语言)。

这就像给 13 个不同的人戴上同一副眼镜,并让他们描述同一张照片。如果描述有误,我们就知道问题不在于眼镜,而在于这个人描述所见之物的能力。

主要发现

1. 问题出在“翻译者”,而非“相机”
他们发现,即使使用完全相同的相机,当使用低资源语言时,机器人识别物体的能力也大打折扣。

  • 类比:想象一位对城市了如指掌的导游。如果你用英语询问,他们会正确地指向埃菲尔铁塔。如果你用一种他们几乎不懂的语言询问,他们可能会指向一棵随机的树。导游的“眼睛”没有改变;薄弱环节在于他们对语言的了解。
  • 结果:“惩罚”(即性能下降)完全归因于人工智能的文本处理部分,而非视觉部分。

2. 更大的“大脑”并不总能解决问题
通常,当人工智能模型变得更大、更强大时,它们在所有方面都会变得更好。研究人员测试了一个小型模型和一个大 7 倍的模型。

  • 意外发现:对于某些语言(如阿拉伯语和中文),拥有更大的“大脑”确实有所帮助。但对于其他语言(如巴斯克语和卢森堡语),更大的“大脑”反而使情况变得更糟
  • 类比:把它想象成一个图书馆。
    • 如果一种语言处于“分词劣势”(如阿拉伯语),它只是需要一个更大的图书馆来容纳更多的词汇。更大的模型会有所帮助。
    • 如果一种语言处于“语料库覆盖劣势”(如巴斯克语),这意味着图书馆里从一开始就几乎没有该语言的书籍。如果书籍本身就不存在,给图书管理员一个更大的图书馆也无济于事。事实上,更大的图书管理员可能会因为拥有更多的“自信”但没有更好的数据,而更自信地指向错误的地方。

3. 机器人是“自信地错误”
这是最重要的发现。当机器人在这些语言中失败时,它并不会变得“安静”或不确定。相反,它会变得大声且自信,但它指向的是错误的位置。

  • 类比:想象一个 GPS 导航系统。
    • 信号崩溃(他们未发现的):GPS 说:“我不知道你在哪里”,并显示空白屏幕。
    • 空间错位(他们发现的):GPS 以 100% 的自信说:“你就在这里!”,但它指向的是三条街外的一栋房子。
  • 后果:由于机器人如此自信,你不能简单地告诉系统:“如果你不确定,就不要显示结果。”系统确实很确定,但它确定的是错误的事情。

能源效率:一种廉价的解决方案

最后,研究人员测量了这一过程消耗了多少电力。

  • 结果:这种方法极其节能。它使用的能量大约比那些花哨的、会说话的人工智能模型(如那些写文章或与你聊天的模型)少 20 到 50 倍
  • 启示:如果你需要一个系统,能够快速用多种语言指出图片中的物体,同时又不消耗大量电力,那么这种“密集定位”方法是一个非常实用且节能的选择。

总结

这篇论文证明,对于这些人工智能模型而言,罕见语言的问题不在于人工智能无法“看见”图像;而在于人工智能无法充分“理解”单词,以便将它们与正确的位置匹配。如果训练数据(图书馆里的书)缺失,仅仅让人工智能变得更大并不能解决这个问题。而且,由于人工智能经常是“自信地错误”,我们不能仅仅依赖其置信度来判断它是否在说真话。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →