← 最新论文
🤖 machine learning

FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens

FuseLIP 引入了一种新颖的多模态嵌入架构,该架构利用离散图像分词器通过早期融合将文本和图像处理统一在单个 Transformer 中,从而实现更丰富的跨模态交互,并在各种嵌入任务中超越了传统的后期融合方法。

原作者: Christian Schlarmann, Francesco Croce, Nicolas Flammarion, Matthias Hein

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Christian Schlarmann, Francesco Croce, Nicolas Flammarion, Matthias Hein

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,计算机在通过视觉和语言这两个截然不同的维度来理解世界方面已经变得非常出色。多年来,最成功的系统一直将这两种感官视为独立的流。它们使用一个专门的大脑来处理图像,另一个大脑来处理句子,然后强迫这两个独立的流在处理过程的最末端汇合。这种方法让机器能够完成令人印象深刻的壮举,例如在没有任何针对特定图像的预训练情况下,根据文本描述找到特定的照片。然而,这种分离造成了一个盲点。当人类看着一张图片并阅读关于它的问题时,他们并不会在结合两者之前分别孤立地处理图像和文字;他们是同时理解两者之间的关系的。旧的方法在处理需要一边观察图像视觉细节、一边阅读特定指令的任务时会显得力不从心,因为这两个信息流在彼此相遇之前,就已经在各自独立的状态下被处理得过于深入了。

一组研究人员提出了一种构建这些系统的新方法,这种方法模仿了人类从一开始就融合视觉和听觉的能力。他们引入了一种名为 FuseLIP 的新架构,放弃了为图像和文本建立独立大脑的想法。相反,他们将图片和文字都转换为单一、统一的基本构建块(或称为“标记/tokens”)流,并将它们输入到同一个单一的处理引擎中。通过这样做,该系统允许视觉和语言信息在学习过程的每一个步骤中进行交互,而不是等到最后。这种信息的早期混合使得模型能够学习到旧有的分离式系统所遗漏的复杂关系,特别是在任务涉及理解特定指令如何改变或描述一个视觉场景时。

研究人员构建这个新系统的第一步,是找到一种方法将图像转化为计算机用于文本的同类离散单元。虽然文本本质上是由字母和单词组成的,但图像仅仅是彩色像素的网格。为了弥补这一差距,团队使用了一个工具将图像压缩成 12 序列的独特编码,有效地将一张图片翻译成了一句“视觉单词”。随后,他们将这些视觉单词与标准的文本单词组合成一个长列表。这个列表由一个单一的 Transformer 模型进行处理,这是一种旨在理解上下文和关系类型的神经网络。由于图像和文本从一开始就混合在一起,模型可以观察到像“左边”或“旋转”这样的词汇是如何直接影响它所观察到的视觉特征的,从而创造出更丰富的综合输入理解。

为了教导这个新系统,研究人员必须创建一个迫使它同时关注图片和文字的课程。他们收集了大量的标准图像和文本数据,但也发明了新的方式来生成需要模型解决谜题的训练示例。例如,他们创建了一些任务,要求模型根据文本描述来识别经过裁剪、旋转或翻转的图像。在这些场景中,仅仅识别出图片中的物体是不够的;模型必须理解特定的空间指令才能找到正确答案。他们还训练系统回答关于图像的问题,并根据描述定位图片的特定部分。至关重要的是,他们通过向模型展示那些错误答案看起来与正确答案非常相似的困难案例来进行教学,从而迫使模型学习分辨正确方向的对象与稍微偏移的对象之间的细微差别。

当他们用这种新方法与保持图像和文本处理分离的传统方法进行对比测试时,结果令人瞩目。新系统 FuseLIP 在需要深度理解文本与图像如何交互的任务上,始终优于旧模型。当被要求根据文本线索识别旋转后的图像或特定的裁剪区域时,传统系统经常失败,而新系统则能以高准确度解决这些问题。研究人员发现,那些仅在末端合并信息的旧系统,一旦图像被孤立处理,就无法获取解决这些谜题所需的精细视觉细节。新系统通过早期混合信息的能力,使其在应用语言指令的同时,能够保留必要的视觉结构。

研究还表明,模型的训练方式与它的架构同样重要。研究人员指出,在训练数据中包含这些困难且具有误导性的示例对于系统学习至关重要。如果没有这些示例,模型很难区分看起来相似的选项。此外,他们证明了这种新架构可以使用一种双重目的的学习方法进行训练。它既学习将图像与文本进行匹配,也学习预测输入的缺失部分,这种技术进一步强化了它对数据的理解。这种早期混合与针对挑战性示例的严格训练相结合,使模型达到了最先进的性能水平,证明了对于需要视觉与语言真正整合的任务而言,单一且统一的处理方式不仅可行,而且更为优越。

这项工作的意义不仅在于更高的测试分数。通过展示单个编码器可以有效地处理图像和文本,研究人员为更高效、更强大的 AI 系统开辟了一条路径。这些系统不需要维持两套独立的、沉重的机械装置来理解世界;它们可以使用一个精简的引擎来共同处理一切。虽然新系统在通过其分词器处理单张图像时需要更多的计算能力,但整体训练过程更加高效,且生成的模型更加稳健。研究人员承认,在扩大数据和模型规模方面仍有提升空间,但他们的发现表明,多模态理解的未来在于“早期融合”,即计算机学会像人类一样同时进行观察与阅读。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →