Analyzing Diffusion and Autoregressive Vision Language Models in Multimodal Embedding Space
本文提出了首个系统性研究,旨在比较多模态扩散语言模型与自回归视觉语言模型作为嵌入工具的表现,研究结果表明,尽管前者由于图文对齐不足而普遍表现较差,但这种性能差距在特定模型之间存在显著差异。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你拥有一个巨大的图书馆,其中的每一本书、照片和视频并不是存储在书架上,而是以一种独特的“氛围”或“指纹”形式存储的。在人工智能的世界里,这些指纹被称为嵌入(embeddings)。它们让计算机能够理解一张狗的照片和“狗”这个词是相关的,尽管一个是图像,一个是文本。
长期以来,创建这些指纹的最佳方式是使用自回归模型(Autoregressive Models)。把它们想象成一个正在读书的人,从左到右,一次读一个词。它们非常擅长理解上下文,因为它们是循序渐进地构建意义的。
最近,一种被称为**扩散模型(Diffusion Models)**的新型 AI 成为了热门。想象一下,它们就像一位雕塑家,从一块被噪声覆盖的大理石块开始,慢慢凿去噪声,从而显现出雕像。或者,把它们想象成一个可以同时观察整个句子并填补缺失单词的人,而不是一个接一个地进行猜测。这些模型之所以出色,是因为它们可以同时看到“大局”(双向注意力)。
核心问题
这篇论文的研究人员提出了一个简单的问题:这些新的“雕塑家”(扩散)模型在创建这些“氛围”指纹方面,能否做得和旧的“读者”(自回归)模型一样好?
实验过程
为了找出答案,团队选取了两个最好的“雕塑家”模型(名为 LaViDa 和 MMaDA)以及两个最好的“读者”模型(名为 LLaVA-1.6 和 Qwen2.5-VL)。他们通过一种标准的训练方法(例如教它们将图片与正确的描述进行匹配)来教授这些模型如何创建这些指纹。
随后,他们在三种不同的场景下对它们进行了测试:
- 分类(Classification): “这是什么图片?”(例如:是猫还是狗?)
- 视觉问答(VQA): “看着这张图表,最高值是多少?”
- 检索(Retrieval): “帮我找一张符合这个特定描述的图片。”
结果:“雕塑家”陷入苦战
结果令人惊讶。尽管“雕塑家”模型(扩散模型)拥有同时观察全局的超能力,但它们通常的表现逊于“读者”模型。
- “优秀的”雕塑家(LaViDa): 这个模型表现得相当不错。它仅略逊于最好的“读者”模型(在 100 分制下低了约 3 到 4 分)。它在处理新的、不熟悉的数据类型(域外数据)时表现尤为出色,这表明它具有更强的灵活性。
- “挣扎的”雕塑家(MMaDA): 这个模型差距巨大。在所有测试中,它的得分都比“读者”模型低了 20 多分。它根本无法跟上节奏。
为什么会这样?
研究人员进行了深入研究,以了解为什么“雕塑家”们处于劣势。他们发现了两个主要原因:
- 指纹不匹配: 在“读者”模型中,图片和文本在指纹空间中靠得非常近(它们完美对齐)。而在“雕塑家”模型中,图片的指纹和文本的指纹往往保持较远距离,就像两个人试图握手,却站在房间的两端。这些模型未能学会将图像和文本如此紧密地联系在一起。
- 训练目标错误: “挣扎的”模型(MMaDA)被训练同时做两件事:既要理解图像,又要从零开始生成新图像。研究人员怀疑,试图成为一名“画家”(生成图像)分散了模型作为一名优秀“图书管理员”(创建精确指纹用于搜索)的注意力。
总结
尽管扩散模型非常令人兴奋且拥有像“同时观察全景”这样酷炫的特性,但它们尚未准备好取代旧的“读者”模型来创建易于搜索的指纹。由于“读者”模型能更好地将所见与所读紧密结合,它们仍然稳坐准确性的宝座。
论文得出结论,虽然扩散模型具有潜力(尤其是 LaViDa 模型),但它们需要显著提升图像与文本的对齐能力,才能成为处理这些任务的首选方案。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。