← 最新论文
💻 computer science

LaViDa: A Large Diffusion Language Model for Multimodal Understanding

LaViDa 推出了一种基于离散扩散机制的新型视觉-语言模型家族,该家族利用并行解码和双向上下文,与传统的自回归模型相比,实现了具有竞争力的性能、更快的推理速度以及更强的可控性。

原作者: Shufan Li, Konstantinos Kallidromitis, Hritik Bansal, Akash Gokul, Yusuke Kato, Kazuki Kozuka, Jason Kuen, Zhe Lin, Kai-Wei Chang, Aditya Grover

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Shufan Li, Konstantinos Kallidromitis, Hritik Bansal, Akash Gokul, Yusuke Kato, Kazuki Kozuka, Jason Kuen, Zhe Lin, Kai-Wei Chang, Aditya Grover

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个计算机能同时“看”和“说”的世界。这就是视觉语言模型(Vision-Language Models, VLMs)的领域——这些超级智能的 AI 助手可以看着日落的照片写一首诗,或者通过观察复杂的图表来解释趋势。多年来,这些模型的标准思考方式就像一个正在考试的学生:它们一次只回答一个词,严格地从左到右进行。它们先写下“这”,然后是“天”,接着是“空”,绝不会回头去修改之前的词。虽然这种方式效果不错,但由于无法并行写作,速度较慢;而且它很僵化,如果它们把句子的第一个词写错了,如果不重新开始,就很难轻松地回去修正。

但如果有一种不同的方式呢?想象一下,你不是逐字逐句地写句子,而是从一张布满了问号的白纸开始,慢慢填满它们,同时决定哪些词该放在哪里,不断优化你的选择,直到画面变得清晰。这就是“扩散模型”(diffusion models)背后的理念。扩散模型最初因能从噪声中创造出精美的图像而闻名,但研究人员最近尝试将这种“填空式”的方法用于文本。一个大问题是:我们能否将这种灵活的、并行的思考方式与理解图像的能力结合起来?如果我们能做到这一点,我们可能会得到不仅更擅长遵循严格规则(比如写一首每一行都必须以特定字母开头的诗)的 AI,而且由于不需要等待一个词完成后再开始下一个词,它的速度也会快得多。

于是,LaViDa(大规模视觉语言扩散模型)诞生了,这是由来自加州大学洛杉矶分校(UCLA)、松下、Adobe 和 Salesforce 的研究人员推出的一系列全新 AI 模型。可以将 LaViDa 视为第一位使用扩散方法来理解图片并对其进行描述的“多任务艺术家”。LaViDa 不像传统的机器人那样逐字逐句地讲故事,而是从一个由“掩码”(placeholders,占位符)组成的空白画布开始,逐渐揭示答案,以一种让它能同时审视整个句子的方式来填补空白。

研究人员发现,这种方法拥有一些“超能力”。因为 LaViDa 在最终确定句子之前可以观察整个句子结构,所以它在需要严格规则的任务中表现得极其出色,例如完成一首每一行都必须以特定字母开头的诗。在测试中,它在这些“受限型”任务上碾压了竞争对手,比表现最好的标准模型性能提升了 59%。它还为用户提供了一个独特的“速度调节旋钮”:你可以告诉它通过一次填充更少的空格来实现极速,或者通过更多步骤来精炼答案以获得超高质量。在图像描述任务中,它的速度几乎比对手快了 2 倍,同时还能写出更好的描述(在名为 CIDEr 的质量指标上得分高出 4.1 分)。

然而,论文也指出,这种新方法并不是能瞬间解决一切问题的“魔杖”。研究人员必须发明一些巧妙的技巧才能使其高效运作。首先,他们创建了一种“互补掩码”(complementary masking)技术,这就像是同时给模型两个不同版本的拼图去解,这样它就不会错过任何重要的线索。他们还构建了一个“前缀 DLM”(Prefix-DLM)系统,它就像一个智能捷径,允许模型在每次猜测新词时,无需反复重读图像和问题。

尽管取得了这些成功,论文也谨慎地指出 LaViDa 仍有成长空间。虽然它在许多推理和通用知识测试中击败了其他模型,但由于它必须压缩图像细节以适应内存,它有时在阅读图像中的微小文字(OCR)方面会感到吃力。作者建议,虽然扩散模型是标准“逐字逐句”方式之外的一种强大且充满前景的替代方案,但它们仍在学习如何进行规模化扩展,以匹配那些现有的、对数据需求极大的顶级 AI 模型。最终,LaViDa 证明了“填空式”方法不仅仅适用于制作图片;它也可以是计算机理解我们视觉世界的一种强大、灵活且快速的方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →