← 最新论文
💻 computer science

Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models

Sparse-LaViDa 是一个新颖的框架,它通过在推理过程中动态截断冗余的掩码标记(masked tokens),同时利用专门的寄存器标记(register tokens)和一致的训练注意力掩码来保持生成质量,从而加速掩码离散扩散模型(Masked Discrete Diffusion Models),在多种多模态任务中实现了高达 2 倍的加速。

原作者: Shufan Li, Jiuxiang Gu, Kangning Liu, Zhe Lin, Zijun Wei, Aditya Grover, Jason Kuen

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Shufan Li, Jiuxiang Gu, Kangning Liu, Zhe Lin, Zijun Wei, Aditya Grover, Jason Kuen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在尝试拼凑一个巨大的拼图,但你没有看到包装盒上的图案,而是必须从零开始猜测每一块碎片的颜色和形状。在人工智能的世界里,这就是计算机试图创建图像或理解复杂场景时的情景。长期以来,科学家们一直在使用两种主要的工具:一种像作家打字写句子一样,通过逐块构建图像(称为自回归模型);另一种则从一个静态的、充满噪声的模糊图像开始,逐渐将其清理干净,直到图像显现出来(称为扩散模型)。最近,一种名为“掩码离散扩散”(Masked Discrete Diffusion)的新型混合方法成为了明星。它将文本和图像都视为一长串拼图碎片(即标记/tokens),计算机通过观察已知的碎片来学习预测缺失的部分。这非常强大,因为它允许人工智能一次性观察整个画面,而不仅仅是下一个碎片,这使得它在图像编辑或解决数学问题方面表现出色。然而,这里有一个问题:为了清理图像,计算机在每一步中都必须重新检查每一块拼图碎片,即使是那些已经解决或仍然隐藏的碎片。这就像一位厨师在炖汤时,每分钟都要品尝一下锅里的每一种食材,即使有些食材已经调味完美,他也得尝一下,只为了确保味道正确。这使得整个过程既缓慢又耗费计算资源。

于是,Sparse-LaViDa 登场了,它像是一个为这些 AI 模型量身定制的聪明“副厨”。这项工作的研究人员意识到,计算机并不需要每次都盯着整个拼图看;它只需要专注于那些当前正在被解决的碎片。他们构建了一个系统,能够动态地“截断”(truncate),或者说切掉那些不必要的掩码标记(即隐藏或已解决的碎片)在烹饪过程中的存在。但巧妙之处在于:你不能直接把这些碎片扔掉,否则人工智能可能会忘记整个图像的上下文。因此,Sparse-LaViDa 引入了特殊的“寄存器标记”(register tokens)。你可以把它们想象成微小的、神奇的书签,代表着缺失的碎片。它们是紧凑的摘要,告诉人工智能:“嘿,这里还有 1,000 块碎片,但你现在不需要逐一观察它们;只需信任这个书签即可。”这使得人工智能能够在保持全局观的同时,跳过冗余的工作。

论文证明了这种方法效果惊人。通过使用这些寄存器标记和一种特殊的内存组织方式(称为 KV 缓存/KV caching),这个新模型 Sparse-LaViDa 在不损失任何质量的前提下,显著提高了处理速度。在测试中,它使文本生成图像的速度提升了近 2 倍(具体为 1.96 倍加速),使图像编辑速度提升了近 3 倍2.84 倍加速),并使视觉数学推理速度提升了 2.80 倍。至关重要的是,作者展示了这不仅仅是适用于简单任务的小技巧;它保留了进行复杂任务的能力,如“局部重绘”(inpainting,填充图像缺失部分)和“外延绘制”(outpainting,扩展图像),而其他快速方法往往会破坏这些能力。研究人员指出,虽然我们通过微调现有模型实现了这些结果,但该方法在理论上未来也能够用于从头开始训练大规模模型。最终,Sparse-LaViDa 表明我们可以鱼与熊掌兼得:既拥有超快的生成速度,又不会牺牲那些让模型在理解和创造视觉世界方面如此出色的双向思维能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →