← 最新论文
💻 computer science

Lavida-O: Elastic Large Masked Diffusion Models for Unified Multimodal Understanding and Generation

Lavida-O 是一种统一的掩码扩散模型,其采用了新颖的弹性混合 Transformer(Elastic Mixture-of-Transformers)架构和迭代自反思能力,在高清图像生成、目标定位及图像编辑方面实现了最先进的性能,并超越了现有的自回归模型和连续扩散模型。

原作者: Shufan Li, Jiuxiang Gu, Kangning Liu, Zhe Lin, Zijun Wei, Aditya Grover, Jason Kuen

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Shufan Li, Jiuxiang Gu, Kangning Liu, Zhe Lin, Zijun Wei, Aditya Grover, Jason Kuen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下这样一个世界:计算机可以观察一张图片并准确告诉你正在发生什么,或者根据一个简单的句子从零开始绘制出一幅全新的画作。长期以来,科学家们必须为这些工作构建两种不同类型的机器人:一种是用于理解图像的“大脑”,另一种是用于创作图像的“艺术家”。但就像人类既能读懂地图又能绘制素描一样,研究人员现在正试图构建一个能够同时胜任这两项工作的单一、超级智能的 AI。这个领域被称为“多模态建模”(multimodal modeling),而最新的明星选手是一种被称为“掩码扩散模型”(Masked Diffusion Model)的 AI 类型。你可以把这种模型想象成一场“猜图游戏”。计算机从一个充满问号(掩码)的空白画布开始,然后逐一填补它们,直到出现一幅清晰的图像。这有点像揭开一层层迷雾,从而显现出隐藏的风景。科学家们正在提出的核心问题是:我们能否让这个“揭开迷雾”的过程变得如此聪明,以至于 AI 不仅仅是在猜测图像,还能理解背后的故事、编辑场景,甚至在落笔绘图之前就先规划好自己的杰作?

于是,LaVida-O 登场了,这是一个表示“是的,我们可以!”的新型 AI 模型。该项目的研究人员构建了一个统一的系统,使其既能担任侦探,也能担任画家。与以往那些要么擅长理解但不擅长绘画,要么绘画速度快但思考缓慢的模型不同,LaVida-O 试图成为两者的结合体。它可以观察一张照片并精确指出“狗”站在“领带”旁边的位置,也可以根据“赛博朋克精灵”这样的提示词生成一张高分辨率、细节丰富的图像。更酷的是,它可以编辑现有的照片,比如把电视换成书架,或者在工作时进行“出声思考”,检查自己的错误并在向你展示最终结果之前将其修复。

LaVida-O 背后的秘密武器是一个被称为弹性混合 Transformer(Elastic Mixture-of-Transformers,简称 Elastic-MoT)的巧妙架构技巧。想象一下一个拥有两条装配线的工厂。通常,如果你想制造两种不同的产品,你可能会建造两个独立的、庞大的工厂,这既昂贵又缓慢;或者,你可能会使用一个试图同时处理所有事情的巨型工厂,但这可能会变得混乱。LaVida-O 就像一个智能工厂,可以根据任务的大小缩减或扩张其劳动力。当它只需要理解图像时,它会使用一支庞大且重型的团队;但当它需要生成新图像时,它只激活一支规模较小、专业化的团队,从而节省了大量的能量和时间。这就像一把瑞士军刀,只有在你需要拧螺丝时才会拿出螺丝刀,而不是随身携带整个沉重的工具包。

为了让绘画过程更加出色,团队还加入了其他一些技巧。他们教会了模型使用分层采样(Stratified Sampling),这就像一位画家不仅仅是先填满画布的左上角,而是将笔触均匀地分布在整幅画作中,确保图像在各处同时均匀地构建,而不是卡在某一个地方。他们还赋予了模型“通用文本调节”(universal text conditioning)功能,允许用户通过输入像“让它变亮一点”或“增加对比度”这样的文字来给出额外指令,而不需要复杂的专业代码。

或许最令人兴奋的特性是规划与自我反思(Planning and Self-Reflection)。在开始绘画之前,模型可以停下来并“规划”布局,决定物体应该放在什么位置。如果它正在编辑照片,它会首先定位要更改的对象。在生成图像后,它可以观察自己的作品并说:“等等,狗和领带重叠了,这不对,”然后进行修正。这种批判和纠错的能力带来了更高质量的结果。

论文表明,LaVida-O 不仅仅是一个理论,它确实有效。在测试中,它在图像中的物体检测、文本生成图像以及编辑照片等任务上击败了许多现有模型。它能够生成分辨率高达 1024x1024 像素的图像,这比之前的许多尝试都要清晰得多。它还表现得极其迅速,在进行物体检测时,与一些旧的、较慢的模型相比,实现了高达 6.8 倍的加速。尽管它仍然存在一些局限性——例如在渲染图像内微小的文字时有些吃力,或者有时会对照片中不该改变的部分进行微调——但结果表明,这种“弹性”方法是一个重大的进步。LaVida-O 表明,通过在一个单一且灵活的框架内结合理解与生成,我们可以构建出不仅是听从命令,而且真正能够思考、规划并以一种我们从未见过的细致程度进行创作的 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →