MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities
本文介绍了 Modus,一种仅解码器(decoder-only)的任意到任意(any-to-any)多模态模型,该模型在不使用特定任务组件的情况下对称地处理所有模态,从而实现了灵活的跨模态生成,并在多种基准测试中取得了具有竞争力的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下这样一个世界:你的计算机不再仅仅是“看到”一张图片或“读到”一个句子,而是理解了图片、句子、深度图以及边缘轮廓图都只是描述同一现实的不同语言。长期以来,人工智能一直像是一个只精通一种方言的专家;一个模型可能擅长写故事但拙于绘画,或者擅长识别物体但对它们的距离一窍不通。科学家们一直试图构建一种这些不同数据类型(他们称之为“模态”)的“通用翻译器”,以便让一个单一的大脑能够在这几种语言之间轻松切换。主要的挑战在于,如何教会一个大脑流利地使用所有这些语言,而不需要为每一对语言都准备一个单独的翻译器。
于是有了 MODUS,一种新型的 AI 模型,它扮演着“全能语言专家”的角色。研究人员并没有构建一台带有不同部件、处理不同任务的庞大且笨重的机器,而是构建了一个“仅解码器”(decoder-only)的大脑。你可以把这想象成一个讲故事的人,他听完一个故事后,无论这个故事是用哪种语言讲述的,他都能继续讲下去。无论你输入的是照片、文本描述、深度图(显示物体远近程度)还是边缘轮廓图,MODUS 都将它们视为一个单一且连续的标记(token)流(就像句子中的单词一样)。它不需要专门处理深度信息的工具,也不需要专门处理文本的工具;它只需要预测序列中的下一个部分。这意味着它可以根据照片生成深度图,或者根据深度图生成照片,甚至可以将它们串联起来:照片 边缘 深度 新照片,一气呵成。论文表明,这种方法效果惊人地好,使模型能够执行复杂的任务,如自我验证(self-verification)以及通过多个步骤创建一致的图像,同时全程使用统一的架构。
全能大脑:MODUS 如何运作
想象一下,你有一个非常擅长讲故事的朋友。如果你给他一张猫的照片,他可以描述它;如果你给他一段关于猫的描述,他可以把它画出来。现在,想象这位朋友还能告诉你那只猫离你有多远,或者画出它的轮廓草图,甚至解释这只猫在感受什么,而无需改变他的性格或需要一个不同的脑子来完成每项任务。这本质上就是 MODUS 所做的事情。
在过去,AI 模型通常被构建得像一把带有许多独立工具的瑞士军刀:一个刀片用于文本,一个用于图像,一个用于深度。如果你想从深度图过渡到图像,你可能需要一连串不同的模型,每个模型将接力棒传递给下一个。这篇论文认为这种方式既低效又笨重。相反,MODUS 使用了一种仅解码器的方法。简单来说,“解码器”是一种通过预测序列的下一部分来学习的 AI 类型。你可以把它想象成一场“传声筒”游戏,AI 正试图根据之前出现的所有内容来猜测下一个词、下一个像素或下一个深度值。
MODUS 的魔力在于它将一切都视为一个序列。
- 文本是单词的序列。
- 图像被分解成微小的补丁(patches),并转化为数字序列。
- 深度图和表面法线(显示表面朝向的方向)也被转化为序列。
因为一切都只是一个序列,MODUS 不需要不同的“头”(即专门的部分)来处理不同的工作。它只需观察输入序列并预测输出序列。如果你给它一张照片并要求生成深度图,它会将照片视为故事的“开头”,将深度图视为“延续”。如果你给它一个深度图并要求生成照片,它就会反转这个过程。
“任意到任意”的超能力
论文称之为任意到任意(Any-to-Any)建模。这是指能够获取任何组合的输入并生成任何组合的输出的能力。
- 输入: 一个房间的照片。输出: 该房间的文本描述。
- 输入: 一个房间的文本描述。输出: 该房间的照片。
- 输入: 一个房间的照片。输出: 一个深度图(显示家具的远近)。
- 输入: 一个深度图。输出: 一张照片。
以往的大多数模型只能做特定的配对,比如“文本转图像”或“图像转文本”。MODUS 打破了这些壁垒。它甚至可以完成对其他模型来说显得很奇怪的任务,比如直接将“Canny 边缘”(一种轮廓草图)转换为深度图,或者结合照片和文本提示来生成表面法线图。
秘诀:均匀采样与阶段性训练
你可能会问:“如果它只是在预测下一个标记,为什么这很难?”研究人员发现了一些棘手之处。
首先是模态混淆的问题。当模型学习生成图像或深度图时,有时会产生混淆。它可能被要求生成深度图,却意外地生成了边缘图。论文发现,这是由于他们在训练期间采样“时间步”(time steps)的方式导致的。想象一下,通过从模糊变得清晰的过程来训练模型画画。如果你在过程的中间阶段(此时图像仍然模糊)停留太久,而在最开始阶段(即模型决定要画什么的阶段)停留太少,模型就会对它应该画什么感到困惑。
为了解决这个问题,团队使用了均匀时间步采样(uniform timestep sampling)。他们没有只关注中间步骤,而是确保模型在练习最初的步骤(决定模态)和最后的步骤(细化细节)时投入同等的精力。这有助于模型在开始担心细节之前,先学会说:“好吧,我正在画一张深度图。”
其次,他们使用了**阶段性训练(staged training)**方法。他们并没有把所有东西一次性丢给模型。
- 第一阶段: 教它处理 1D 的事物,如文本和边界框(定位/grounding)。
- 第二阶段: 加入 2D 空间事物,如深度、表面法线和边缘。
- 第三阶段: 教它同时处理多个输入(多条件)并将它们串联起来。
这种循序渐进的方法帮助模型在不会感到不知所措的情况下进行学习,使其能够继承从文本和图像训练中获得的强大知识,并将其扩展到新的数据类型。
链式生成与自我验证
MODUS 最酷的特性之一是链式生成(Chained Generation)。因为它将一切视为单一序列,所以它可以将自己的输出作为下一步的输入。
- 假设你想根据文本描述生成一个 3D 场景。
- MODUS 不会尝试直接从“文本”跳到“3D 场景”,而是可以走:文本 边缘草图 深度图 最终图像。
- 边缘草图帮助模型理解布局,深度图帮助它理解几何结构,而最终图像则建立在这些坚实的基础之上。
论文表明,这种链式过程使最终结果更加一致。如果直接尝试从“文本”到“图像”,模型可能会搞错布局。但通过中间步骤(如边缘草图),模型在添加颜色和细节之前就“锁定”了结构。
另一个巧妙的技巧是跨模态自我验证(Cross-Modal Self-Verification)。由于 MODUS 可以生成任何模态,它可以检查自己的工作。
- 如果 MODUS 根据文本提示生成了一张图像,它可以立即生成一个“定位”图(显示物体位置)或回答关于该图像的问题(VQA)。
- 如果生成的图像在这样检查时与文本描述不符,模型可以丢弃它并重新尝试。
- 论文发现,使用这种自我检查方法提高了生成图像的质量,使其比通过外部工具评分时更加准确。
结果:统治一切的单一模型
研究人员在名为 MODUS-DATASET 的大规模数据集上测试了 MODUS,该数据集包含 2900 万个样本,其中图像与所有这些不同的标注(深度、边缘、文本等)都是配对的。他们在这些数据上训练了模型,并发现其在各个领域表现都非常出色。
- 它在进行视觉定位(根据文本在图像中寻找物体)方面,表现得与专门模型一样出色。
- 它能以极高的准确度估计深度和表面法线。
- 它生成的文本转图像效果足以与其它顶尖模型竞争。
- 至关重要的是,它通过单一模型完成了这一切。你不需要下载一个专门用于深度的模型,另一个用于边缘的模型,以及另一个用于文本的模型。
论文明确指出,虽然以往的模型往往难以达到专门的“单任务”专家的水平,但 MODUS 在提供完成所有任务的灵活性时,依然能够保持与它们竞争力的水平。这表明,“仅解码器”的方法是多模态 AI 的一个强大基础,能够处理多样化的数据类型,而无需为每个新任务构建复杂的定制架构。
简而言之,MODUS 是迈向更统一 AI 的一步——这种 AI 不再将世界视为独立的各类数据,而是将其视为一个单一的、相互关联的故事,这个故事可以被讲述、被重述,并以它选择的任何语言进行翻译。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。