← 最新论文
💻 computer science

Toward Native Multimodal Modeling: A Roadmap

本文通过定义架构原生性、基于输入输出二元性对现有模型进行分类,并提供构建能够无缝融合理解与生成能力的统一 Transformer 框架的工业级指南,呈现了一条从晚期融合方法向原生多模态建模(NMM)转型的规范化路线图。

原作者: Siyu An, Junru Lu, Junnan Dong, Qiufeng Wang, Yinghui Li, Weizhi Fei, Zichao Yu, Zheng Yuan, Biao Liu, Haopeng Wang, Renzhao Liang, Yixuan Yang, Yunhang Shen, Bo Ke, Keyu Chen, Linhao Luo, Difan Zou
发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Siyu An, Junru Lu, Junnan Dong, Qiufeng Wang, Yinghui Li, Weizhi Fei, Zichao Yu, Zheng Yuan, Biao Liu, Haopeng Wang, Renzhao Liang, Yixuan Yang, Yunhang Shen, Bo Ke, Keyu Chen, Linhao Luo, Difan Zou, Xiao Huang, Di Yin, Ruizhi Qiao, Xing Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教机器人如何理解和与现实世界互动。长期以来,我们教机器人的方式是给它们配一副“眼镜”(用于看)、一个“麦克风”(用于听)和一个独立的“大脑”(用于思考),然后试图将它们粘合在一起。这篇题为《NMM 路线图》的论文认为,这种“粘合”方法已经过时。相反,我们需要构建“天生原生”的机器人——这意味着它们的大脑从设计之初就旨在同时处理视觉、听觉和语言,将其作为单一、统一的信息流。

以下是该论文旅程的分解,使用简单的类比:

1. 演进:从“粘合”到“天生原生”

该论文描述了构建这些 AI 模型的三个阶段:

  • 后期融合(“粘合”方法): 想象一个机器人,其摄像头和麦克风插在一台标准计算机上。计算机实际上并不“看”或“听”;它只是接收来自摄像头和麦克风的预处理笔记。论文称此为“解耦”。这就像一位翻译只从聋人那里收到书面笔记,并试图猜测他们在说什么。这虽然可行,但机器人对原始感官细节是“盲目”的。
  • 中期融合(“团队合作”方法): 现在,摄像头和麦克风直接与大脑的中间层对话。它们分享见解,但仍保持各自独立的身份。这就像一群专家(摄影师、音响工程师和作家)坐在同一个房间里。他们协作,但仍穿着各自的制服。
  • 早期融合(“天生原生”方法): 这是该论文的终极目标。想象一个大脑,其中没有独立的摄像头或麦克风。相反,大脑将视频、声音和文本都视为同一种类型的“令牌”(就像书中的字母)。它将一张狗的图片与单词“狗”视为同一句子中的平等邻居。这就是原生多模态建模(NMM)。机器人不仅仅是翻译;它以一种统一的方式“体验”世界。

2. 三种类型的“原生”机器人

作者根据这些新的“天生原生”模型如何处理信息,将它们分为三类:

  • 多模态到文本(翻译者): 机器人接收混合输入(视频、音频片段、照片),仅输出文本。这就像一位记者观察混乱的场景并写出一篇完美的新闻报道。
  • 多模态到目标(创造者): 机器人接收混合输入,并创造单一特定事物,如视频、歌曲或图像。这就像一位导演根据剧本和情绪板制作一部电影。
  • 多模态到多模态(通用代理): 这是“圣杯”。机器人可以无缝地接收任何内容(视频、音频、文本)并输出任何其他内容(文本、视频、音频)。这就像一个人可以观看电影、聆听歌曲、阅读书籍,然后基于刚刚的体验,立即绘制一幅画、写一个故事或唱一首歌。在“理解”与“创造”之间没有障碍。

3. 成功的配方

这篇论文不仅仅关于大脑;它关乎构建这些模型的整体配方。它们将其分解为四个关键要素:

  • 数据(饮食): 你不能只给机器人喂食文本。你需要混合媒体的饮食:带声音的视频、带标题的图像,甚至关于人类如何与网站或机器人交互的数据。论文指出,这种“食物”的混合比例至关重要。如果你喂给它太多文本而视频太少,它就会忘记如何“看”。
  • 训练(学校):
    • 预训练: 这就像小学,机器人同时学习所有语言和感官的基础知识。
    • 微调: 这就像专业大学。如果机器人正在学习生成图像,训练将专注于此,但论文警告说,必须小心不要让它忘记如何理解文本。
    • 强化学习(RL): 这就像教练给予反馈。“做得好,那个视频看起来很逼真!”或者“做得不好,那个音频与嘴唇不匹配。”论文强调了一种名为在线策略蒸馏的新技巧,这就像拥有一支由专家教练组成的团队(一位教数学,一位教艺术,一位教安全),同时教导机器人,以免它感到困惑。
  • 部署(表演): 当机器人实际运行时,它面临一个问题:序列爆炸。一段 10 分钟的视频会变成数百万个微小的数据点。论文提出了智能的压缩方法,例如只关注视频的重要部分(动作),而忽略无聊的部分(静态背景),这样机器人就不会耗尽内存。
  • 评估(测试): 我们如何知道它是否有效?论文认为我们需要新的测试。我们不能只问:“它回答了问题吗?”我们还需要问:“它是否在正确的时间回答了?”(针对实时流媒体)以及“它是否产生了幻觉?”(它是否编造了事实?)。

4. 未来:“世界模型”

该论文最后展望未来。终极目标是从仅处理数据的模型转向原生世界模型

将当前的 AI 想象成一位能阅读任何书籍但从未离开过图书馆的图书管理员。原生世界模型则是一位探险家。它通过传感器直接感知世界,理解物体运动的物理规律,记住长期事件,并能实时行动。它不仅仅是“处理”一个球落下的视频;它理解重力、时间和因果关系,因为它被训练为将世界视为单一、连续、原生的体验。

简而言之: 这篇论文是一份蓝图,旨在推动 AI 从由分离工具组成的“拼凑被褥”,转变为“无缝挂毯”,其中看、听和思考作为一个自然、统一的过程同时发生。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →