← 最新论文
💬 NLP

Projector Is All You Train

本文表明,对于3D多模态大语言模型,仅训练投影器并保持语言模型骨干网络冻结,足以实现强大的性能、避免能力漂移,并且与联合训练相比,训练吞吐量可提升一倍。

原作者: Nyx Iskandar, Saathvik Selvan, Slater Victoroff

发布于 2026-08-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Nyx Iskandar, Saathvik Selvan, Slater Victoroff

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能飞速发展的世界里,研究人员正在教会计算机不仅通过文字,还通过视觉、听觉和三维形状来理解世界。想象一下,一台计算机可以观察一把椅子、一辆汽车或一座雕塑的数字模型,然后就这些物体进行对话,回答问题或描述其特征。为了构建这些系统,科学家通常会将两种强大的工具结合起来:一个大规模语言模型(它是理解和生成人类语言的引擎),以及一个专门的编码器(它将原始的3D数据转化为语言模型可以读取的格式)。连接这两个部分需要一座桥梁,这是一个虽小但至关重要的组件,负责将3D信息转化为语言模型的内部语言。

多年来,构建这些系统的标准方法是同时训练这座桥梁和语言引擎。其理念是,要让语言模型真正理解3D形状,就需要通过教它观察这些新物体来微调其内部设置。这个过程计算成本高昂且耗时,通常需要巨大的计算能力。然而,来自 Ramen VR 和加州大学伯克利分校的研究人员最近的一项调查挑战了这一长期存在的假设。他们提出了一个简单而深刻的问题:真的有必要改变语言引擎吗?还是我们只需训练这座桥梁来承担重任即可?

研究人员试图利用从简单的几何形状到复杂的家具和车辆等各种3D物体模型来测试这一假设。他们采用了几种不同的、现有的语言模型——有些仅为文本设计,有些则已经具备理解图像的能力——并将它们与一个3D编码器配对。随后,他们进行了两项不同的训练实验。在第一种实验中,他们遵循传统方法,同时调整桥梁和语言引擎。在第二种实验中,他们完全冻结了语言引擎,保持其内部设置不变,仅训练用于将3D数据连接到语言模型的桥梁。他们在高性能显卡上运行了十六个小时的实验,仔细追踪生成的系统识别物体及描述物体的表现。

结果令人震惊。那些仅训练桥梁、保持语言引擎冻结状态的系统,其表现与同时训练两个组件的系统一样出色,甚至在许多情况下表现更好。当测试它们从类别列表中识别物体或书写详细描述的能力时,“仅限桥梁”的模型所取得的分数足以媲美该领域现有的最佳系统。或许更令人惊讶的是,“仅限桥梁”的模型学习速度快了一倍。由于在训练期间不需要更新庞大的语言引擎,它们可以在相同的时间内处理两倍数量的示例,从而以更高的效率达到高性能水平。

这项研究还揭示了传统方法(即同时训练两个部分)的一个隐藏代价。当研究人员在将语言引擎与3D数据进行联合训练后对其进行检查时,他们发现模型开始遗忘原有的知识。它们遵循复杂指令、解决数学问题或推理二维图像空间关系的能力显著下降。在某些情况下,模型因受到新的3D训练的影响而变得如此混乱,以至于无法再生成连贯的文本或遵循基本指令。“仅限桥梁”的方法完全避免了这个问题;因为语言引擎从未被触动,它在获得理解3D形状这一新能力的同时,保留了所有原有的能力。

这一发现表明,构建智能系统有一种更模块化、更高效的方式。研究人员无需在每次引入一种新类型的数据时都重新训练AI的整个“大脑”,而是可以简单地构建一座新桥梁,将该数据连接到现有的“大脑”。这意味着同一个强大的语言模型可以潜在地独立连接到声音、视频或3D数据的编码器,而不会产生一种新技能抹除另一种技能的风险。研究人员得出结论:对于使大型语言模型适应新类型的感官输入,重新训练核心语言引擎这一复杂过程是不必要的。成功的关键不在于改变引擎,而在于建造一座更好的桥梁。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →