Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing
本文介绍了混合探测(Mixture of Probes, MoP),这是一个通过结构化探测和专门的跨模态训练策略,利用仅在训练阶段可用的特权模态来解耦特定模态信号与通用信号,从而显著增强多模态大语言模型的新型框架,即使在推理阶段缺失辅助模态时也能实现大幅度的性能提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在训练一个超级聪明的机器人来理解世界。通常情况下,你会同时给它配备摄像头、麦克风,甚至是一个 3D 深度传感器,希望它能完美地学会看、听和感知一切。但问题在于:在现实世界中,这个机器人外出执行任务时,可能只带有一个廉价的摄像头。它不再拥有那些高级的 3D 传感器或高质量的麦克风。
这就是“特权模态”(privileged modality)问题。你在训练期间拥有所有这些高级工具,但在实际测试时,你只有一个简单的工具。
旧方法:混乱的搅拌机
目前的多数 AI 模型试图通过将所有数据(视频、音频、深度)扔进一个大搅拌机,并寄希望于它们能混合成一种完美的奶昔来解决这个问题。它们将每种传感器都视为同一种食材的不同口味。
该论文指出,这种方法失败了。它表明,仅仅将所有东西混合在一起并不能帮助机器人学会如何利用高级 3D 传感器,从而在以后更好地使用廉价摄像头。事实上,作者发现,仅仅在所有这些传感器上同时进行训练,其表现往往比仅在你要使用的单个传感器上进行训练的效果还要差。这就像是试图通过坐在一个同时连接着方向盘、舵和一副桨的驾驶舱里来学习开车;你只会感到一头雾水。
新想法:“探测器混合”(Mixture of Probes, MoP)
作者提出了一种名为 Mixture of Probes (MoP) 的新方法。与其使用搅拌机,不如把 MoP 想象成机器人在大脑内部的一支专业侦探团队。
在机器人的“大脑”(处理图像和声音的部分)内部,存在着像摩天大楼楼层一样的思考层。旧模型只观察最顶层的楼层来做决策。而 MoP 则会向每一层楼派出两类侦探进行检查:
- 专业侦探(模态特定探测器): 这些人是只专注于一件事的专家。一个侦探只看视频,另一个只听音频,还有一个只看深度数据。他们学习各自特定传感器的独特特性。
- 通用侦探(模态通用探测器): 这些是“大局观”的思想家。他们观察所有传感器,以寻找适用于所有事物的共同真理,无论那是声音还是视觉。
秘诀:保持独立
这是最重要的一部分:论文明确指出,你必须将这两类侦探分开。如果他们开始互相交流或者互相抄袭笔记,他们就会坍缩成一个平庸、通用的群体,从而学不到任何新知识。
为了阻止这种情况,作者发明了一个特殊的规则,叫做**“探测器解耦损失”(Probe Disentanglement Loss)**。你可以把它想象成一位严厉的老师,不断检查侦探们的笔记本。如果“视频侦探”开始写下和“音频侦探”一样的笔记,老师就会拍打他们的手并说:“不!你需要找到属于你自己的独特之处!”这迫使机器人将每个传感器的独特细节与它们共享的通用知识区分开来。
效果如何?数据说话
作者在两个大挑战上测试了该方法:
- 日常生活 (ADL): 他们使用第一视角视频(从你自己的眼睛看)、第三视角视频(从远处相机看)和深度数据来训练机器人。然后,他们在每次仅使用其中一个传感器的情况下对其进行测试。
- 音乐: 他们使用音频和视频结合的音乐进行训练,然后仅使用音频或仅使用视频进行测试。
结果非常明确:
- “搅拌机”方法(朴素 MLLM): 当他们没有使用特殊的侦探而只是简单混合一切时,机器人的表现并没有提升多少。在日常生活测试中,它在第一视角视频上的得分约为 72.96%。
- MoP 方法: 通过使用保持笔记独立的专业侦探和通用侦探,机器人在同一项任务上的得分跃升至 79.46%。仅仅通过利用额外的传感器进行训练,它就实现了 6.50% 的提升!
- 更令人印象深刻的是,当机器人仅使用深度传感器(在此之前它从未单独使用过该传感器)进行测试时,MoP 将得分从 54.37% 提升到了 66.21%。这是一个巨大的 11.84% 的飞跃。
在音乐测试中,MoP 也击败了其他方法,在纯音频测试中提升了 5.45%,在纯视频测试中提升了 1.64%。
这意味着什么(以及并不意味着什么)
论文表明,通过将“特殊的”与“通用的”分离,我们可以教会机器人利用其高级训练工具,从而成为其简单现实世界工具的高手。
然而,作者也谨慎地指出了几个局限性:
- 这仅在机器人使用单一、共享的大脑(通用编码器)来处理所有传感器时才有效。如果机器人为每种传感器配备了完全独立的脑部,则此方法无效。
- 他们仅测试了机器人在测试时使用单个传感器的情况。他们并没有测试如果机器人在最后阶段拥有两个传感器时会发生什么。
- 结果是基于特定数据集(如 Ego-in-Exo Perception 和 Music-AVQA)的,因此虽然数学逻辑看起来很严密,但这只是一个建议,表明这种方法可能在其他地方也奏效,而不是对世界上每一个机器人的保证。
简而言之,论文建议,如果你想让你的 AI 在工具有限的情况下依然聪明,不要只是把所有东西都喂给它然后听天由命。给它一个由专家和通才组成的团队,确保他们互不抄袭,并让他们通过高级工具进行学习,以便在面对简单工具时也能大放异彩。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。