← 最新论文
💬 NLP

Multimodal Model Diffing for Feature Discovery and Control

本文介绍了 MMDiff,这是一个多模态模型差异化框架,它利用稀疏自编码器来隔离、检测并因果控制多模态大语言模型中的特定特征,从而在保持通用性能的同时,实现对空间理解、OCR 和安全性方面的针对性提升。

原作者: Hunar Batra, Lachin Naghashyar, Ashkan Khakzar, Philip Torr, Christian Schroeder de Witt, Constantin Venhoff, Ronald Clark

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Hunar Batra, Lachin Naghashyar, Ashkan Khakzar, Philip Torr, Christian Schroeder de Witt, Constantin Venhoff, Ronald Clark

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你制造了一个超级聪明的机器人,它能读懂书籍、观察图片,并针对两者回答问题。你教会了它要乐于助人,但有时它会感到困惑、产生幻觉,或者在看到一张棘手的图片时说出一些不安全的内容。问题在于,在机器人的“大脑”内部,一切都是一团混乱的数学。这就像一个巨大的图书馆,所有的书都被粘在了一起,你无法分辨出到底是哪一页导致了机器人的不良行为,或是它识别照片中猫咪的神奇能力。科学家们想要修复这个问题,但他们需要一种方法来窥探内部,找到控制这些特定技能的精确“开关”或“旋钮”。

为了实现这一目标,研究人员使用了一种名为**稀疏自编码器(Sparse Autoencoder, SAE)**的工具。把 SAE 想象成一个神奇的翻译官,它能将机器人混乱、纠缠的思想分解成一份简单的、清晰的“概念”或“特征”列表。原本是一团模糊的数据云,现在机器人的大脑突然变得井然有序,变成了一本字典,其中的每一条目都代表一个单一的概念,比如“红色”、“危险”或“左边”。但问题在于,当你教一个纯文本机器人如何看图时,它不仅仅是增加了新特征,它往往还会重新排列旧的特征。这就像是将一本英文词典拿过来,却突然用“苹果”这个词来表示“一辆红色的车”。这使得人们很难辨别哪些特征实际上是在进行新的视觉工作,哪些仅仅是文本训练留下的残余。

正是在这里,名为 MMDiff 的新论文介入了。来自牛津大学和微软的研究员 Hunar Batra 及其团队意识到,要找到那些特定的“视觉开关”,你不能只观察最终形态的机器人;你必须将其与学习看图之前的“纯文本版”自我进行对比。他们创建了一种称为**多模态模型差异化分析(Multimodal Model Diffing)**的方法。想象一下你有两对完全相同的双胞胎:一个只读过书,而另一个则已经学会了观察世界。通过将他们的脑部进行并排对比,MMDiff 突出了哪些部分的大脑发生了变化,或者被重新用于视觉任务。

该团队发现这种“差异化”过程极其强大。他们发现,通过隔离这些改变了的特征,他们竟然能以惊人的精确度控制机器人的行为。例如,他们找到了负责理解空间关系(比如知道杯子在桌子上方)的特定特征。当他们把这些特定特征“关掉”时,机器人在回答空间问题方面的表现下降了约 12%,但其回答一般性问题的能力却保持完全不变。这就像是关掉了“左/右”开关,却没有破坏“这是什么?”开关。

他们还发现了与安全性相关的特征。当他们识别并移除那些让机器人容易受到基于图像的不安全陷阱影响的特征时,机器人忽略这些陷阱的成功率提高了 24%。更棒的是,他们可以通过调高或调低这些特征来“引导”机器人。通过增强正确的特征,他们在无需从头开始重新训练整个机器人模型的情况下,将机器人识别图像中的文字(OCR)能力提升了 1.8%,并将空间推理能力提升了 3.6%

论文明确排除了这样一种观点,即你可以直接在多模态机器人上从头训练一个新的字典,并期望能轻松找到这些特定的视觉特征。他们证明了,如果没有将机器人与其纯文本版本进行对比(即“差异化”部分),特征就会变得混杂,导致你无法隔离想要控制的特定技能。他们还发现,仅仅观察哪些特征经常触发是不够的;你必须检查这些特征是否在训练过程中发生了旋转或含义的变化。

简而言之,MMDiff 就像是一个针对 AI 大脑的高科技“查找并替换”工具。它不仅告诉我们机器人正在做某事,还告诉我们究竟是脑部的哪一个微小部分在做这件事,从而让我们能够微调、修复或改进特定的行为,如阅读文字、理解空间或保持安全,同时让机器人的其他智能部分保持原封不动。这表明,在未来,我们或许能够更安全、更有效地审计和控制这些强大的 AI 系统,确保它们完全按照我们的意愿行事。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →