Multimodal Function Vectors for Visual Relations
本文证明了大型多模态模型中的特定注意力头将视觉关系知识编码为可操纵的“函数向量”,这些向量可以被提取、微调并进行线性组合,从而显著增强在关系推理任务上的零样本性能、上下文学习能力以及泛化能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个非常聪明但有点糊涂的机器人助手。你给它看一张厨房的照片,并问它:“那个男孩在做什么?”
如果只是把照片展示给它看,机器人看到的可能只是一堆脱节的物品列表:冰箱、男孩、橱柜、水槽。它很难理解将这些物品联系在一起的故事。如果你先给它一些例子(比如,“在这张照片里,男孩拿着一个杯子;在那张照片里,女孩坐在椅子上”),它猜对的可能性会稍微提高一点。这被称为“上下文学习”(in-context learning),但即便有了例子,机器人仍然是在黑暗中盲目猜测。
这篇论文是关于寻找机器人大脑内部的一个“魔法开关”,这个开关能帮助它理解这些连接关系(比如“拿着”、“坐在……上”或“在……旁边”),而不需要靠猜。
以下是研究人员如何利用简单的类比完成这项工作的:
1. 寻找“特殊神经元”
机器人的大脑由数十亿个被称为“注意力头”(attention heads)的微小处理单元组成。把它们想象成成千上万个微型广播电台。大多数电台可能正在播放关于颜色和形状的杂音或音乐。
研究人员使用了一种特殊的工具(称为因果中介分析,Causal Mediation Analysis)来监听这些电台。他们发现,只有极少数的电台(在数千个中大约只有10个)实际上正在广播“关系”信号。这些特定的频道知道什么是“在上方”、“在下方”或“携带”。
2. 创建“功能向量”(神奇的 USB 闪存盘)
一旦找到了这些特殊的广播电台,研究人员就记录了当机器人观察具有清晰关系的图片时的“声音”。他们将这些声音取平均值,从而创建了一个单一且紧凑的数字文件,称为功能向量(Function Vector)。
你可以把这个向量想象成一个包含特定说明书的 USB 闪存盘。
- 如果你插上“上方”的 USB 闪存盘,机器人突然就会如何识别位于其他物体之上的物体了。
- 如果你插上“携带”的 USB 闪存盘,它立刻就能理解谁在拿着什么。
酷的地方在于,他们不需要重新教机器人。他们只需在机器人观察一张新图片时,将这个“USB 闪存盘”插入机器人的大脑。突然间,机器人的表现大幅提升,甚至不需要先给它任何例子。
3. 调节信号(微调)
第一个版本的“USB 闪存盘”已经很不错了,但研究人员发现他们可以让它变得更好。他们使用少量的练习数据对文件进行了轻微调整(就像调节收音机的音量或清晰度一样)。
经过这次快速的“微调”后,机器人变得更加擅长识别关系。它不需要记住整个世界,它只需要这个特定的、经过优化的指令文件来引导它的思考。
4. 混合与匹配(类比技巧)
这篇论文中最神奇的部分是,当机器人遇到一个它从未见过的关系时,比如“在右上方”会发生什么。
研究人员给机器人看一张关于“上方”和“右方”的图片。他们提取了“上方”的 USB 闪存盘和“右方”的 USB 闪存盘,按照特定的比例将它们混合在一起(就像混合蓝色和黄色颜料得到绿色一样),从而创造出了一个新的“右上方”USB 闪存盘。
当他们把这个混合后的驱动程序插入机器人时,它能够解决一个涉及“右上方”关系的谜题,而这个关系是它从未接受过训练的。这就像是机器人通过混合已知的概念来理解一个全新的概念,仅仅是通过混合数字指令实现的。
核心结论
这篇论文证明了这些庞大且复杂的 AI 模型并非仅仅是黑盒。在它们内部,存在着特定的、微小的、有组织的部件,负责处理特定的任务(比如理解关系)。
- 之前: 机器人必须根据模糊的提示进行猜测。
- 现在: 我们可以找到这个特定的“关系开关”,把它拔出来,进行微调,然后再插回去,让机器人更好地理解这个世界。
这有助于我们理解这些 AI 模型是如何工作的,并为我们提供了一种更精确控制它们的方法,使它们在观察图片中事物之间的联系时变得更加出色。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。