← 最新论文
🤖 machine learning

How can embedding models bind concepts?

本文研究了为什么像 CLIP 这样的视觉-语言模型在包含可恢复对象信息的情况下仍难以实现概念绑定,揭示了其高复杂度的绑定函数阻碍了泛化,而经过充足数据训练的受控 Transformer 模型则学习到了能够实现系统性绑定的低复杂度乘性交互。

原作者: Arnas Uselis, Darina Koishigarina, Seong Joon Oh

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Arnas Uselis, Darina Koishigarina, Seong Joon Oh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题:“技巧的堆砌” vs. “脑中的图像”

想象你正在看一张包含两个物品的照片:一个红色的正方形和一个蓝色的圆形

  • 人类能瞬间明白:“红的是正方形,蓝的是圆形。”我们可以在大脑中将颜色与形状分离,并重新组合它们。
  • **AI 模型(如 CLIP)**擅长识别“成分”。如果你给它们看这张照片,它们会自信地告诉你:“我看到了红色!我看到了蓝色!我看到了正方形!我看到了圆形!”
  • 失败之处: 然而,当被要求将图片与“红色的正方形”这样的描述进行匹配时,AI 经常会感到困惑。它可能会认为红色的正方形其实是蓝色的圆形,或者只是在瞎猜。它能识别出“部分”,却无法将它们正确地“绑定”在一起。

这篇论文在问:为什么 AI 能看到局部,却看不全整体图像?

第一部分:AI 如何“看见”场景(乐高盒子)

研究人员发现,AI 处理包含多个物体的场景时的内部记忆(称为“嵌入/embedding”)就像是一个乐高盒子

  • 加法结构: 如果你有一个红色的正方形和一个蓝色的圆形,AI 对整个场景的记忆基本上就是“红色正方形的记忆”加上“蓝色圆形的记忆”。
  • 好消息: 因为场景仅仅是部分的叠加,你实际上可以“编辑” AI 的记忆。如果你减去“蓝色圆形”这一块,加上“绿色三角形”这一块,AI 的记忆就会改变,反映出一个由红色正方形和绿色三角形组成的场景。
  • 坏消息: 虽然 AI 可以存储这些部分,但它并没有一个简单的规则来规定这些部分应该如何“粘合”在一起以形成一个特定的物体。

第二部分:“高复杂度”缺陷

论文指出,AI 无法绑定概念(例如“红色”+“正方形”)的原因是它的内部“规则手册”过于复杂了。

  • 类比: 想象你在学习一门新语言。
    • 低复杂度(好): 你学习了一个简单的语法规则:“形容词放在名词之前”。你可以将这个规则应用到你听到的任何新单词上。
    • 高复杂度(坏): 你没有学习规则,而是背下了你听过的每一句句子。如果有人说了一句你从未听过的句子,你会陷入僵局,因为你并没有记住那个特定的组合。
  • 研究人员发现,像 CLIP 这样的模型表现得就像那个**“背诵者”**。它们学会了分别识别“红色”和“正方形”,但它们组合它们的方式是一种混乱、高复杂度的模式,无法进行泛化。这就像它们必须单独记住每一个可能的物体组合。由于它们无法记住“所有”组合(组合的数量是无穷无尽的),当面对新的组合时,它们就失败了。

第三部分:解决方案(从零开始训练)

研究人员问道:“这是 AI 的根本缺陷,还是仅仅因为训练方法不好?”

他们利用合成数据(由形状和颜色组成的虚构图片)从头构建了简单的 AI 模型,并专门针对这个问题进行了训练。

  • 结果: 当这些新模型接受了足够多的数据训练后,它们完美地学会了绑定概念
  • 秘诀: 这些成功的模型不仅仅是在死记硬背。它们学习到了一个简单的、低复杂度的规则
  • 神奇机制: 论文发现,成功的模型通过使用乘法来绑定概念,而不是仅仅使用加法。
    • 加法(不利于绑定): 红 + 方 = 一团混乱的混合物,你无法分辨哪个颜色属于哪个形状。
    • 乘法(有利于绑定):×\times 方 = 一个独特且清晰的信号,它表示“这个特定的红色正方形”。

把它想象成无线电频率。仅仅把两个电台信号相加会产生静电(噪音)。但如果你以特定的方式将信号相乘,你就可以调到一个针对该特定组合的、独特且清晰的频道。

研究总结

  1. 问题所在: 大型预训练模型(如 CLIP)能很好地识别单个概念,但在将它们正确组合在一起时会失败。
  2. 原因分析: 它们的内部“胶水”(绑定函数)过于复杂。它依赖于记忆而非简单的规则,因此在面对新物体时会失效。
  3. 证据支持: 当从头开始训练一个全新的模型并提供足够的数据时,它可以完美地学习绑定概念。
  4. 核心机制: 成功的模型通过使用乘法交互(一种结合信号的特定数学方式)来为每个物体创建独特的特征签名,从而使它们能够对从未见过的物体进行泛化。

简而言之: AI 失败并不是因为它对物体“无知”;而是因为它试图去背诵一座无限的书库,而不是去学习语言的语法。一旦教会了它“语法”(一个简单的乘法规则),它就能阅读任何书籍。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →