Expressivity In Multimodal Contrastive Learning
本文分析了多模态对比学习的表示能力,证明了虽然标准的 CLIP 是两种模态的通用逼近器,但其常见的多模态扩展无法捕捉任意联合分布,由此作者提出了 Hadamard-CLIP,这是一种简单的改进方案,它在不牺牲检索效率的情况下,恢复了针对任意数量模态的通用逼近能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代人工智能的世界里,机器正越来越多地同时学习如何观察、聆听和阅读。这些系统不再仅仅是孤立地识别一张图片或翻译一个句子,而是正在学习理解不同类型的信息是如何相互连接的。计算机可能会观察一张日落的图像,并学会将其与“黄金时刻”这个词联系起来,或者将特定的声音与视觉场景相关联。这种被称为“对比学习”(contrastive learning)的过程,已成为计算机构建对世界共同理解的基石。它的工作原理是教机器将其内部记忆中相关的部分拉近,同时将不相关的部分推开。其结果是产生了一种强大的能力,可以利用文本检索图像、根据描述生成图片,或在复杂的数据景观中进行导航。然而,尽管这些系统在实践中取得了显著成功,科学家们长期以来一直对它们理解能力的根本极限感到好奇。具体而言,他们想知道用于构建这些系统的数学结构是否真的能够捕捉到不同类型数据之间所有可能的联系,还是说在其设计中存在着隐藏的盲点。
加州理工学院的一个研究小组致力于通过将这些学习系统的架构视为一种概率估计方法,而非仅仅是一堆代码,来回答这个问题。他们设想了一个场景:机器已经看到了无限量的数据,这使得他们能够剥离有限样本带来的噪声,从而纯粹地专注于系统的理论容量。他们的调查揭示了这些机器在处理不同数量的数据类型时,信息处理方式存在着明显的界限。当系统处理两种类型的数据(例如图像和文本)时,目前通用的标准架构在理论上是完美的。它强大到足以学习这两者之间任何可能的联系,达到了最复杂的通用网络的水平。这一发现为当前双部分系统的成功提供了坚实的数学基础。
然而,当研究人员检查旨在同时处理三种或更多类型数据(如结合视频、音频和文本)的系统时,故事发生了变化。在处理这些复杂任务时,实践中最常用的方法是简单地累加每对可能的数据类型之间的相似性。研究人员证明,虽然这种方法擅长学习任何两种特定数据类型之间的关系,但当三者或更多者同时存在时,它在理解全貌方面存在根本性的缺陷。它创造了一个盲点:系统可以理解 A 与 B 之间的关系,以及 B 与 C 之间的关系,但却无法理解仅在 A、B、C 同时被考虑时才存在的独特的三方联系。研究证明,无论喂给该方法多少数据或训练多久,标准方法都无法捕捉到这些高阶交互。
为了解决这个问题,研究人员对现有设计提出了一种简单而强大的改进方案。他们引入了一种新的架构,在标准系统的顶部增加了一组学习到的权重。这个小小的添加物充当了一个桥梁,允许机器以一种能够捕捉其完整且复杂关系的方式,将来自所有数据类型的信息结合起来。他们将这种新设计命名为 Hadamard-CLIP,它恢复了系统学习任何可能的各类数据联合分布的能力,无论涉及多少种类型。至关重要的是,这种修复并没有牺牲使这些系统在现实世界中变得实用的速度。与其他复杂的解决方案不同(那些方案需要机器在每次做出预测时都处理原始数据),这种新方法允许系统预先计算并存储数据的简化表示。这意味着,即使增加了理解多模态的复杂性,系统仍然可以像原始的简单模型一样快速地检索信息。这项工作表明,通过进行微小的结构性改变,就能够解锁多模态学习的全部表达能力,确保机器能够真正理解描述世界的多种不同方式之间那错综复杂的联系网络。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。