想象一下,你拥有一支世界级的专家团队,每位成员都是特定领域的行家里手。你有一位视觉专家,能完美描述任何图片;一位阅读专家,能总结任何书籍;还有一位数据分析师,擅长在电子表格中发现规律。
通常,要让这些专家协作解决新问题,你需要花费数月时间训练他们,使他们理解彼此的专业术语并学会如何协作。这就像人工智能中的“微调”:缓慢、昂贵且复杂。
本文介绍了CoMET,一种能让这些专家立即协作而无需任何训练的方法。这就像递给他们一个简单的翻译器和一块白板,然后说:“去解决这个问题吧。”
以下是 CoMET 的工作原理,分解为简单步骤:
1. “冻结”的专家(骨干模型)
首先,CoMET 采用已经学会如何识图或阅读文本的预训练模型(即这些专家)。这些模型是“冻结”的,意味着我们完全不改变它们的“大脑”。我们只是让它们查看数据并为我们提供摘要。
- 问题:有时,它们提供的摘要过长或杂乱无章。就像你只需要一句话的描述,视觉专家却写了一篇十页的长文。
- 解决方案(PCA):本文使用了一种简单的数学技巧,称为PCA(主成分分析)。将其想象为一个“摘要器”,能将那篇十页的长文压缩成一份精炼的、256 个单词的要点列表。令人惊讶的是,作者发现仅进行这种压缩,就能让这些专家在没有学习任何新内容的情况下,协作效果大幅提升。
2. “表格”大脑(TFM)
一旦专家提供了压缩后的摘要,CoMET 便将此信息传递给一个表格基础模型(TFM)。
- 什么是 TFM? 想象一位超级聪明的侦探,他已在涉及数百万行和列数据的数百万个不同案例(数据集)上接受过训练。这位侦探如此出色,以至于如果你向他展示一个包含少量示例的新案例,他无需事先研究该新案例,就能立即解决问题。
- 神奇之处:CoMET 将压缩后的图像和文本摘要作为该侦探的输入,就像它们是电子表格中的另一列数据一样。随后,这位侦探做出最终预测(例如,“这是一只狗”或“这封邮件具有毒性”)。
3. “智能高亮笔”(PALPooling)
有时,专家提供的摘要会偏离重点。例如,如果你展示一张公园里狗的照片,视觉专家可能会关注草地和树木,而不是狗本身。
- 旧方法:要解决这个问题,你通常必须重新训练专家,使其关注狗。
- CoMET 方法(PALPooling):作者发明了一种轻量级工具,称为PALPooling。它不进行重新训练,而是充当“智能高亮笔”。它会审视专家的初步猜测,找出图像或文本中哪些部分对得出正确答案最有用,然后重新加权摘要以聚焦于这些部分。
- 速度:它在几秒钟内完成此操作,而非数小时,且无需繁重的“重新训练”过程。
为何这很重要
本文声称,通过简单地堆叠这些预训练工具(视觉 + 阅读 + 数据侦探),并利用少量数学方法整理数据,他们取得了最先进的成果。
- 无需训练:他们无需针对特定的新问题训练该系统。它即可“开箱即用”。
- 可扩展性:他们在包含超过50 万个样本和2,000 个不同类别(例如对数千种不同类型的软件错误或昆虫进行分类)的大型数据集上测试了该方法。
- 分层成功:他们证明该方法在“分层”任务中表现优异。想象一个图书馆,你首先按“小说”分类书籍,然后是“悬疑”,最后是“侦探”。CoMET 能快速导航这些层级而不致困惑,而传统方法往往难以处理如此庞大复杂的树状结构。
核心结论
本文认为,我们并不总是需要从零开始构建复杂的定制 AI 流程。相反,我们可以将 AI 模型视为乐高积木。如果你拥有一块用于图像的坚固积木、一块用于文本的坚固积木,以及一块用于数据表格的坚固积木,你就可以用一个简单的连接器(PCA)和一个智能决策者(TFM)将它们拼接在一起,瞬间解决难题。
本文并未声称:
- 它并未声称该方法适用于所有类型的数据(如音频或视频),尽管它暗示该方法可能扩展至这些领域。
- 它并未声称这将取代所有未来的 AI 训练,而是挑战了许多新问题中复杂训练的必要性。
- 它未提及具体的医疗诊断或临床用途;其重点在于一般的分类任务,如识别动物、文本情感或软件错误。
技术摘要:CoMET——无需微调的模块化多模态分类
问题陈述
多模态分类任务通常依赖于复杂的端到端训练流程,涉及在特定数据集上对大型基础模型进行微调。这种方法计算成本高昂、耗时,且往往需要针对数据集进行超参数调整。尽管表格基础模型(TFMs)近期已展现出无需微调即可通过上下文学习执行强预测任务的能力,但其应用主要局限于表格数据,或在应用于多模态场景时仍需微调。本文解决的核心挑战是:如何利用 TFMs 的“开箱即用”特性进行多模态分类(结合文本、图像和表格数据),而无需任何特定任务的训练或反向传播,同时克服标准模态编码器(通常输出如 CLS 等固定大小的令牌)与 TFM 输入要求之间的不匹配问题。
方法论:CoMET
作者提出了CoMET(将模态编码器与表格基础模型组合),这是一个将冻结的预训练骨干网络与 TFM 组合而成的模块化流程。该方法分为四个明确的步骤:
- 特征提取:每个非表格模态(例如图像、文本)通过冻结的预训练骨干网络(例如用于图像的 DINOv3,用于文本的 ELECTRA)进行处理,以提取样本级的令牌级嵌入。
- 池化:令牌嵌入被聚合为固定大小的向量表示。本文引入了PALPooling(伪注意力标签池化),作为标准 CLS 令牌或平均池化的轻量级自适应替代方案。
- PALPooling 机制:PALPooling 不通过反向传播,而是通过岭回归拟合一个线性评分向量。它使用源自 TFM 自身预测标签分布的“伪注意力标签”(PALs)。具体而言,它将训练数据划分为支持集和查询集。TFM 在查询集上进行预测,随后一个评分函数(基于预测结果与先验标签频率之间的 Jensen-Shannon 散度)为岭回归模型生成目标。该模型学习对令牌进行加权,以最大化相对于先验分布的偏移,从而在不通过 TFM 进行梯度下降的情况下有效识别信息丰富的令牌。
- 降维(PCA):使用主成分分析(PCA)对池化后的嵌入进行压缩。作者证明,PCA 不仅仅是一个压缩工具,更是一个关键的适配器,它将冻结编码器的嵌入几何结构与 TFM 的预训练先验(具有合成性和高秩特性)对齐。
- 预测:压缩并拼接后的多模态特征(表格数据 + 投影后的非表格数据)被输入到 TFM(具体为 TabICLv2)中,同时输入带有标签示例的支持集。TFM 执行上下文学习,以预测查询样本的标签分布。
主要贡献
- PCA 作为充分的适配器:本文证明,对来自冻结骨干网络的嵌入应用 PCA,足以使 TFMs 成为具有竞争力的多模态分类器。这种投影通过增加嵌入的有效秩、使其与 TFM 的合成预训练分布对齐,并平衡表格与非表格特征之间的信号,显著提升了性能。
- CoMET 框架:一个易于实现、模块化的框架,在无需任何微调的情况下,在多样化的多模态基准测试中实现了最先进(SOTA)的结果。其组件(编码器、TFMs)可独立替换。
- PALPooling:一种新颖的、无需训练的自适应池化方法。它利用源自模型自身输出的伪标签,避免了通过 TFM 进行反向传播的需求。它始终优于 CLS 令牌和平均池化,特别是在 CLS 令牌无法捕捉任务相关特征的场景中(例如包含多个对象的图像)。
- 可扩展的层次化分类:作者展示了 CoMET 在层次化分类(H-CoMET)中的应用。通过将大型分类问题(例如超过 50 万样本、2000 多个类别)分解为树结构内的较小子任务,该方法实现了快速、可扩展的推理,而无需为每个子任务单独训练模型。
结果
本文在单模态和多模态基准测试中评估了 CoMET:
- 单模态性能:在图像和文本数据集上,结合 PCA 和 PALPooling 的 CoMET 表现与线性探测或多层感知机(MLP)相当或更优,且往往显著超越它们(例如在 ImageNet 子集上提升 +3.4% 至 +6.2%)。
- 多模态基准测试:CoMET 在结合文本、图像和表格数据的数据集(例如 Jigsaw Toxicity、PetFinder、MM-IMDb、Airbnb)上取得了具有竞争力或最先进(SOTA)的结果。其表现优于之前的多模态 TFM 方法(如 MMPFN),后者需要利用模态特定投影器进行微调。
- 层次化扩展:在 iNaturalist(2,896 个类别)和 Amazon MM 等大规模层次化数据集上,H-CoMET 实现了高准确率(iNaturalist 上为 82.50%),推理时间低于 6 分钟,显著优于扁平分类器,并达到或超越了最先进层次化文本模型的水平。
- 效率:该方法无需对 TFM 或编码器进行训练。PALPooling 的拟合仅需数秒(例如图像数据集为 16 秒至 54 秒)。
意义与主张
本文认为,基础模型的组合为多模态学习提供了一种简单、强大且“开箱即用”的解决方案。其主要意义在于挑战了针对新问题必须采用复杂端到端训练流程的必要性。
- 模块化:该方法允许随着骨干网络或 TFM 的改进而独立替换它们,从而在不重新训练的情况下继承未来的进展。
- 无需训练的高效性:它证明了只要嵌入经过适当适配(通过 PCA)和池化(通过 PALPooling),即使对于非表格数据,也可以通过上下文学习摊销贝叶斯推断来实现强大的预测性能。
- 可扩展性:该方法使得处理传统微调方法因计算限制而往往难以应对的超大规模数据集和细粒度类别空间(数千个类别)成为可能。
作者保持了谦逊的态度,承认虽然 PCA 是一个简单的适配器,但更复杂的 TFM 信息驱动的降维方法可能会带来进一步的收益。他们还指出,当前工作专注于文本和图像模态,但该模板可推广至其他拥有现成编码器的领域(例如音频、视频)。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。