The JEPA Predictor: A Transferable Operator for Occluded Feature Completion
本文证明了联合嵌入预测架构(JEPA)中的预测器组件可以通过简单的线性投影进行冻结并迁移至非 JEPA 编码器,通过在无需重新训练底层模型的情况下有效补全缺失特征,显著提升其在遮挡输入下的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图在拥挤的房间里认出一个朋友,但有人把一个巨大的、不透明的盒子盖住了他半张脸。你的大脑非常擅长填补空白:它会利用可见的耳朵、头发以及房间里的环境信息来推测被遮挡的面部轮廓。在人工智能的世界里,计算机已经变得非常擅长在看到完整图像时识别事物。然而,当图像的一部分缺失时——比如一辆车被树部分遮挡,或者医疗扫描图像被金属植入物截断——这些聪明的计算机往往会感到困惑并犯错。
多年来,科学家们构建了两种主要的“聪明眼睛”(AI 模型)来解决这个问题。一种类型通过尝试猜测缺失的碎片来进行学习(基于现在预测未来),而另一种类型则通过比较不同的图片来寻找相似之处。通常,当这些模型训练完成后,负责“猜测”的部分会被丢弃,因为该部分仅在学习阶段才需要。最终的产品只是那个“看”图片的“眼睛”。但如果那个被丢弃的“猜测机器”实际上是我们忘记使用的超能力呢?这篇论文提出了一个简单且有趣的疑问:我们能否将一种 AI 类型中的“猜测机器”嫁接到另一种不同类型的 AI 上,从而帮助它看穿缺失信息的迷雾?
研究人员 William 和 Christopher Nguyen 来自 Aitomatic, Inc.,他们发现答案是肯定的。他们发现,一种被称为 JEPA(联合嵌入预测架构)的特定 AI 架构中的“预测器”部分,充当了缺失信息的通用翻译器。尽管这个预测器是针对一种特定的 AI 类型进行训练的,但他们展示了通过一个简单的数学桥梁,它可以被“插”进四种完全不同的流行 AI 模型(如 CLIP、DINOv3、DINOv2 和 MAE)中。
以下是他们的实验是如何运作的:想象你有一张狗的照片,但 77% 的部分被一个黑色矩形覆盖了。一个标准的 AI 模型,如果只观察可见的极小部分,可能会猜它是一只猫或一块石头。研究人员取了一个来自 JEPA 模型的“冻结”(未改变)预测器,并将其连接到其他 AI 模型上。当 AI 看到可见的部分时,它会将该信息通过一个简单的线性桥梁传递给 JEPA 预测器。随后,预测器利用其训练过的知识来“幻觉”或预测出隐藏的 77% 的狗的特征应该是怎样的。最后,系统将真实的可见部分与预测的隐藏部分结合起来,做出最终判断。
结果令人瞩目,尤其是在图像被严重遮挡的情况下。在一个犬种数据集中,标准 AI 模型(CLIP)在 77% 的图像被遮挡时,准确率跌至仅 15.9% 的糟糕水平。但一旦他们连接上 JEPA 预测器,其准确率便飙升至 52.1%。这是一个高达 36 个百分点的巨大飞跃。在另一个类别较少的数据集上,该模型几乎恢复了因缺失部分而损失的所有准确率。
论文解释说,这之所以奏效,是因为存在一种“成本-收益”的平衡。连接两个模型的简单桥梁并不完美;它会轻微地扭曲图像中可见部分的特征信息(成本)。然而,预测器在猜测缺失部分方面表现得极其出色(收益)。当图像大部分可见时,扭曲成本过高,系统就不会提供太多帮助。但当图像被严重遮挡(如 77% 被遮挡)时,拥有一个关于缺失部分的良好猜测所带来的收益,完全压倒了微小的扭曲成本。预测器本质上变成了一个可移植的“特征补全”工具,它可以在不需要重新训练主模型的情况下,跨越不同的 AI 家族发挥作用。
研究人员还测试了如果缺失的部分像电视屏幕上的静电一样随机分布会发生什么。在这种情况下,预测器的帮助并不大,这表明它是专门为处理大块连续缺失信息(如树木遮挡汽车或照片中的裁剪部分)而设计的。他们还证明了这不仅仅是 AI 在“平滑”模糊边缘或填充像素;它实际上是在重建高层级的特征,从而让计算机能够理解物体的身份。
简而言之,这篇论文表明,我们并不总是需要从头开始构建一个新的、庞大的 AI 来处理缺失数据。我们可以提取一个为特定任务构建的专门“猜测引擎”,并通过一个简单的数学适配器,用它来强化其他 AI 模型,即使在图像破碎时也能帮助它们看清世界。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。