← 最新论文
🤖 AI

LeVLJEPA: End-to-End Vision-Language Pretraining Without Negatives

LeVLJEPA 引入了首个完全非对比式的端到端视觉-语言预训练方法,该方法利用无需负样本的跨模态预测,在为视觉问答和语义分割等下游任务生成密集语义特征方面展现出卓越性能,同时在全局读出(global readouts)方面保持了竞争力。

原作者: Lukas Kuhn, Giuseppe Serra, Randall Balestriero, Florian Buettner

发布于 2026-07-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Lukas Kuhn, Giuseppe Serra, Randall Balestriero, Florian Buettner

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图通过向机器人展示图片并读给它看与这些图片相关的故事,来教会它理解这个世界。长期以来,这种教学的最佳方式就像是在玩一场高风险的“找不同”游戏,而且还要面对庞大的群众。

旧方法:“找不同”游戏(对比学习)

把传统的训练方法(如 CLIP)想象成一位老师拿着一张猫的照片,并读出一段话:“这是一只猫。”为了确保机器人学到了东西,老师还会向它展示 10,000 张其他照片和故事,而这些内容与这张照片并不匹配。机器人必须学会:“好吧,这张特定的照片与这个故事相匹配,但它绝对不匹配那 10,000 个其他东西。”

这种方法在处理简单任务时表现良好,比如看着一张图片并猜出:“这是一只猫还是一只狗?”(零样本分类)。但它有一个缺陷:机器人为了在“匹配 vs 不匹配”的游戏中获胜,会学会只关注大局,从而忽略了图像中微小、细致的部分。这就像是通过只背诵书的封面来准备考试,却忽略了书里的章节内容。

新方法:“蒙面翻译官”(LeVLJEPA)

该论文的作者们提出了一个大胆的问题:我们能否在不展示任何“错误答案”(负样本)的情况下,教会机器人?

他们构建了一个全新的系统,其运作方式就像是一个**“蒙面翻译官”**游戏:

  1. 设定: 你有两个专家。一个负责看图片,另一个负责读故事。
  2. 游戏规则: “图片专家”试图猜出“故事专家”在想什么,反之亦然。
  3. 转折点: 被猜测的对象是“冻结”状态的(他们无法改变想法或给出反馈)。猜测者必须完全依靠自己来弄清楚真相。
  4. 安全网: 为了确保猜测者不会直接放弃并对所有问题都回答“我不知道”(这被称为“崩溃”),他们必须遵循一条规则:他们的猜测必须均匀分布,就像发出一副分布均匀的牌一样,而不是聚拢在一起。

这种方法不需要负样本,不需要复杂的温度设置,也不需要庞大的“错误答案”人群。它仅仅依赖于预测和一个简单的规则来保持平衡。

大惊喜:“细节” vs “总结”

研究人员将这种新方法与旧有的“找不同”方法进行了对比测试。以下是他们的发现:

  • 总结测试(全局特征): 如果你问机器人:“这张图片里的主要物体是什么?”(例如简单的分类任务),旧方法和新方法的表现几乎完全一样。它们都擅长处理“大局”。
  • 细节测试(稠密特征): 这正是奇迹发生的地方。现代 AI 系统不仅仅观察“主要物体”,它们还会观察图像中的每一个局部块(patch),以理解复杂的场景,比如在杂乱的库房里寻找特定的工具,或者追踪机器人的手臂。
    • 旧的“找不同”方法就像是一个只记得城市天际线的游客。
    • 新的 LeVLJEPA 方法则像是一位熟悉每一条街道、小巷和店铺的当地导游。

当研究人员将这种新方法作为复杂视觉语言模型(例如能够遵循指令或回答详细问题的机器人)的“大脑”时,它彻底击败了竞争对手。它在以下方面表现得显著更好:

  • 语义分割: 精确识别哪些像素属于哪个物体(比如为汽车画出完美的轮廓线)。
  • 视觉问答: 回答棘手的问题,例如“那个红色的物体正坐在蓝色的桌子上吗?”

核心启示

论文得出结论:旧的训练方式(使用负样本)对于简单的“匹配或不匹配”游戏非常有效,但它实际上阻碍了那些需要观察精细细节的 AI 的发展。

通过转向这种新的“无需负样本的预测”方法,他们创造了一个能够以高清晰度(逐像素级别)观察世界的视觉编码器,而这正是现代 AI 系统在现实世界中运行所必需的。

简而言之: 旧的方法教会了 AI 识别书的封面。而新的方法教会了 AI 逐页阅读整个故事

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →