← 最新论文
💻 computer science

AV-JEPA: Extending LeJEPA to Audio-Visual Self-Supervised Learning

本文介绍了 AV-JEPA,这是一个精简的音视频自监督学习框架,它通过使用早期融合的视觉 Transformer 和模态丢弃技术扩展了 LeJEPA,在不依赖解码器、指数移动平均(EMA)教师或对比负样本的情况下,实现了具有竞争力的性能和零样本检索能力。

原作者: Benjamin Robson, Santeri Mentu, Wenshuai Zhao, Arno Solin

发布于 2026-07-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Benjamin Robson, Santeri Mentu, Wenshuai Zhao, Arno Solin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:计算机就像一群渴望学习、白纸般的学生,想要了解一切,却被困在一个没有老师、没有教科书的教室里。这就是**自监督学习(self-supervised learning)的领域——在这个领域中,机器试图通过在海量的无标签数据中寻找模式来教导自己。通常情况下,为了让计算机学会识别猫或汽车,需要人类指着一张图片说:“那是只猫。”但如果计算机仅仅通过观察图片并猜测缺失的部分就能学习呢?这就是掩码学习(masked learning)**的魔力:你遮住图像或声音的一部分,然后让计算机去填补空白。长期以来,实现这一目标的最佳方式是强迫计算机逐像素地重建缺失的部分,就像一个拼图解谜者试图重构一个破碎的花瓶。但现在有一个更新颖、更抽象的概念叫做 JEPA(联合嵌入预测架构)。JEPA 不要求计算机重建破碎的花瓶,而是要求它预测缺失部分的“本质”或“氛围”。这就像是通过闻蒸汽来猜测汤的味道,而不是试图尝出每一项具体的食材。这篇论文提出了一个重大问题:当计算机试图同时理解两种不同的感官——视觉和听觉时,这种“猜测氛围”的方法是否可行?

来自芬兰的一个团队撰写了这篇论文,他们说“可以!”,并介绍了一种名为 AV-JEPA 的新模型。把 AV-JEPA 想象成一位超级聪明的侦探,他通过观察视频和聆听音频来理解犯罪现场,但有一个特别之处:他并不试图重建缺失的视频帧或音频波形(这就像是试图凭记忆重画整个犯罪现场),这位侦探学习的是在一种感官缺失时,预测场景的“感觉”。

他们是这样做的。想象你正在观看一段吉他手的视频。通常,计算机会将视频和音频结合在一起观察。然而,AV-JEPA 会对感官进行一场“捉迷藏”游戏。它获取一段剪辑,并创建两个版本:一个版本中视频被完全遮蔽(因此计算机只能听到吉他),另一个版本中音频被静音(因此计算机只能看到吉他)。模型的任务是观察“仅音频”的版本,并预测“仅视频”版本的感觉如何,反之亦然。它在没有任何人类告诉它发生了什么,也没有尝试重建缺失部分的情况下完成这项工作。它只是学习如何在共享的精神空间中,将声音的“灵魂”与图像的“灵魂”对齐。

对于一种跳过了繁重重建工作的算法来说,其结果非常令人印象深刻。当他们在名为 VGGSound(包含声音视频的数据库)的数据集上测试该模型时,它在识别视频发生内容方面的准确率达到了 57.1%。在另一个大规模数据集 AudioSet 上,它获得了 32.7 的 mAP(衡量识别声音好坏的指标)。虽然这些数字略低于目前使用旧有“重建拼图”方法的顶尖模型(后者在 VGGSound 上可达 67%),但作者指出,AV-JEPA 要简单得多。它不需要复杂的额外组件来重建图像,也不需要一个“老师”模型来引导它。它只是通过自我学习。

这篇论文最酷的发现之一是,该模型学会了自主关注正确的事物。当研究人员观察模型在听到某种声音时“看向”哪里时,发现它自然而然地聚焦在噪声源上。如果它听到鸟鸣,它就会看向鸟;如果它听到长笛,它就会看向音乐家的嘴部。它在没有人教它寻找声源的情况下做到了这一点;它只是通过必须预测彼此的关系,从而发现了声音与视觉来源之间的联系。

论文还表明,该模型可以进行“零样本(zero-shot)”检索,这是一种高级说法,意味着它只需通过搜索声音就能找到视频,或者通过搜索视频就能找到声音,而无需专门针对这些特定的搜索任务进行训练。这就像是在一个图书馆里,你只需哼唱一段曲调就能找到对应的书。

然而,作者也坦诚地说明了局限性。他们发现该模型在音频方面存在严重的偏向。在测试中,模型的决策主要由听到的内容驱动,而非看到的画面。这就像是这位侦探在听觉线索方面是个天才,但在视觉证据面前却有些分心。论文指出,虽然对于一种“纯净”且简单的架构而言,这是一个巨大的进步,但仍需努力才能使其在视觉理解上达到与听觉相匹配的高度,尤其是与那些花费多年时间进行图像重建的复杂模型相比。但对于一种抛弃了重建拼图、转而专注于感官连接的方法来说,AV-JEPA 是一个非常有前景的新方向,它展示了计算机学习世界如何发声与呈现视觉的新路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →