← 最新论文
💬 NLP

The JEPA Paradox in Language: The Geometry of Linguistic Alternatives

本文认为,确定性联合嵌入预测架构(JEPAs)在语言任务上表现不佳,是因为文本固有的多模态性违反了平方误差潜变量预测所需的条件集中性,从而导致表征坍缩以及下游性能下降,除非重新设计目标函数以保留多种可能的补全方式。

原作者: Anh Trac Duc Dinh, Khang Nhat Hoang Vo

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Anh Trac Duc Dinh, Khang Nhat Hoang Vo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图教会一个机器人如何理解世界。为了做到这一点,科学家经常使用一种被称为“自监督学习”的技巧,即让计算机通过猜测它已经见过的拼图中的缺失部分来进行学习。在图像和视频的世界里,这种方法就像魔法一样奏效。如果你遮住一张猫的照片中的一小部分,计算机可以轻易猜出下面是什么,因为毛发、耳朵和背景都由平滑且可预测的模式连接在一起。如果你知道猫头部的样子,你就确切知道旁边的耳朵应该是什么样子的。这种被称为 JEPA(联合嵌入预测架构)的方法已成为图像、视频和音频领域的明星,因为其中的“缺失部分”通常只有一个正确答案。

然而,当科学家尝试将这种同样的“猜缺失部分”技巧用于语言时,情况变得奇怪了。语言不像图片;它更像是一本“选择你自己的冒险”类书籍。如果你遮住句子中一个词,比如“猫在垫子上___”,缺失的词可以是“坐”、“躺”、“睡”甚至“玩”。所有这些都是合理的,但它们又截然不同。这篇论文探讨的核心问题是:为什么“猜缺失部分”的方法在处理图片时表现得如此出色,但在处理文本时却惨败?作者们试图寻找这种失败背后的几何学原因,本质上是在询问:当我们从像素切换到单词时,游戏的规则是否发生了变化?

这篇题为《语言中的 JEPA 悖论》的论文指出,问题不在于计算机不够聪明,而在于游戏本身对它是不公平的。作者们构建了一个文本版的图像预测器(他们称之为 T-JEPA),并观察它在实时运行中的挣扎。他们发现,当你要求计算机通过猜测一个单一的“平均”答案来预测缺失的单词时,它会感到困惑。因为完成一个句子的有效方式有很多种,计算机试图寻找一个中间地带。结果它预测出了一个“幽灵词”,它是“坐”、“躺”和“睡”的混乱混合体——一个实际上并不存在且没有任何意义的词。

研究人员发现了一个特定的失败序列。首先,计算机意识到它无法以高置信度预测该单词,因为选项太多了。然后,它并没有学会处理这种不确定性,而是试图通过将所有不同的含义坍缩成记忆中一个单一、乏味的点的做法来“作弊”。这被称为“质心退化”(centroid degeneracy)。想象一下,试图通过指向中间的一个灰色点来描述彩虹;你会失去所有的色彩和意义。论文显示,这种坍缩发生在计算机意识到自己在失败之前。计算机的内部语言地图不断缩小,直到它无法分辨快乐的句子和悲伤的句子,从而导致在阅读理解或搜索等任务上的表现极差。

这项研究明确排除了“计算机只是需要更多训练时间或更大的大脑”这一观点。失败的原因在于,用于图片的数学方法(平方误差预测)要求一个单一、清晰的答案,而语言天生提供的是一个由许多可能选项组成的“云团”。作者建议,如果计算机想要以此方式学习语言,它们需要停止尝试将所有这些可能性挤压成一个点,而是要学会尊重这些有效的“云团”。虽然这篇论文并未声称已经解决了如何教 AI 语言的问题,但它提供了一张清晰的地图,解释了为什么目前的“图片式”方法在面对文本时会撞墙,并为开发能够处理人类语言那美丽而混乱的歧义性的新方法指明了方向。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →