← 最新论文
💬 NLP

Lost in Interpolation: Why Predictive Feedback Fails in Diffusion Language Models

本文指出,现有掩码扩散语言模型中所使用的欧几里得线性插值与其超球面嵌入空间在几何上是不匹配的,并提出了球面软掩码(S-SM),这是一种使用球面线性插值的方法,在不降低收敛性的情况下显著提升了生成质量和困惑度。

原作者: Lavanya Nigam, Ishaan Bansal, Aryan Sood, Vidit Aggarwal, Gaurav Kumar Nayak

发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Lavanya Nigam, Ishaan Bansal, Aryan Sood, Vidit Aggarwal, Gaurav Kumar Nayak

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人写故事,但不是让它像人类那样逐字书写,而是给它一张空白页,上面的每个词都被一个“掩码(MASK)”遮住了。机器人的任务是通览整页内容,猜出空白处应该填什么词,然后一个接一个地慢慢揭晓它们。这就是一种被称为“扩散语言模型(Diffusion Language Model)”的 AI 工作方式。这就像一场倒过来的“猜词游戏”,AI 从完全混乱的状态开始,逐渐让画面变得清晰。

为了让这个游戏更快、更聪明,研究人员使用了一个技巧叫做“软掩码(soft-masking)”。与其让机器人只是简单地说:“我确定这个词是‘猫’”或者“不,继续遮住它”,它还可以说:“我有 80% 的把握它是‘猫’,有 20% 的把握它是‘狗’”。它将这些猜测融合在一起,为下一轮创造出一个新的、模糊的提示。现在的核心问题是:你应该如何在数学上融合这些猜测? 大多数人一直采用旧的方法,即假设机器人的大脑是一张平坦的、直线型的地图。但如果机器人的大脑实际上是一个巨大的、弯曲的球体呢?


插值中的迷失之谜

这篇论文的作者们——来自印度理工学院鲁尔基分校(IIT Roorkee)的一个团队——决定调查这些 AI 模型内部“大脑”的形状。他们发现,这些模型存储单词的方式并不是像纸张一样平坦,而是像球体的表面一样弯曲。

把 AI 的词汇表想象成一个巨大的、隐形的地球仪。每个单词都是这个球体表面上的一个点。当 AI 进行猜测时,它正指向球体上的某个位置。问题在于,标准的混合猜测方法(称为“线性插值”或 LERP)将地球仪视为一张平坦的地图。如果你在平坦的地图上画一条连接两个城市的直线,你可能会直接穿过地球中心。但如果你是在地球表面行走,你必须沿着地面的曲线前进。论文指出,标准方法强迫 AI 穿过地球中心,这是一条奇怪且不自然的路径,会让模型感到困惑并减慢其速度。

“插值中的迷失”这一发现

研究人员发现,当 AI 试图使用旧的、平直线的方法来融合预测时,它会“迷失”。他们测量了“掩码状态”(空白)与“预测状态”(猜测)之间的夹角,发现无论在整个训练过程中,这个角度始终稳定在 73 度。他们还注意到,无论单词多么常见或罕见,词向量的“大小”(或范数)几乎保持完全相同。这两个线索就像是足迹,证明了 AI 正行走在一个超球面(多维球体)上,而不是一个平坦的平面上。

因为 AI 生活在球面上,作者认为使用直线来混合信息是不对的工具。这就像是用一把放在桌子上的直尺去测量纽约和伦敦之间的距离,而不是用一根绕过地球仪的绳子。

解决方案:球面软掩码 (S-SM)

为了解决这个问题,该团队发明了一种新方法:球面软掩码 (S-SM)。S-SM 不再是在地球中心画直线,而是强迫 AI 沿着地球表面行走。

他们是这样做的:

  1. 地球行走:他们没有在直线路径上平均化猜测,而是使用了一种特殊的数学技巧——“Fréchet 均值(Fréchet mean)”,来寻找球面上平均位置。
  2. 曲线融合:他们使用了名为 SLERP(球面线性插值)的技术。想象一下在气球上两个点之间拉紧的一根绳子;SLERP 沿着这根绳子沿着气球的曲线移动,永远不会离开表面。
  3. 结果:他们在一个拥有 1.69 亿参数的 AI 模型上测试了这种新方法。结果令人印象深刻。新方法不仅有效,而且表现得更好

数据说明了什么

团队将他们的 S-SM 方法与旧的标准(TopK/LERP)以及一个没有任何反馈的版本进行了对比测试。他们测试了不同的“思考时间”(称为 NFE 预算,范围从 64 到 512 步)。

  • 更高的质量:新方法生成的文本更接近人类的写作。他们使用了一个名为 MAUVE 的评分来进行衡量。在较高的预算下(如 512 步),S-SM 比旧方法提高了多达 2 倍 的 MAUVE 分数,比标准的 TopK/LERP 方法提高了 27.5% 至 56.1%
  • 更少的错误:AI 犯下的令人困惑的错误更少了。“生成困惑度(generative perplexity)”(衡量 AI 对自身文本感到惊讶程度的指标)比基准模型下降了 16.9% 至 19.6%
  • 没有权衡取舍:通常情况下,当你让 AI 变得更聪明时,它会变得缺乏创意(即重复自身)。但作者发现,S-SM 保持了与旧方法完全相同的“熵”(衡量创意和随机性的指标)。它变得更聪明了,却并未变得枯燥乏味。

为什么旧方法会失败

论文明确排除了“平直直线法仅仅是‘还可以’或‘足够好’而已”的可能性。数据表明,对于这类 AI 来说,这种方法在根本上是错误的。当研究人员观察“置信权重”(AI 用来决定对其猜测信任程度的一个数值)时,他们看到了有趣的事情。在新的 S-SM 方法下,AI 学会了更加信任其几何反馈,其权重稳定在约 0.056,而旧方法仅在 0.030 左右。这表明当 AI 不再被强迫穿过地球中心时,它“感觉”更加自信。

核心结论

这篇论文不仅仅是提出了一个新想法,它还提供了强有力的证据,证明 AI 大脑的几何结构是球形的,而我们一直以来使用的数学工具是错误的。通过从直线转向曲线路径(SLERP),作者展示了我们可以让这些模型生成更好的文本,且速度更快,同时不会失去它们的灵性。这提醒我们,有时为了前进,你不能只走直线,而要跟随曲线。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →