← 最新论文
💬 NLP

A Continuous-Time Markov Chain Framework for Insertion Language Models

本文建立了一个连续时间马尔可夫链框架,以推导出一种针对插入式语言模型(Insertion Language Models)的有原则的扩散式去噪目标,证明了先前的方法是该方法的特例,同时实现了具有竞争力的性能和增强的采样灵活性。

原作者: Dhruvesh Patel, Benjamin Rozonoyer, Soumitra Das, Tahira Naseem, Tim G. J. Rudner, Andrew McCallum

发布于 2026-06-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Dhruvesh Patel, Benjamin Rozonoyer, Soumitra Das, Tahira Naseem, Tim G. J. Rudner, Andrew McCallum

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图写一个故事,但你必须遵守一个非常严格的规则:你必须按顺序写下每一个词,从第一个字母到最后一个字母。这就是大多数当前的 AI 语言模型(被称为“自回归”模型)的工作方式。它们就像一列只能在单轨上向前行驶的火车。如果火车在旅程早期卡住了或走错了路,很难修复整个行程。

其他模型则试图变得更加灵活,通过猜测句子中间的词并填补空白(例如“掩码扩散模型”)。然而,这些模型有时可能难以确定句子的确切长度,或者可能会对事件的顺序感到困惑。

这篇论文介绍了一种教 AI 写字的新方法,称为基于扩散的插入式语言模型(Diffusion-based Insertion Language Models, DILMs)。以下是它如何运作的,使用了简单的类比:

核心思想:“剪刀与胶水”游戏

作者设想了一个反向进行的“游戏”,以此来教 AI 如何写作。

  1. 加噪过程(剪刀):
    想象你有一个完美、完整的句子:“The quick brown fox jumps over the lazy dog.”(敏捷的棕色狐狸跳过了那只懒狗。)
    AI 的老师拿起一把剪刀,开始随机地一个接一个地剪掉单词。

    • 首先,它剪掉了 “lazy”。
    • 然后它剪掉了 “brown”。
    • 接着是 “jumps”。
    • 最终,你只剩下了几个单词,甚至是一个空白空间。
      该论文使用了一个叫做**连续时间马尔可夫链(Continuous-Time Markov Chain)**的数学框架来描述这个剪切过程。你可以把这理解为一种精确、科学的方式,用来表达:“我们将以稳定、可预测的速率移除单词,直到句子消失为止。”
  2. 学习过程(胶水):
    现在,AI 必须进行反向游戏。它从空白空间(或剩余的少量单词)开始,必须弄清楚如何把单词放回去。

    • 它不仅仅是猜测下一个词,它可以在任何地方插入单词。
    • 它可以把 “brown” 放在 “The” 和 “quick” 之间。
    • 它可以把 “lazy” 放在 “over” 和 “dog” 之间。
    • 它甚至可以在不同的间隙中同时插入多个单词。

为什么这很特别?

该论文声称这种方法结合了两者的优点:

  • 灵活性: 与“轨道上的火车”模型不同,这种 AI 可以在句子的中间修正错误或添加细节,而无需从头开始重写整个句子。
  • 知道何时停止: 这些“填空式”模型的一个常见问题是它们不知道句子何时结束。它们可能会不停地添加单词,或者过早停止。
    • 作者通过教 AI 预测**“剩余长度”(length-to-go)**解决了这个问题。想象 AI 有一个小小的燃料表。随着它插入单词,燃料表会下降。当仪表归零时,AI 就知道:“好了,句子完成了,”然后它会自然地停止。

该新模型的两个版本

论文提出了两种实现这种“粘贴”(插入)的具体方式:

  1. DILM-S(单次插入): AI 一次只选择一个位置和单词进行插入。这就像一次小心翼翼地放置一块乐高积木。这非常精确。
  2. DILM-M(多次插入): AI 同时观察所有的空白处,并可以同时填补多个间隙。这就像抓起一把乐高积木,并将它们一次性卡入到位。这更快。

他们发现了什么?

研究人员在两类任务上测试了他们的新模型:

  1. 规划任务(“星形图”游戏):
    想象一张地图,有一个中心枢纽和几条通往四周的路径。AI 必须找到从起点到终点的正确路径。

    • 结果: 新模型(DILM-S 和 DILM-M)几乎是完美的。它们比标准的“轨道上的火车”模型以及其他的“填空式”模型都要出色。它们能够看到全局并正确规划路线。
  2. 写故事(语言建模):
    他们测试了模型编写新闻文章和通用文本的能力。

    • 结果: 新模型的写作连贯性与现有的最佳模型一样好。
    • 巨大的加分项: 作者发现,通过他们的新方法,你可以权衡速度与质量。如果你让 AI 进行更多“步骤”(花费更多时间),写作质量就会提高。如果你追求速度,它会更快,但质量会稍逊一筹。这给了用户一个可以调节的旋钮,以获得他们精确需要的东西。

总结

简而言之,这篇论文将“填空”这一混乱、试错的过程赋予了一个坚实的数学基础。通过将这个过程视为一个连续的“剪切与粘贴”单词的游戏,他们创造出了一种可以按任何顺序写作、知道何时停止、并且可以根据用户需求在速度与高质量之间进行调节的 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →