← 最新论文
🤖 machine learning

Tensor-Train Joint Modeling for Few-Step Discrete Diffusion

本文引入了一种张量列(Tensor-Train)联合建模框架,该框架通过将条件洁净分布显式表示为低秩张量,克服了当前离散扩散模型的系统性并行化偏差,从而通过轻量化微调实现针对序列数据的高效、高质量少步生成。

原作者: Byoungkwon Kim, Minhyuk Sung

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Byoungkwon Kim, Minhyuk Sung

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人写故事或设计一种新分子。在过去,机器人一次只能写一个词或一个原子,就像一个人一个字母一个字母地打字那样。这很慢,就像等待画笔上的颜料干透后才能画下一笔一样。最近,科学家们发明了一种更快的办法,叫做“扩散”(diffusion)。这种方法不再是从头开始书写,而是让机器人从一张布满了空白掩码(masks)的页面开始,同时猜测空白处应该填入什么,就像是在填填字游戏一样。这要快得多,因为它可以同时猜测许多个词。然而,这里有一个陷阱:当机器人为了追求极速而试图一次性猜测过多的词时,它就会出错。它假设它猜测的每一个词都是独立的,就像认为“云”这个词与“天空”这个词毫无关系,仅仅因为它在同一时间猜测了它们。这会导致产生乱码。计算机科学领域的一个重大问题是:我们如何让机器人一次猜测许多词,却又不丢失它们之间的联系,从而既能保持高效,又能让内容有意义?

这篇论文介绍了一个巧妙的新框架来解决这个难题。作者 Byoungkwon Kim 和 Minhyuk Sung 提出了一种名为“张量链联合建模”(Tensor-Train Joint Modeling)的方法。把机器人的大脑想象成一个巨大的、多维的拼图盒。旧的思维方式将盒子里的每个槽位都视为独立的、孤立的抽屉。而新方法则意识到,这些抽屉实际上是由一张隐藏的网状结构连接在一起的。他们使用一种叫做“张量分解”(tensor decomposition)的数学技巧来理清这张网。具体来说,他们发现一种被称为“张量链”(Tensor-Train, TTD)的技术,就像一组特殊的连锁齿轮,能够自然地理解相邻的词或原子是如何相互依赖的。

论文指出,通过使用这种 TTD 方法,机器人终于可以在短短几步之内预测出许多标记(tokens),而不会导致质量崩塌。在实验中,他们对文本写作和分子设计进行了测试。当他们将这种新方法应用于一个现有的模型 VADD 时,结果令人瞩目:在生成文本时,与标准版本相比,该模型在仅用 8 步生成 OpenWebText 数据集上的困惑度(以“生成困惑度”衡量)降低了 32.7%。更棒的是,这种提速并没有带来巨大的代价;当运行 128 步时,新方法仅比原始方法慢了 1.7%。作者认为,虽然其他方法试图通过添加额外的、沉重的模型或隐藏变量来解决问题,但他们的方法更轻量,因为他们直接将这种“连接网”构建到了机器人现有的脑结构之中。他们发现,这种方法对于像语言这样的序列数据效果最好,因为语言中后文的内容深受前文的影响,而这种模式恰好被他们的“张量链”齿轮所完美捕捉。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →