← 最新论文
💬 NLP

AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling

AURORA-LM 是一种连续潜变量扩散语言模型,通过将高容量、可解码文本表示的构建与其分布建模相解耦,利用基于查询的编码器-解码器以及在 Ascend NPU 上通过流匹配训练的块因果扩散 Transformer,实现了最先进的性能。

原作者: Jiajun Liang, Yucheng Liao, Yukang Cao, Jiazhe Wei, Ken Li, Wende Tan, Jiankun Zhang, ZY Cui, Jingkang Yang, Liucheng Guo, Shiqi Yang, B. Yang, Caifeng Shan, Ziwei Liu, Chenyang Si

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiajun Liang, Yucheng Liao, Yukang Cao, Jiazhe Wei, Ken Li, Wende Tan, Jiankun Zhang, ZY Cui, Jingkang Yang, Liucheng Guo, Shiqi Yang, B. Yang, Caifeng Shan, Ziwei Liu, Chenyang Si

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图制造一台能够像人类作家一样构思新故事的机器。长期以来,科学家们已经非常擅长教机器构思图像、音乐和视频。他们通过将这些事物视为平滑、流动的“数据之河”来进行教学——想象一下从蓝色到紫色的色彩渐变,或者从一个音符滑动到另一个音符的旋律。这种“连续性”的思维方式在处理图像和声音时效果极佳。但当涉及到语言时,机器却一直困在另一个世界里:一个由乐高积木组成的世界。要写出一个句子,计算机必须一个接一个地拼凑起被称为“标记”(tokens,如单词或单词的一部分)的单个、僵硬的方块。这就像是只能使用一个单一、僵硬的印章来创作一幅杰作。

科学家们一直在问一个大问题:我们能否教机器使用那种用于图像的平滑、流动的“河流方法”来写作?这个挑战非常棘手。语言是精确的;如果稍微模糊一个词,它可能会变成完全不同的词或者乱码。以往尝试融合这两个世界的方法通常必须做出妥协:它们会将语言挤压成一个微小的、模糊的形状,以便于机器生成,但这样一来,机器就无法清晰地读取它了。这就像是用隐形墨水写小说,然后寄希望于读者能猜出其中的文字。

AURORA-LM 的出现,是一种全新的方法,它说:“让我们停止挤压语言。”与其强迫语言进入一个微小且易于生成的形状,研究人员构建了一个特殊的“翻译器”,它能保持语言的丰富与细节,并教会生成器去处理这种复杂性。你可以这样想:想象你想重塑一座复杂的雕塑。旧的方法会说:“让我们只做一个微小的、模糊的黏土团,然后寄希望于稍后它看起来像那座雕塑。”而 AURORA-LM 则说:“不,我们要保持黏土的细节和高质量,并培养一位更聪明的雕塑家,他知道如何精准地塑造这些细腻的黏土而不出错。”

研究人员发现,通过将“使语言细节化”的任务与“生成故事”的任务分开,他们可以兼顾两者的优点。他们创建了一个系统,用于生成平滑、连续的“潜变量”(latent)数据流(这是一个高级术语,指文本的一种隐藏的、压缩后的版本),而这些数据仍然足够详细,足以被还原为完美的文字。他们在两个大型任务上进行了测试:从头开始编写随机故事以及总结长篇新闻文章。在这些测试中,AUR生的 AURORA-LM 表明,它比其他尝试实现类似目标的方法(包括一些已经存在的非常大的模型)能写得更加流畅和准确。

团队还展示了这种方法在扩大机器规模时会变得更加出色。他们将其规模扩大到了一个拥有约 10 亿参数的版本(参数是衡量 AI “大脑”大小和复杂程度的指标),并发现它依然表现强劲,甚至击败了一个使用类似技术的大型公开模型。核心结论是:你不需要为了让机器更容易生成而牺牲语言的清晰度。通过在“平滑的生成世界”与“精确的文字世界”之间建立一座更聪明的桥梁,AURORA-LM 表明,机器可能很快就能像绘画和歌唱那样,用同样流畅、连续的优雅姿态进行写作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →