AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling
AURORA-LM 是一种连续潜变量扩散语言模型,通过将高容量、可解码文本表示的构建与其分布建模相解耦,利用基于查询的编码器-解码器以及在 Ascend NPU 上通过流匹配训练的块因果扩散 Transformer,实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图制造一台能够像人类作家一样构思新故事的机器。长期以来,科学家们已经非常擅长教机器构思图像、音乐和视频。他们通过将这些事物视为平滑、流动的“数据之河”来进行教学——想象一下从蓝色到紫色的色彩渐变,或者从一个音符滑动到另一个音符的旋律。这种“连续性”的思维方式在处理图像和声音时效果极佳。但当涉及到语言时,机器却一直困在另一个世界里:一个由乐高积木组成的世界。要写出一个句子,计算机必须一个接一个地拼凑起被称为“标记”(tokens,如单词或单词的一部分)的单个、僵硬的方块。这就像是只能使用一个单一、僵硬的印章来创作一幅杰作。
科学家们一直在问一个大问题:我们能否教机器使用那种用于图像的平滑、流动的“河流方法”来写作?这个挑战非常棘手。语言是精确的;如果稍微模糊一个词,它可能会变成完全不同的词或者乱码。以往尝试融合这两个世界的方法通常必须做出妥协:它们会将语言挤压成一个微小的、模糊的形状,以便于机器生成,但这样一来,机器就无法清晰地读取它了。这就像是用隐形墨水写小说,然后寄希望于读者能猜出其中的文字。
AURORA-LM 的出现,是一种全新的方法,它说:“让我们停止挤压语言。”与其强迫语言进入一个微小且易于生成的形状,研究人员构建了一个特殊的“翻译器”,它能保持语言的丰富与细节,并教会生成器去处理这种复杂性。你可以这样想:想象你想重塑一座复杂的雕塑。旧的方法会说:“让我们只做一个微小的、模糊的黏土团,然后寄希望于稍后它看起来像那座雕塑。”而 AURORA-LM 则说:“不,我们要保持黏土的细节和高质量,并培养一位更聪明的雕塑家,他知道如何精准地塑造这些细腻的黏土而不出错。”
研究人员发现,通过将“使语言细节化”的任务与“生成故事”的任务分开,他们可以兼顾两者的优点。他们创建了一个系统,用于生成平滑、连续的“潜变量”(latent)数据流(这是一个高级术语,指文本的一种隐藏的、压缩后的版本),而这些数据仍然足够详细,足以被还原为完美的文字。他们在两个大型任务上进行了测试:从头开始编写随机故事以及总结长篇新闻文章。在这些测试中,AUR生的 AURORA-LM 表明,它比其他尝试实现类似目标的方法(包括一些已经存在的非常大的模型)能写得更加流畅和准确。
团队还展示了这种方法在扩大机器规模时会变得更加出色。他们将其规模扩大到了一个拥有约 10 亿参数的版本(参数是衡量 AI “大脑”大小和复杂程度的指标),并发现它依然表现强劲,甚至击败了一个使用类似技术的大型公开模型。核心结论是:你不需要为了让机器更容易生成而牺牲语言的清晰度。通过在“平滑的生成世界”与“精确的文字世界”之间建立一座更聪明的桥梁,AURORA-LM 表明,机器可能很快就能像绘画和歌唱那样,用同样流畅、连续的优雅姿态进行写作。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。