← 最新论文
💬 NLP

Hierarchical Latent Prediction for Language Models

本文介绍了分层潜在预测(Hierarchical Latent Prediction, HiLP),这是一种利用高层抽象潜在变量来减轻潜在空间展开中误差累积的新型辅助目标,从而提升语言模型的长程推理、编程性能以及投机采样效率。

原作者: Chang Shi, Tim Pearce, Manan Tomar, Siddhartha Sen, John Langford

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Chang Shi, Tim Pearce, Manan Tomar, Siddhartha Sen, John Langford

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一个机器人写故事。教它的标准方法叫做“下一标记预测”(Next-Token Prediction)。这就像是在玩“填词游戏”(Mad Libs),机器人观察你写的最后一个词,然后猜下一个词是什么。如果你说“猫坐在……”,机器人猜“垫子上”。接着,你输入“猫坐在垫子上”,它猜“柔软的”。这种方法已经造就了一些极其聪明的机器人,但它有一个缺陷。因为机器人只看前一步,它在长篇故事中会迷失方向。如果它在早期犯了一个微小的错误,这个错误会随着它不断进行猜测而变得越来越大,就像滚下山坡的雪球一样。这被称为“曝光偏差”(exposure bias)。

为了解决这个问题,科学家们尝试教机器人向前看几步,或者去猜测接下来几个词的“氛围”(vibe),而不只是仅仅猜测下一个字母。但这些方法往往各有各的问题:它们要么看不够远,要么在试图规划太远的未来时会被自己的错误搞糊涂。大问题在于:我们能否教机器人同时在多个层面上理解故事的结构——比如既知道一个章节的情节,又知道下一句的内容——同时又不让机器人变得太慢或太复杂到难以使用?

这正是微软研究院(Microsoft Research)和德克萨斯大学奥斯汀分校的研究人员在他们的新论文《语言模型的层次化潜在预测》(Hierarchical Latent Prediction for Language Models)中所解决的问题。他们引入了一种聪明的新训练方法,叫做 HiLP(层次化潜在预测)。把机器人的大脑想象成有两个思考层。第一层是“街道视角”,专注于紧接着的下一个词,就像旧方法那样。第二层是“直升机视角”,它一次观察一组词,以理解更大的图景,比如一个段落或一个场景。

在实验中,研究人员教机器人将这种“直升机视角”作为一种秘密训练工具。他们创建了一个特殊的“抽象”层,将最后几个词总结为一个高层级的概念。然后,他们要求机器人预测这个高层级概念在未来几步之后会是什么样子。这迫使机器人学习故事应该如何在更长的距离内流动,而不仅仅是从一个词到下一个词。至关重要的一点是,这个“直升机视角”仅在训练期间使用。当机器人完成学习后,研究人员会丢弃这些额外的层。当机器人实际为你写故事时,它只使用简单的、快速的“街道视角”。这意味着机器人在不变得更慢或更臃肿的情况下,学会了更长期的规划。

结果表明,这种方法效果很好。当研究人员在编程任务和多步推理谜题上测试这个新机器人时,它的表现优于其他尝试“向前看”的方法。例如,在一个名为 HumanEval 的编程基准测试中,新方法取得了 11.33 的分数,击败了标准方法(得分为 8.77)以及最近的其他尝试,如 NextLat(得分为 10.58)。研究人员还发现,这种方法让“投机采样解码”(speculative decoding)变得更高效。这是一种机器人一次猜测多个词以提高速度的技术;有了 HiLP,机器人的猜测更加准确,意味着它在纠正自己方面浪费的时间更少。

该论文认为,虽然只看一步对于局部细节很有好处,但它无法捕捉语言的长期结构。通过在训练中加入这种层次化的“直升机视角”,机器人学会了将长期目标记在心中,从而减少了“雪球效应”式的错误。作者指出,这种方法提供了一种在不牺牲速度或复杂度的前提下,获得长程规划益处的方法,尽管他们也提到,他们使用的特定“前瞻”距离是一个手动设置,未来的工作可以使其更加灵活。最终,HiLP 表明,教语言模型在练习时既看“森林”又看“树木”,可以帮助它写出更好的故事,即使在表演时它只使用“树木”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →