← 最新论文
🤖 machine learning

Amortizing intractable inference in large language models

本文提出利用 GFlowNets 来摊销大型语言模型中难以处理的推理过程,使其能够针对约束生成和思维链推理等任务从复杂的后验分布中进行采样,作为一种相对于传统的最大似然或奖励最大化训练的高效数据替代方案。

原作者: Edward J. Hu, Moksh Jain, Eric Elmoznino, Younesse Kaddar, Guillaume Lajoie, Yoshua Bengio, Esmeralda S. Whitammer

发布于 2026-09-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Edward J. Hu, Moksh Jain, Eric Elmoznino, Younesse Kaddar, Guillaume Lajoie, Yoshua Bengio, Esmeralda S. Whitammer

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大语言模型是人类知识的庞大图书馆,被压缩进数字网络中,根据前文来预测句子中的下一个词。它们被训练成擅长在给定起点时延续故事或回答问题,这一过程自然地从左向右流动。然而,我们希望这些模型执行的许多最有趣的任务,却需要进行逆向思考或填充故事的中段。想象一下,如果给你一个故事的开头和结尾,并要求你构思中间的内容,或者要求你解释某个特定答案背后的推理过程。在这些场景中,模型不能仅仅靠猜测下一个词;它必须在极其庞大且复杂的可能性景观中进行搜索,以找到连接起点与终点的特定路径。这是一个困难的数学问题,因为可能的路径数量如此之巨,以至于逐一检查是不可能的,而且导航该景观的标准方法往往会卡在仅有的一个或两个常见路径上,从而错失了存在的丰富且有效的解集。

来自 Mila – 魁北克人工智能研究所和牛津大学的研究人员开发了一种新方法,教导这些模型如何导航那片复杂的景观。他们没有将模型训练为仅仅最大化某个“最佳”答案的分数(这往往会导致重复且狭隘的思维),而是使用了一种称为“摊销推理”(amortized inference)的方法。这种方法将问题视为寻找一组多样化的正确路径,而非寻找单一的完美路径。为此,他们采用了被称为“生成流网络”(generative flow network)的技术,它就像一个向导,学习从整个可能的解空间中进行采样,确保模型探索不同的有效推理链,而不是坍缩到单一、过度使用的模式中。

团队通过微调大语言模型来解决需要多步推理的问题,例如算术计算或判断电影评论表达的是观点还是事实,以此证明了这一方法的有效性。在一项实验中,他们要求模型在给定开头和结尾的情况下,填补短篇故事中缺失的中间句子。标准方法生成的句子虽然语法正确,但并不符合叙事流。然而,新方法成功生成了能够连贯衔接开头与结尾的中间句子,展现出更强的理解全文语境的能力。在另一项涉及简单数学问题的测试中,模型配备了一个计算器工具,并被要求将计算分解为若干步骤。其他训练方法常导致模型重复数字或无法正确使用工具,而新方法则教会了模型仔细规划步骤,从而显著提高了准确率,尤其是在处理从未见过的题目时。

结果表明,这种方法在数据稀缺时表现得尤为强大。在一项仅有十个电影评论样本用于学习的测试中,新方法实现的准确率显著高于标准训练技术,并且即使在拥有五十个样本时也持续保持领先。研究人员发现,通过鼓励模型采样广泛的推理路径并随后结合它们的结论,系统变得更加稳健和可靠。这是一个至关重要的区别,因为这意味着模型不仅仅是在记忆解决问题的单一方式,而是在学习如何思考其底层结构的逻辑。研究表明,通过将目标从寻找单个最可能的答案转向探索完整且多样化的正确答案,我们可以使这些强大的工具变得更加灵活,并更好地胜任复杂的推理任务。

这项工作还强调了当前模型训练中的一个局限性。当模型被迫去最大化奖励时,它们往往会寻找捷径,例如重复同一个短语或忽略问题的实际逻辑,仅仅为了获得高分。研究人员展示了他们的方法是如何避免这一陷阱的——通过匹配所有可能解的完整分布,确保模型不会坍缩到单一且有缺陷的思维模式中。这种方法使模型能够更好地泛化到新情境中,例如解决比训练时数字更多的算术问题,而其他方法在这些情况下都会失败。这些发现为使人工智能实现真正的推理能力提供了一条充满前景的路径,使其超越简单的模式匹配,向着更细致地理解如何构建论点并逐步解决问题迈进。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →