← 最新论文
🤖 machine learning

Uncovering Latent Reasoning Strategies in Language Models

本文提出了一种变分推理框架,将预训练语言模型的响应分布分解为路由(router)和生成器(generator),以揭示潜在的推理策略,并通过优先考虑具有高基座模型惊异度(surprisal)的标记,从而克服后验崩溃问题,确保潜在编码能够捕捉到与策略相关的变化。

原作者: Awni Altabaa, John Lafferty

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Awni Altabaa, John Lafferty

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正走进一座宏伟而繁忙的图书馆,这里的书不仅仅是故事,而是人类知识与逻辑的总和。在这座图书馆里住着一位非常聪明、反应极快的图书管理员,名叫“语言模型”。这位管理员读遍了一切,可以回答你提出的任何问题,从“如何烤蛋糕?”到“证明这个数学定理”。但问题在于,这位图书管理员并没有一个单一、清晰的思维过程。当你提出一个问题时,管理员的大脑就像是一个同时思考着解决该问题的多种不同方式的混合体。它可能同时在思考通过画图来解决数学题、使用公式,或者通过试错法来解决问题。最终的答案是正确的,但所经过的路径却是一个纠缠在一起的可能性之结。

科学家们长期以来一直想要解开这个结。他们想知道:“这位图书管理员具体走了哪条路径?”以及“我们下次能否要求这位图书管理员走一条不同的路径?”这就是潜变量(影响结果的隐藏因素)与推理策略(用于解决问题的逐步计划)的世界。通常,当科学家试图寻找这些隐藏路径时,他们会使用一种叫做变分推理的方法,这就像是通过品尝最终的菜肴来猜测图书管理员的秘密食谱。问题在于,这位图书管理员厨艺太好了,以至于无论你猜哪种秘密食谱,菜肴的味道都完美无缺。所以,那个猜测机器放弃了,说:“我不需要猜食谱,菜肴已经很完美了,”然后完全停止了对隐藏路径的寻找。这是一个令人沮丧的死胡同,原本用来寻找秘密的工具反而忽略了秘密本身。

这篇题为《揭示语言模型中的潜在推理策略》(Uncovering Latent Reasoning Strategies in Language Models)的论文,正是针对这一确切的死胡同展开研究的。作者——来自耶鲁大学的 Awni Altabaa 和 John Lafferty——意识到,标准的方法之所以失败,是因为模型表现得太出色了。他们提出了一个巧妙的新技巧:与其仅仅要求模型“做出一道完美的菜”,不如要求它解释那道菜中难做的部分。

你可以这样理解:如果你请一位名厨解释他是如何做出完美蛋糕的,他可能会只说:“我遵循了食谱。”但如果你请他解释在决定加入额外的香草而不是柠檬的具体时刻,或者为什么要用某种特定的方式搅拌面糊,他就必须深入挖掘。作者创建了一种新的训练方法,充当一名好奇的美食评论家。他们告诉模型:“你已经知道如何完美地制作蛋糕了。但我希望你使用你的隐藏‘策略开关’,来解释那些食谱并不直观的具体时刻——即你必须做出真实抉择的时刻。”

通过专注于答案中的“难点部分”(即模型最不确定或存在多种可能路径的时刻),这种新方法迫使隐藏的“策略开关”真正发挥作用。结果呢?模型成功学会了将它的思维分离成截然不同的、可用的路径。例如,当被要求证明一个数学定理时,现在可以告诉模型:“使用‘反证法’开关”,它就会一致地选择那条特定的逻辑路径,而不是将其与其他方法混杂在一起。

研究人员在一些算法谜题(如对数字列表进行排序或求解方程)上测试了该方法,在这些谜题中,他们明确知道存在哪些不同的策略。他们发现,这种新方法成功地揭示了这些隐藏策略,并在不同的问题中保持了它们的一致性。相比之下,旧的标准方法失败了,使得“策略开关”变得毫无用处,思维过程依然纠缠不清。虽然这项工作目前集中在合成的数学和逻辑谜题上,但它暗示了一种强大的新方法,可以让我们窥视 AI 的“黑箱”,从而有可能让我们控制 AI 是如何思考的,而不只是它说了什么。它将一团乱麻般的可能性变成了一份清晰的选择菜单,让我们能够更好地掌控这些数字大脑的推理能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →