← 最新论文
💬 NLP

Using Probabilistic Programs to Train Inductive Reasoning in Large Language Models

本文介绍了基于程序的后验训练(Program-based Posterior Training, PPT),这是一种利用概率程序生成多样化的开放世界场景和分布软标签的新型微调方法,从而显著增强了大语言模型进行不确定归纳推理的能力并使其与人类判断保持一致。

原作者: Liyi Zhang, Akshay K. Jagadish, Brenden M. Lake, Thomas L. Griffiths

发布于 2026-06-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Liyi Zhang, Akshay K. Jagadish, Brenden M. Lake, Thomas L. Griffiths

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一位非常聪明、博学多才的学生(一个大语言模型,或称 LLM)如何对现实世界进行推测。

目前,这些学生非常擅长演绎推理(Deductive Reasoning)。这就像解数学题或编写代码:有一套明确的规则,只要遵循规则,就能得到唯一的、100% 正确的答案。如果他们错了,那就是明显的错误。

然而,现实世界很少如此整洁。我们日常的大部分思考其实是归纳推理(Inductive Reasoning)。这就像是一名侦探,通过一些零散的线索来推断发生了什么。

  • 例子: 你看到一位朋友迟到了,看起来很疲惫,并且一直在看表。你猜测他睡过头了。但也许他是因为堵车?也许他是错过了公交车?这里并没有一个“正确”的答案;而是一个可能性的范围,每种可能性都有不同的发生概率。

问题在于,标准的训练方法很难处理这种情况。很难找到一个庞大的“侦探案例库”,其中的答案是由一位知道每个结果精确概率的老师来评分的。让其他 AI 模型来为这些案例评分是有风险的,因为它们可能会仅仅复制自身的偏见。

解决方案:“模拟游戏”(基于程序的后验训练)

这篇论文的作者想出了一个巧妙的方法来训练 AI 处理不确定性。他们称之为基于程序的后验训练(Program-based Posterior Training,简称 PPT)

你可以把它想象成一个三步走的视频游戏制作流水线:

  1. 故事讲述者(LL LLM): 首先,他们要求一个强大的 AI 发明许多荒诞、开放世界的场景。
    • 例子: “想象一场力量举锦标赛,运动员的表现取决于他们的先天力量、当天的专注度以及睡眠量。”
  2. 数学家(概率程序): 接着,他们要求 AI 将那个故事转化为一段严格的数学代码(一个“概率程序”)。这段代码充当了一个完美的模拟引擎。它不仅仅是在猜测,而是在根据故事中的规则计算出每种结果的精确数学概率。
    • 类比: 如果故事是一个食谱,那么这一步就是编写一段计算机程序,精确地模拟出蛋糕会如何升高、密度如何、以及根据配料有多大的概率被烧焦。
  3. 老师(训练数据): 最后,他们运行该模拟过程数千次。与其给学生一个单一的答案(例如“贾马尔会赢”),模拟器会给出一个答案的分布(例如“贾马尔有 60% 的概率获胜,30% 的概率平局,以及 10% 的概率失败”)。

随后,AI 学生就在这数百万个模拟场景中接受训练。它学习的不再是死记硬背一个“正确”答案,而是学习如何匹配由模拟器生成的概率云的形状

他们尝试之后的结果如何?

研究人员在几个挑战任务中测试了这个新的“学生”:

  • 更佳的预测能力: 当被要求预测从未见过的体育或医疗场景中的结果时,该 AI 做出了更准确的估计。它不仅仅是猜一个数字,它理解了该数字背后的不确定性
  • 像人类一样思考: 当他们将 AI 的猜测与人类的实际判断进行比较时,通过这种方法训练的 AI 与人类的思维方式契合得更好。它不再过度自信,而是开始表现得像一个谨慎的人类观察者。
  • 泛化能力: 即使在测试 AI 处理完全不同的主题(例如从体育转向医疗保健)时,它仍然表现出色。这表明它学习到的是一种通用的“处理不确定性”的技能,而不仅仅是死记硬背体育事实。
  • 校准度: 这个 AI 变得“经过校准了”。这意味着如果它说某事发生的概率是 70%,那么该情况实际上确实会在大约 70% 的时间里发生。论文指出,这种提升是深层的;它不仅仅是表面上的小技巧(比如事后调整旋钮),而是其表示不确定性的方式发生了根本性的变化。

核心结论

该论文认为,要让 AI 更好地进行现实世界推理,我们不应仅仅喂给它更多的事实。相反,我们应该教会它模拟世界。通过利用 AI 生成故事,将这些故事转化为严格的数学模拟,并利用这些模拟的结果来训练其他 AI,我们可以创造出更擅长处理现实生活中混乱、不确定且具有概率性质的模型。

他们并没有在这次特定的研究中测试医疗诊断或法律建议;他们专注于体育、通用场景和特定的基准测试,以证明这种方法是有效的。其核心观点是,概率程序充当了完美的老师,让 AI 能够学习处理不确定性的艺术。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →