← 最新论文
🤖 machine learning

PPDL: LLM-Based Flows as Probabilistic Programs

本文介绍了 PPDL,这是一种概率编程语言,它使开发者能够在基于 LLM 的应用流程中量化并传播不确定性,并在无需修改核心逻辑的情况下实验推理缩放技术,这一点已通过一个针对 Rocq 证明器的定理证明智能体得到了验证。

原作者: Louis Mandel, Guillaume Baudart, Mandana Vaziri, Martin Hirzel

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Louis Mandel, Guillaume Baudart, Mandana Vaziri, Martin Hirzel

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图解决一个非常棘手的谜题,但你并不是独自一人,而是有一个聪明又富有创造力的朋友在和你交流。这个朋友是一个被称为“大语言模型”(LLM)的人工智能。他们擅长写故事、解数学题,甚至编写计算机代码。然而,他们并不完美。有时,他们会对错误的答案表现得过于自信,或者可能会编造一些听起来很真实但实际上并不存在的事实。这就是所谓的“不确定性”。

想象一下,你需要解决一个需要很多步骤的极其困难的问题。你先请你的 AI 朋友制定一个计划,然后请他们根据这个计划编写代码,接着请他们检查代码,以此类推。每当你问一个问题时,AI 都会给出一个答案,但这个答案可能是有些摇摆不定的。如果你将十个这样的摇摆不定的答案串联在一起,最终的结果可能会变成一团糟。这就像是在搭建一座由叠叠乐(Jenga)积木组成的塔,每一块积木都略微晃动;随着高度增加,整个塔倒塌的可能性就越大。开发者和用户经常会感到迷茫:“这个答案是对的吗?我们有多确定?我应该信任它吗?”

为了解决这个问题,科学家们尝试了一些技巧。一个流行的想法是“推理缩放”(inference scaling)。这可以理解为让你的 AI 朋友把同一个谜题尝试做十遍,看看哪个答案出现的次数最多。这就像是问一群朋友一个谜语的答案,然后根据多数人的投票来决定。但问题在于,这样做手动操作起来非常麻烦。你必须编写专门的计算机代码来运行那十次尝试,记录哪些看起来不错,并丢弃那些不好的结果。这就像是你每次只想烤一批饼干以确保味道正确时,都必须先建造一座新的工厂。这既复杂又昂贵,而且如果你想尝试不同的烘焙方式,调整起来也非常困难。

论文的核心思想: “神奇记分卡”

这篇论文介绍了一个名为 PPDL(概率提示词声明语言)的新工具。你可以将 PPDL 理解为 AI 工作流中的一个特殊的“神奇记分卡”。通过 PPDL,你不再只是向 AI 提问并得到一个单一答案,而是可以让你的程序天生就能理解 AI 可能存在的不确定性。

它是这样运作的:

  1. 流程: 你像平时一样编写给 AI 的指令(例如:“规划代码”,然后“编写代码”,最后“检查代码”)。
  2. 神奇因子: 你添加一个特殊的指令,叫做 factor(因子)。这就像是一个记分卡,你告诉 AI:“嘿,如果这个计划听起来逻辑通顺,就给高分;如果代码有错误,就给低分。”
  3. 结果: 当你运行程序时,计算机不仅仅给出你一个答案。它会并行地运行整个过程(就像有一百个不同版本的你在同时尝试解开这个谜题)。它会利用你的“记分卡”来权衡结果。如果某条路径看起来非常有希望,计算机就会把更多精力集中在那条路径上。如果某条路径看起来很糟糕,它就会放弃该路径。

最酷的部分在于,你不需要自己编写复杂的“运行十次”的代码。PPDL 会在后台处理所有这些繁重的任务。你只需要编写一次逻辑,系统就会自动找出探索所有可能性的最佳方式。

他们的发现

作者在多个挑战领域测试了这个想法,从解决小学数学题到编写复杂的计算机代码,甚至证明数学定理。

  • 更高的准确度: 在测试中,使用带有这些“记分卡”的 PPDL 使 AI 的准确率显著提高。例如,在名为 GSM8k 的数学测试中,标准 AI 的正确率约为 83.8%。但当他们使用 PPDL 结合“重要性采样”(Importance Sampling,这是一种聪明地挑选最佳猜测的方法)时,准确率跃升至 93.7%。
  • “聪明”的方法胜出: 他们对比了使用记分卡的几种不同方式。有时,仅仅采取“多数票”(最常见的答案)效果很好。但通常情况下,更聪明的方法(如重要性采样和顺序蒙特卡洛法)表现得更好。这些方法就像是一位侦探,他不只是在数票数,而是实际上在调查一个答案为什么好或为什么坏,从而及早丢弃错误的路径,并将精力集中在正确的路径上。
  • 定理证明器案例研究: 为了对系统进行压力测试,他们构建了一个使用 Rocq 工具来证明数学定理的 AI 智能体。这是一个非常困难的任务,AI 必须编写证明,检查是否出错,并反复进行修正。他们发现,“聪明”的方法(顺序蒙特卡洛法)比单纯不断进行随机猜测能更好地找到正确的证明。它能够同时探索许多不同的路径,并迅速放弃那些走投无路的路径。

他们并未声称的内容

作者很谨慎,并没有说这是一个解决所有问题的“万灵药”。他们指出,这些“记分卡”(因子)的质量取决于你输入的信息。如果你的记分卡不好,系统也不会奇迹般地修复它。此外,虽然这种方法让 AI 变得更加可靠,但这并不意味着 AI 突然变得完美了;它只是意味着我们有了一种更好的方法来衡量我们对答案的确定程度。

为什么这很重要

这篇论文表明,通过将 AI 工作流视为“概率程序”(即理解不确定性的程序),我们可以让 AI 应用变得更加可靠,而不会使其构建过程变得异常复杂。这就像是为开发者提供了一套新工具,让他们能够自动处理“一遍又一遍尝试”这类琐碎且混乱的工作,从而让他们能够专注于构建酷炫的事物,而由计算机来计算出获得正确答案的最佳路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →