← 最新论文
🤖 machine learning

LLM Priors for ERM over Programs

本文介绍了 \textsc{LLM-PV},这是一个利用预训练大语言模型先验知识,在无需穷举枚举或梯度更新的情况下,高效地在离散程序类上执行经验风险最小化的“提议与验证”框架,从而在传统方法失效的算法任务上实现鲁棒的泛化。

原作者: Shivam Singhal, Priyadarsi Mishra, Eran Malach, Tomer Galanti

发布于 2026-07-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Shivam Singhal, Priyadarsi Mishra, Eran Malach, Tomer Galanti

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大问题:大海捞针

想象一下,你正试图教会计算机一个秘密规则。这个规则很简单,比如:“如果数字能被 3 整除,就说‘是’;否则,说‘否’。”但计算机并不知道这个规则,它只看到了几个数字示例及其对应的答案。

在计算机科学领域,有两种主要方法来尝试寻找这个规则:

  1. “暴力破解”侦探: 这种方法试图把宇宙中所有可能的规则一个接一个地写下来,然后逐一检查是否符合示例。
    • 问题在于: 如果规则稍微复杂一点(比如规则的总数多到像地球上所有沙滩上的沙粒一样),这种方法可能需要比宇宙年龄还要长的时间才能完成。它太慢了。
  2. “梯度下降”学生: 这是现代 AI(比如你使用的聊天机器人)通常学习的方式。它从一个猜测开始,通过不断微调其内部的“旋钮”来做得更好,就像一个学生通过犯错并纠正错误来为考试做准备。
    • 问题在于: 对于某些类型的逻辑规则(比如检查一个数字是否为质数或统计特定模式),这种“微调”方法会陷入困境。它可能会完美地背下练习题,但在面对一个新的、略有不同的问题时却彻底失败。这就像是一个背下了答案但并没有真正理解数学原理的学生。

新方案:LLM-PV(聪明的图书管理员)

作者提出了第三种方法,叫做 LLM-PV。你可以把它想象成雇佣了一位聪明的图书管理员来帮你寻找规则。

以下是该过程的逐步运作方式:

  1. 提议(图书管理员的猜测): 你不是去检查图书馆里的每一本书(暴力破解),也不是试图从头重写整个图书馆(梯度下降),而是向这位聪明的图书管理员(一个预训练的大型语言模型)寻求几个建议。

    • 神奇之处: 这位图书管理员读过数百万本书籍和代码片段。当你展示给它一些示例时,它并不会随机猜测。它利用自己的“直觉”(先验知识)来建议几个可能有效的、合理的规则。它将搜索范围从“所有可能的规则”缩小到了“少数几个可能的候选者”。
  2. 验证(试驾): 图书管理员将这些规则写成实际的计算机代码。然后,你运行这些代码片段来检查它们是否符合你的示例。

    • 关键点: 图书管理员不允许根据测试结果改变主意。它只负责提出建议。最终胜出者的筛选过程完全是通过严格检查代码与数据的匹配程度来完成的。
  3. 选择(优胜者): 你挑选出那个能得出最多正确答案的代码片段。

为什么这很重要

论文表明,这种“聪明的图书管理员”方法效率极高。

  • 它很快: 它不需要检查数十亿条规则,只需要检查少数几个聪明的猜测。
  • 它很准确: 与那些在逻辑谜题上经常失败的“微调型”AI 方法不同,这种方法实际上能找到确切的数学规则(例如用于检查质数的 Miller-Rabin 素性检验)。
  • 它具有泛化能力: 这是最令人印象深刻的部分。如果你用短数字(例如 10 位数)来教这个系统,它学到的是规则,而不只是数字本身。因此,当你要求它检查一个 100 位的数字时,它依然能完美运行。而“微调型”AI 通常会在这里失败,被更长的数字搞糊涂。

一个现实世界的类比:学习烘焙

想象一下,你想学习制作蛋糕的秘密配方。

  • 暴力破解: 你尝试用每一种可能的食材组合(盐、糖、沙子、石头等)来烤蛋糕,直到其中一个味道对了为止。这要花上一辈子的时间。
  • 梯度下降(标准 AI): 你烤了一个蛋糕,尝了一下,说:“缺点糖。”你又烤了一次,“少点面粉。”你不断重复。最终,你可能做出一个味道和你要模仿的那款极其相似的蛋糕,但如果你改变了烤箱温度或面粉品牌,你的蛋糕就会垮掉,因为你只是学会了模仿那一次特定的批次,而不是学会了烘焙的原理
  • LLM-PV: 你请教了一位看过无数食谱的大厨(LLM)。你给了他们一些关于这款蛋糕的线索。大厨说:“我猜这是一款带有特定香料组合的巧克力蛋糕。”他们写下了三份具体的配方。你烤了这三份。其中一份非常完美。你既不需要烤一百万个蛋糕,也不需要无休止地微调配方。你得到了适用于任何烤箱的实际配方

核心结论

论文认为,我们不应该仅仅使用 AI 来直接预测答案,而应该将 AI 作为一种搜索工具,用来生成潜在的解决方案(程序),然后通过严格的测试来挑选出最好的一个。这结合了大型语言模型的“常识”与计算机程序的可靠性,使我们能够通过极少的示例学习复杂的规则。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →