← 最新论文
💻 computer science

Predicting Performance of Symbolic and Prompt Programs with Examples

本文提出了 RAP,这是一个性能预测框架,它利用检索到的相似任务和提示程序来构建近似先验,通过区分大语言模型提示的弥散性能分布与符号程序的“全有或全无”特性,有效解决了大语言模型提示不可靠的问题。

原作者: Chengqi Zheng, Keya Hu, Shuzhi Liu, Tao Wu, Kevin Ellis, Yewen Pu

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Chengqi Zheng, Keya Hu, Shuzhi Liu, Tao Wu, Kevin Ellis, Yewen Pu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位招聘经理,正在决定是否让一名新员工胜任一项重要工作。你有两类候选人:“机器人”(一种符号程序,例如 Python 代码)和**“创意自由职业者”**(一种提示程序,即给 AI 下达的、用于执行某项任务的指令)。

这篇论文提出了一个简单的问题:如果两位候选人都通过了几项小型练习测试,我们能否信任他们胜任实际工作?

作者的回答是:对于“机器人”可以,但对于“自由职业者”则未必。 以下是原因,完全基于论文自身的逻辑和类比。

1. 两种“程序”

  • “机器人”(符号程序): 这就像一台严格的计算器。如果你告诉它"2 + 2",它必须回答"4"。它遵循僵化的规则。如果它通过了测试,那是因为它完美地遵循了规则。
  • “自由职业者”(提示程序): 这就像请一位聪明但略显不可预测的艺术家去“画一只猫”。你给艺术家一个提示(指令)。艺术家可能画出一只很棒的猫、一只奇怪的猫,或者一只狗。即使他们通过了几项练习测试,也可能只是运气好,或者这些指令在现实世界中略有偏差。

2. “抛硬币”模型

作者设想,每次程序运行测试时,都像是在抛硬币。

  • 正面: 程序答对了。
  • 反面: 程序答错了。

目标是推测这枚硬币的“权重”如何。它是一枚公平硬币(50/50)?还是一枚总是正面朝上的“作弊”硬币(100% 成功)?

3. 重大发现:过去的“形状”

在查看测试结果之前,作者先考察了成千上万个此类程序的历史,以观察它们的“硬币权重”通常呈现何种形态。他们发现了两种截然不同的形状:

  • “机器人”的历史(非此即彼):
    想象所有“机器人”程序的一个直方图。它在两端呈现出两个高耸的尖峰。

    • 尖峰 1: 大多数“机器人”是完美的(100% 成功)。
    • 尖峰 2: 大多数“机器人”是失效的(0% 成功)。
    • 中间地带: 几乎什么都没有。“机器人”很少表现得“还可以”。它们要么完美,要么彻底失败。
    • 类比: 这就像电灯开关。它要么开,要么关。
  • “自由职业者”的历史(弥散的云团):
    想象所有“自由职业者”程序的一个直方图。它在中间呈现出一大片宽阔、平坦的云团。

    • 有许多程序是“接近正确”的(70%、80%、90%)。
    • 完全完美的极少,彻底失败的也极少。
    • 类比: 这就像调光开关。大多数“自由职业者”都处于中间状态,亮度各不相同。

4. 为什么少数测试会误导你

这种差异解释了为什么少数几次通过测试对于“自由职业者”具有误导性,而对于“机器人”则令人放心。

  • 对于“机器人”: 如果你看到它通过了 3 次测试,你就知道它很可能属于那些“完美”的尖峰之一。因为“中间地带”(即它可能只是“还可以”的区域)并不存在,所以通过几次测试就是它将持续工作的有力保证。
  • 对于“自由职业者”: 如果你看到它通过了 3 次测试,它可能只是那些“接近正确”的程序中运气好的一次。因为存在大量“接近正确”的程序云团,通过几次测试并不能证明它将来会完美。它很容易在下一个测试中失败。

5. 解决方案:RAP(“相似度搜索”工具)

既然我们不能仅凭少数几次测试就信任“自由职业者”,作者便构建了一个名为RAP(检索近似先验,Retrieved Approximate Prior)的工具。

把 RAP 想象成一位聪明的图书管理员

  1. 问题: 你有一个新的“自由职业者”提示和几次测试结果。你不知道它是否可靠。
  2. 图书馆: RAP 拥有一个庞大的图书馆,里面存储着以前尝试过的其他提示和任务。
  3. 搜索: RAP 查看你的新提示,问道:“图书馆里谁与你最相似?”它找到了其他解决了类似问题的提示。
  4. 预测: RAP 不是基于通用规则进行猜测,而是查看那些相似的提示在过往的表现。它为你的提示构建了一个定制的“猜测地图”(先验)。
  5. 更新: 随着你运行更多测试,RAP 会更新它的猜测。

结果: 与仅凭猜测或一次性查看整个图书馆相比,RAP 在预测“自由职业者”是否会成功方面要出色得多。它能适应你正在执行的具体任务类型。

总结

  • “机器人”(代码)是二元的: 它们要么完美,要么失效。少数几次测试就能证明它们是完美的。
  • “自由职业者”(提示)是可变动的: 它们通常只是“接近好”。少数几次测试并不能证明它们是可靠的。
  • RAP 通过查看相似的过往案例来做出更明智的猜测,从而解决了这一问题,评估新提示的效果,而不是仅仅依赖几次幸运的测试运行。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →