← 最新论文
🤖 machine learning

Accuracy, Stability, and Repeated-Run Reliability of Large Language Models on Deterministic Programming Tasks

本文表明,标准的运行级准确率指标通过忽略单次运行成功与持续无需重试的性能之间存在的巨大差距(特别是对于中端模型而言),显著夸大了大型语言模型在确定性编程任务上的可靠性,从而确立了进行重复运行稳定性分析以实现准确评估的必要性。

原作者: Yongxi Zhou, Lai Yun Choi, Jiaxi Wen, Wenbo Ye

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Yongxi Zhou, Lai Yun Choi, Jiaxi Wen, Wenbo Ye

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你雇佣了一支厨师团队,根据你提供的食谱来烹饪一道特定的菜肴。你要求每位厨师连续尝试烹饪这道菜五次,并使用完全相同的食材和指令。

大多数人看到结果后会说:“哇,厨师 A 五次里对了四次!那是 80% 的成功率。他们很棒。”

但这篇文章提出了一个更实际的问题:“如果我现在要求厨师 A 烹饪这道菜,我能否信任他每次都能做得完美?还是说我必须不断要求他重试,直到他做对为止?”

研究人员发现,衡量成功的标准方式(即“80% 的成功率”)经常在欺骗我们。它让这些厨师看起来比实际情况更可靠。

以下是他们研究结果的拆解,使用了简单的类比:

1. “平均水平” vs. “完美连胜”

论文引入了两种衡量厨师(或 AI 模型)的方法:

  • 运行级通过率(平均水平): 这就像是在统计厨房里总共出了多少份完美的菜肴。如果一名厨师做了 100 盘菜,其中 80 盘是完美的,那么他的得分就是 80%。这是大多数人观察的方式。
  • 完美稳定性率(“无需重试”得分): 这在问:“有多少个‘订单’是厨师在第一次尝试时就做对了,且从未出错?”

重大发现: “平均水平”得分几乎总是高于“无需重试”得分。

  • 类比: 想象一位厨师通过抛硬币来决定是否加盐。
    • 场景 A: 他有 50% 的时间能把菜做得对,但当他做错时,他会错得非常离谱。他表现得不稳定。
    • 场景 B: 他也有 50% 的时间能把菜做得对,但他要么始终完美,要么始终糟糕。
    • 论文发现,对于“中等水平”的厨师(那些表现不错但并非完美的厨师),他们的“平均水平”得分与“无需重试”得分之间的差距巨大。一个模型在平均意义上可能准确率高达 86%,但如果你需要它在不进行第二次尝试的情况下完美运行,它的可靠性实际上只有 75%。这是一个 17.8% 的差距——这是一个足以改变你是否会雇佣他们的巨大差异。

2. “中等区间”陷阱

研究人员发现,最大的谎言发生在那些“中规中矩”的模型身上。

  • 顶尖模型非常优秀,很少犯错,因此它们的“平均水平”和“稳定性”得分很接近。
  • 底层模型表现很差,几乎总是失败,因此它们的得分也趋于一致(都很低)。
  • 中等模型: 这些是最棘手的。它们成功的频率足以让它们看起来不错,但失败的频率又足以让人感到恼火。因为它们处于“门槛”之上,所以它们的结果波动剧烈。论文发现,对于这些模型,其“平均水平”得分夸大了其可靠性,夸大程度接近 18 个百分点。

3. “提示词”(食谱卡)

团队测试了提供一份更详细的食谱卡(“详细提示词”)对比一份简短的食谱卡(“极简提示词”)是否能让厨师更具一致性。

  • 结果: 这完全取决于厨师。
  • 对于某些模型,详细的食谱有所帮助。对于另一些模型,简短的食谱反而更好。对于某些模型,则完全没有影响。
  • 教训: 没有一种“万能提示词”可以解决所有问题。你不能仅仅给一个中等水平的模型一个更好的指令,就指望它突然变得完美稳定。

4. “思考型”模型(推理型 vs. 标准型)

一些现代厨师被训练在烹饪前先进行“逐步思考”(推理模型)。研究人员想知道这种“思考”是否会让它们更具一致性。

  • 结果: 不一定。
  • 虽然一些“思考型”模型表现出惊人的稳定性,但另一些模型的稳定性甚至比它们的非思考型对手还要差。仅仅是“思考”这一行为并不保证能获得完美的连胜。事实上,对于某些模型来说,额外的思考步骤反而引入了更多出错的机会。

5. 为什么这很重要

该论文认为,我们应该停止仅仅关注“平均”得分。

  • 现实世界: 如果你正在构建一个需要自动运行的软件系统(如自动驾驶汽车或银行脚本),你不需要一个“大部分时间”都能工作的系统。你需要的是一个每一次都能工作,且不需要你按下“重试”按钮的系统。
  • 结论: 要了解一个 AI 是否真正准备好进入现实世界,你必须对其进行反复测试。你不仅需要知道它是否能解决问题,还需要知道它在第一次尝试时解决问题的可靠程度如何。

简而言之: 测试中的高分并不意味着学生具备一致性。这篇论文向我们展示了如何衡量“最终做对”与“每次都做对”之间的区别。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →