✨ 要点🔬 技术摘要
想象一下,你雇佣了一支厨师团队,根据你提供的食谱来烹饪一道特定的菜肴。你要求每位厨师连续尝试烹饪这道菜五次,并使用完全相同的食材和指令。
大多数人看到结果后会说:“哇,厨师 A 五次里对了四次!那是 80% 的成功率。他们很棒。”
但这篇文章提出了一个更实际的问题:“如果我现在要求厨师 A 烹饪这道菜,我能否信任他每次都能做得完美?还是说我必须不断要求他重试,直到他做对为止?”
研究人员发现,衡量成功的标准方式(即“80% 的成功率”)经常在欺骗我们。它让这些厨师看起来比实际情况更可靠。
以下是他们研究结果的拆解,使用了简单的类比:
1. “平均水平” vs. “完美连胜”
论文引入了两种衡量厨师(或 AI 模型)的方法:
运行级通过率(平均水平): 这就像是在统计厨房里总共出了多少份完美的菜肴。如果一名厨师做了 100 盘菜,其中 80 盘是完美的,那么他的得分就是 80%。这是大多数人观察的方式。
完美稳定性率(“无需重试”得分): 这在问:“有多少个‘订单’是厨师在第一次尝试时就做对了,且从未出错?”
重大发现: “平均水平”得分几乎总是高于“无需重试”得分。
类比: 想象一位厨师通过抛硬币来决定是否加盐。
场景 A: 他有 50% 的时间能把菜做得对,但当他做错时,他会错得非常离谱。他表现得不稳定。
场景 B: 他也有 50% 的时间能把菜做得对,但他要么始终完美,要么始终糟糕。
论文发现,对于“中等水平”的厨师(那些表现不错但并非完美的厨师),他们的“平均水平”得分与“无需重试”得分之间的差距巨大。一个模型在平均意义上可能准确率高达 86%,但如果你需要它在不进行第二次尝试的情况下完美运行,它的可靠性实际上只有 75%。这是一个 17.8% 的差距——这是一个足以改变你是否会雇佣他们的巨大差异。
2. “中等区间”陷阱
研究人员发现,最大的谎言发生在那些“中规中矩”的模型身上。
顶尖模型 非常优秀,很少犯错,因此它们的“平均水平”和“稳定性”得分很接近。
底层模型 表现很差,几乎总是失败,因此它们的得分也趋于一致(都很低)。
中等模型: 这些是最棘手的。它们成功的频率足以让它们看起来不错,但失败的频率又足以让人感到恼火。因为它们处于“门槛”之上,所以它们的结果波动剧烈。论文发现,对于这些模型,其“平均水平”得分夸大了其可靠性,夸大程度接近 18 个百分点。
3. “提示词”(食谱卡)
团队测试了提供一份更详细的食谱卡(“详细提示词”)对比一份简短的食谱卡(“极简提示词”)是否能让厨师更具一致性。
结果: 这完全取决于厨师。
对于某些模型,详细的食谱有所帮助。对于另一些模型,简短的食谱反而更好。对于某些模型,则完全没有影响。
教训: 没有一种“万能提示词”可以解决所有问题。你不能仅仅给一个中等水平的模型一个更好的指令,就指望它突然变得完美稳定。
4. “思考型”模型(推理型 vs. 标准型)
一些现代厨师被训练在烹饪前先进行“逐步思考”(推理模型)。研究人员想知道这种“思考”是否会让它们更具一致性。
结果: 不一定。
虽然一些“思考型”模型表现出惊人的稳定性,但另一些模型的稳定性甚至比它们的非思考型对手还要差。仅仅是“思考”这一行为并不保证能获得完美的连胜。事实上,对于某些模型来说,额外的思考步骤反而引入了更多出错的机会。
5. 为什么这很重要
该论文认为,我们应该停止仅仅关注“平均”得分。
现实世界: 如果你正在构建一个需要自动运行的软件系统(如自动驾驶汽车或银行脚本),你不需要一个“大部分时间”都能工作的系统。你需要的是一个每一次 都能工作,且不需要你按下“重试”按钮的系统。
结论: 要了解一个 AI 是否真正准备好进入现实世界,你必须对其进行反复测试。你不仅需要知道它是否 能解决问题,还需要知道它在第一次尝试时解决问题的可靠程度 如何。
简而言之: 测试中的高分并不意味着学生具备一致性。这篇论文向我们展示了如何衡量“最终做对”与“每次都做对”之间的区别。
技术摘要:大型语言模型在确定性编程任务中的准确性、稳定性与重复运行可靠性
问题陈述
大型语言模型(LLMs)正越来越多地被部署于具有确定性规范的文本条件任务中,例如程序合成,其正确性是二元的,并由可执行的测试套件进行验证。传统的评估基准(如 HumanEval、MBPP)通常报告单次运行准确率或“最终成功”指标(如 pass@k),这些指标衡量的是模型在 k k k 次尝试中至少产生一个正确解的能力。
然而,许多实际的部署场景要求稳定性 :即模型在相同任务描述下,通过重复调用产生一致且正确结果的能力。虽然近期的研究将重复采样视为一种推理时计算的形式,但正确性与稳定性之间的系统性关系——特别是模型的平均运行成功率与其无需重试的可靠性之间的差距——仍有待深入探索。本文旨在探讨一个问题:观察到的准确率能在多大程度上转化为可靠的、无需重试的行为,特别是对于波动性最高的性能中等水平的系统。
研究方法
实验设置
本研究使用了一个精选的100 个确定性编程问题 (LeetCode 风格)数据集,基于问题的时效性进行筛选,以最大限度地减少来自历史训练数据的污染。该数据集包括 20 个简单题、50 个中等题和 30 个困难题,涵盖了各种算法主题。所有问题均为自包含,无需外部网络访问,并通过固定的、确定性的测试框架进行评分。
模型与配置
评估涵盖了来自五个供应商家族(OpenAI、Anthropic、Google、Qwen、DeepSeek)的 16 个模型 ,包括标准架构和推理专用架构(如 o4-mini、DeepSeek-R1)。
协议: 每个模型在两种提示词模板(DETAILED 和 MINIMAL )下进行评估,每个问题进行 5 次重复运行 (R = 5 R=5 R = 5 )。
参数: 大多数模型使用 T = 0.3 T=0.3 T = 0.3 和 t o p _ p = 0.9 top\_p=0.9 t o p _ p = 0.9 ,以模拟现实中的随机解码。推理专用模型和特定的 API 限制(如 o4-mini)涉及调整后的 Token 预算或固定的内部解码机制。
总实例数: 实验共产生了 16,000 个评估实例。
指标
本文引入了一种重复运行评估协议,包含三个主要指标:
运行级通过率 (Run-Level Pass Rate, RLPR): 单次随机调用的成功概率。R L P R = 1 N R ∑ i = 1 N ∑ r = 1 R Y i , r RLPR = \frac{1}{NR} \sum_{i=1}^{N} \sum_{r=1}^{R} Y_{i,r} R L P R = N R 1 i = 1 ∑ N r = 1 ∑ R Y i , r
完美稳定性率 (Perfect Stability Rate, PSR): 系统在所有 R R R 次运行中均成功(无需重试)的任务比例。P S R = 1 N ∑ i = 1 N I ( ∑ r = 1 R Y i , r = R ) PSR = \frac{1}{N} \sum_{i=1}^{N} \mathbb{I}\left(\sum_{r=1}^{R} Y_{i,r} = R\right) P S R = N 1 i = 1 ∑ N I ( r = 1 ∑ R Y i , r = R ) 注:PSR 在数学上等同于 k = R k=R k = R 时且以“全成功”为阈值的 pass@k,但此处将其解释为部署可靠性指标,而非能力测量指标。
平均方差 (Average Variance, AV): 一种衡量每项任务不稳定性的指标,捕捉了跨任务成功概率的变化。
关键结果
准确性–稳定性差距
研究发现 RLPR 与 PSR 之间存在强相关性 (r = 0.985 r = 0.985 r = 0.985 ),但 RLPR 始终高估了生产环境的可靠性 。
差距幅度: Δ = R L P R − P S R \Delta = RLPR - PSR Δ = R L P R − P S R 的差异在不同模型间表现不一,最大值达到 17.8 个百分点 (在 DETAILED 提示词下的 Gemini 2.5 Flash 中观察到)。
中等准确率峰值: 差距在性能中等的系统中最显著。具有中间成功概率的模型表现出最高的方差(伯努利方差在 p ≈ 0.5 p \approx 0.5 p ≈ 0.5 时达到最大),导致平均成功率与完美稳定性之间存在显著差异。
排名逆转: RLPR 和 PSR 可能导致不同的模型排名。例如,GPT-4.1 在 RLPR 上优于 GPT-4.1-mini(59.6% vs. 58.4%),但在 PSR 上落后(47.5% vs. 50.0%),这是由于前者具有更大的准确性–稳定性差距所致。
问题层面的变异性
两极分化 vs. 不稳定性: 模型如 Qwen-Turbo 具有较低的 AV,因为其结果是两极分化的(要么全部通过,要么全部失败),因此尽管整体准确率较低,但差距很小。相反,Gemini 2.5 Flash 等模型显示出高 AV,表明存在显著的尝试间变异性。
失效模式: 主要失效模式是“答案错误”(58%),其次是“超出时间限制”(27%)。不稳定不仅与算法的不一致性有关,还与实现的脆弱性(超时/运行时错误)有关,且这种现象随问题难度增加而加剧。
提示词敏感度与架构
提示词效应: 提示词敏感度是取决于模型的,而非统一的。虽然大多数模型在 DETAILED 和 MINIMAL 提示词之间的差异较小(<3 pp),但某些模型(如 Claude Sonnet 4.5)出现了逆转。没有单一的模板能表现出绝对优势,且鉴于样本量,提示词效应的统计显著性普遍较低。
推理架构: 研究调查了推理专用模型(如思维链/Chain-of-Thought)是否表现出系统性更小的准确性–稳定性差距。结果具有异质性:DeepSeek-R1 显示出优于预期的稳定性,而其他模型(如 QwQ-Plus、Gemini 2.5 Flash+Think)则显示出更大的差距。置换检验(p = 0.97 p=0.97 p = 0.97 )发现,在本样本中,推理架构并没有表现出系统性的优势,但分析指出由于推理模型数量较少,该分析的效能不足。
意义与主张
本文认为,对于确定性的文本条件生成,重复运行稳定性分析是传统准确率报告的必要补充 。
超越能力测量: 虽然 pass@k 衡量的是模型最终找到解的能力 ,但 PSR 衡量的是部署可靠性 (一致性)。这两者针对不同的下游关注点,且可能出现显著分歧,特别是在中等准确率的系统中。
揭示隐藏风险: 仅依赖 RLPR 会掩盖实质性的不稳定。一个具有 60% 运行级通过率但仅有 47% 完美稳定性的模型,意味着有相当比例的任务处于“需要重试”的状态,这对于期望具备可重现行为的自动化工作流而言可能是不可接受的。
方法论贡献: 本文将 PSR 和平均方差 (AV) 确立为首要评估目标。研究证明,准确性–稳定性差距是一个可观察的、特定于模型的且具有实际意义的现象,无法仅通过平均性能推断得出。
作者总结道,虽然其发现针对的是单轮 Python 代码生成,但该框架为理解对可重现性敏感的工作流中的可靠性提供了一个关键视角。他们提醒,其结果是针对所评估 API 版本的快照式结论,并未考虑更广泛的编排或多轮依赖关系。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。