← 最新论文
💻 computer science

Consistency Amplifies: How Behavioral Variance Shapes Agent Accuracy

该论文通过 SWE-bench 基准测试发现,虽然大语言模型代理的行为一致性通常与准确率正相关,但一致性本质上会放大结果(无论是正确还是错误),因此对于生产部署而言,解释的准确性比执行的一致性更为关键。

原作者: Aman Mehta

发布于 2026-03-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Aman Mehta

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文探讨了一个非常有趣的问题:当人工智能(AI)助手反复做同一件事时,它们的表现是稳定的,还是像“抽卡”一样忽好忽坏?

作者通过让三个不同级别的 AI(Claude 4.5、GPT-5 和 Llama)去解决 10 个真实的编程难题(就像让三个不同水平的程序员去修同一个 Bug),跑了 50 次实验,得出了几个反直觉的结论。

为了让你轻松理解,我们可以把 AI 比作**“三位不同风格的厨师”,把编程任务比作“做一道复杂的菜”**。

1. 三位厨师的“人设”

  • Claude (老练的大厨):

    • 特点: 做事非常有条理,每一步都深思熟虑,甚至有点“强迫症”。
    • 表现: 他做这道菜,每次花的步骤数都差不多(非常稳定)。如果他知道菜谱是对的,他每次都能完美端出菜(准确率高)。
    • 缺点: 如果一开始他看错了菜谱(比如把“放糖”看成了“放盐”),因为他太执着于自己的逻辑,他会非常稳定地把菜做咸,而且每次都是咸的。
  • GPT-5 (快手厨师):

    • 特点: 手速极快,动作麻利,但思考时间较短。
    • 表现: 他做菜速度是大厨的 4.7 倍,但做出来的菜味道不稳定。有时候能蒙对,有时候会翻车。他的“翻车”方式五花八门,不像大厨那样“稳定地翻车”。
    • 结论: 快,但不够稳,也不够准。
  • Llama (新手厨师):

    • 特点: 经验不足,经常不知道下一步该干嘛。
    • 表现: 他做菜时,有时候切菜,有时候直接开火,步骤完全乱套(极度不稳定)。结果就是,他几乎做不出能吃的菜(准确率极低)。

2. 核心发现:一致性是“双刃剑”

这是论文最精彩的观点:“稳定”并不等于“正确”。

  • 以前的误解: 大家以为,如果一个 AI 每次做同一件事的表现都很像(很稳定),那它肯定很靠谱。
  • 现在的真相: 一致性只是放大了结果。
    • 如果 AI 理解对了任务,一致性就是超级英雄:它能每次都完美完成任务。
    • 如果 AI 理解错了任务,一致性就是灾难放大器:它会非常自信且稳定地把错误重复 5 次。

论文中的惊人数据:
在表现最好的“大厨”Claude 那里,71% 的失败并不是因为他“偶尔失误”,而是因为他每次都犯同一个错(比如每次都错误地认为要加个警告,而实际上是要删除代码)。他太“稳定”地坚持错误了。

3. 一个有趣的悖论:什么时候开始“分道扬镳”并不重要

研究人员发现,Claude 和 GPT-5 这两位厨师,在开始做菜的前 3 步,大家的动作几乎是一样的(比如都先打开冰箱,都先洗菜)。

  • 直觉认为: 既然起步一样,后面应该也差不多吧?
  • 现实: 完全不是。虽然起步一样,但 GPT-5 后面就开始“乱舞”了(步骤忽多忽少),而 Claude 依然保持整齐划一。
  • 比喻: 就像两辆车从同一个路口出发,前 3 公里都走直线。但 3 公里后,一辆车开始疯狂变道、急刹车(GPT-5),另一辆车依然稳稳地开在车道上(Claude)。起步的相似,并不能保证过程的稳定。

4. 速度 vs. 质量 vs. 稳定性的“不可能三角”

论文揭示了一个残酷的权衡(Trade-off):

  • GPT-5 选择了速度(快 4.7 倍),代价是质量(准确率低了)和稳定性(波动大)。
  • Claude 选择了质量稳定性,代价是(步骤多,时间长)。
  • Llama 什么都想要,结果什么都做不好。

这就好比:

  • 如果你赶时间(比如写个临时脚本),选GPT-5,虽然可能出错,但快。
  • 如果你要上线生产系统(比如银行软件),必须选Claude,因为它虽然慢,但只要你确认它理解对了,它就不会乱来。

5. 总结:我们该关注什么?

这篇论文告诉我们,在评估 AI 助手时,不要只看它“稳不稳”,更要看它“懂不懂”。

  • 以前的做法: 只要 AI 每次都能给出一个答案,我们就觉得它很稳。
  • 现在的建议: 如果 AI 很稳,但它理解错了题意,那它越稳,危害越大。

一句话总结:
对于 AI 来说,“正确地理解任务”比“机械地重复动作”重要一万倍。 一个能偶尔犯错但能自我修正的 AI,可能比一个“稳定地犯蠢”的 AI 更有用。未来的 AI 开发,重点应该放在提高“理解力”,而不是单纯地让它跑得更快或更稳。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →