← 最新论文
💬 NLP

Evaluating LLMs on Real-World Software Performance Optimization

本文介绍了 SWE-Pro,这是一个源自 102 项专家级优化的严谨仓库级基准测试,它揭示了当前的大型语言模型在现实世界软件优化方面显著无法达到人类水平,与专家工程师所实现的实质性加速和内存减少相比,其取得的收益微乎其微。

原作者: Ezgi Sarıkayak, Wenchao Gu, Hesham Ghonim, Chunyang Chen

发布于 2026-06-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Ezgi Sarıkayak, Wenchao Gu, Hesham Ghonim, Chunyang Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观:“速效厨师” vs. “大师级厨师”

想象一下,你经营着一家规模庞大、繁忙的餐厅厨房(一个现实世界的软件代码库)。你雇佣了一支 AI 厨师团队(大语言模型或 LLM)来协助 大师级厨师(人类专家)让烹饪速度更快、消耗更少的能量。

大师级厨师非常清楚如何高效地切菜、如何通过整理储藏室来节省步骤,以及如何调整炉火温度以节省燃料。他们拥有多年的经验。

AI 厨师非常聪明。他们能读懂食谱,理解食材,甚至能写出在纸面上看起来完美的全新食谱。但本文提出的核心问题是:这些 AI 厨师真的能在现实世界中让厨房运行得更快、更省能耗吗?还是说,他们只是让事情看起来变好了,但实际上并没有提升速度?

问题所在:旧的测试太简单了

以前,研究人员通过给 AI 厨师布置一个微小的单一任务来测试他们,比如:“切这一根胡萝卜。”

  • 缺陷: 在真实的厨房里,你不仅仅是切一根胡萝卜。你会切 10 根、1,000 根甚至 100,000 根。有时候胡萝卜是湿的,有时候是冻上的。
  • 结果: 旧的测试就像是在一个安静的房间里评判一位厨师切单根胡萝卜的能力。它们没有测试这位厨师是否能在有 1,000 个订单的繁忙高峰期应对自如,或者是否在追求速度的同时不小心使用了过多的水(内存)。

本文认为,这些旧的测试过于简单,无法捕捉到真实计算机中发生的“噪声”(随机波动)。

解决方案:SWE-Pro(“真实厨房”模拟器)

作者构建了一个更难的新测试,名为 SWE-Pro。你可以把它看作是一个高科技模拟的、混乱的真实厨房。

  1. 真实的食谱: 他们没有编造虚假任务。他们研究了 102 个真实的案例,在这些案例中,人类专家成功优化了著名开源项目(如 pandasscikit-learnxarray)中的代码。这些是“金标准”食谱。
  2. 压力测试: SWE-Pro 不仅仅测试 AI 在一种输入下的表现,而是测试他们在许多不同场景下的表现。
    • 类比: 这不仅仅是“切 10 根胡萝卜”,而是“切 10 根”、“切 100 根”、“切 10,000 根”,并且要处理湿胡萝卜、冻胡萝卜以及不同大小的胡萝卜。
  3. 噪声过滤器: 计算机是很杂乱的。有时程序运行慢仅仅是因为计算机当时正在处理其他事情(比如服务员掉落了一个托盘)。SWE- پرو 对测试进行了多次运行,并使用了一种特殊的统计“噪声过滤器”,以确保如果 AI 声称“我更快了”,那确实是真的,而不是仅仅因为运气好。
  4. 两个指标: 他们测量两件事:
    • 速度: 食物上菜的速度(运行时间/Runtime)。
    • 内存: 厨师使用了多少台面空间和存储空间(峰值内存和时间加权内存使用量)。

结果:AI 厨师陷入苦战

当他们让顶尖的 AI 模型(如 GPT-5.2、Claude Sonnet 4.6 等)接受这种严苛的“真实厨房”测试时,结果令人惊讶且令人失望。

  • 人类专家(金标准): 当人类优化代码时,他们实现了巨大的改进。
    • 类比: 大师级厨师将烹饪时间缩短了 15 倍,并将所需的台面空间减少了 171 倍。他们找到了巧妙的方法来重新布置厨房,从而节省了大量的资源。
  • AI 厨师:
    • 速度: AI 模型几乎没有任何改进。在大多数情况下,它们的“改进”微乎其微,甚至无法与随机噪声区分开来。
    • 内存: AI 模型几乎从未实现过节省内存。在这一领域,它们几乎不存在。
    • “无信号”问题: 即使 AI 写出的代码通过了基础测试(食物味道是对的),它也极少能产生可衡量的加速效果。这就像是一位厨师虽然把胡萝卜切得很整齐,但花费的时间和之前完全一样。
    • 倒退: 有时,AI 甚至会让事情变得更慢。其中一个模型(GPT-5.2)平均竟然让代码变慢了 30%!

核心启示

本文的结论是,虽然 AI 擅长编写看起来正确且符合规则的代码,但它目前非常不擅长处理实现软件显著提速或降低内存消耗所需的深度、复杂工程。

  • 差距: AI 目前的能力与资深人类工程师的能力之间存在巨大的鸿断。
  • 瓶颈: 问题不在于 AI 如果运气好能不能做出巨大的改进(它确实偶尔可以做到),而在于 AI 无法可靠地发现这些改进的机会。

简而言之: 如果你要求 AI “让这个软件更快”,它可能会写出一个看起来很漂亮的补丁,但不要指望它真的能提升你的电脑速度或节省你的内存。目前,这项工作仍属于人类专家。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →