← 最新论文
🤖 AI

Can Vibe Coding Beat Graduate CS Students? An LLM vs. Human Coding Tournament on Market-driven Strategic Planning

本文提出了一种基于锦标赛的基准测试,用于评估大型语言模型在复杂市场驱动型物流问题上相对于研究生的表现,结果显示,人工编写的智能体显著优于大语言模型生成的解决方案,且大多数大语言模型智能体未能超越简单的基准线,甚至在被提示进行改进时,还会降低人类最优策略的表现。

原作者: Panayiotis Danassis, Naman Goel

发布于 2026-06-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Panayiotis Danassis, Naman Goel

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题:“氛围编程”能打败研究生吗?

想象一下,你有一个超级聪明的机器人助手(大型语言模型,简称 LLM),它只需通过你的对话就能编写代码。你说:“给我做一个外卖 App,”它几秒钟内就能写出代码。这就是所谓的**“氛围编程”(Vibe Coding)**。

这篇论文提出的核心问题是:这个机器人真的足够聪明,能够解决现实中复杂且高风险的商业问题吗?还是说它只是擅长写出看起来没错、但在复杂情况下会崩溃的代码?

为了找出答案,研究人员组织了一场盛大的编程锦标赛

竞技场:“拍卖、取货与递送”游戏

研究人员并没有让机器人去解决简单的数学题(比如“2+2 等于几?”),而是将它们置于一个复杂的模拟环境——**拍卖、取货与递送问题(APDP)**中。

你可以把它想象成一场高水平的物流象棋

  1. 拍卖阶段: 几家公司(代理人)正在竞标派送任务。任务是一个接一个出售的。你必须猜测该出多少钱。如果你出价太高,你会亏钱;如果你出价太低,你可能会赢得任务,但由于配送成本过高而导致亏损。你必须预测竞争对手的行为。
  2. 规划阶段: 一旦你赢得了任务,你必须规划出卡车取货和送货的最佳路线。你的卡车空间有限,且不能违反规则。
  3. 目标: 最终的获胜者是那家利润最高的公司(总收入减去驾驶成本后的净利润)。

这不仅仅关乎编写一段不会崩溃的代码,更关乎编写能够进行策略性思考、预测未来并智斗对手的代码。

参赛选手

研究人员让两个团队展开了对决:

  • 人类战队: 由 EPFL 大学研究生在 AI 编程工具出现之前编写的 17 个代理人。这些学生花费了数周时间进行思考、规划和手动编码。
  • AI 战队: 由世界顶尖 AI 模型(如 GPT-5、Claude、Gemini)通过“氛围编程”生成的 40 个代理人。研究人员给了这些 AI 与学生完全相同的指令。

结果:人类完胜

结果令人惊讶且非常明确:

  1. 前五名全是人类: 在每一场锦标赛中,前五个名额都被人类学生占据。AI 代理人无法突破前五名。
  2. AI 对阵“无脑基准线”: 研究人员创建了一个非常简单、笨拙的 AI 代理(基本上就是一个随机猜测者)。40 个 AI 代理中有 33 个输给了这个简单的代理。 AI 的策略水平如此之差,以至于一个基础计算器都能打败它。
  3. “修复”灾难: 在最后一项测试中,研究人员拿走了获胜的人类代码,并要求最强的 AI 去“改进它”。AI 尝试调整代码,但它并没有让代码变得更好,反而让它变差了。改进后的版本从第 1 名跌落到了第 10 名。

为什么 AI 会失败?

论文解释说,虽然 AI 擅长语法(编写没有拼写错误的程序),但在推理(理解复杂策略背后的“为什么”和“如何做”)方面却表现不佳。

  • “容许启发式算法”的失败: 在一个更简单的测试中,研究人员要求 AI 使用一种特定的数学技巧(A* 搜索)来寻找最佳路径。即使研究人员明确告知,AI 也会不断忘记这个技巧中最基本的规则。这就像要求一位厨师烤蛋糕,但他们甚至会忘记鸡蛋是关键原料,即便你已经提醒过他们。
  • “超时”漏洞: AI 代理经常陷入死循环或思考时间过长,导致它们因为超时而错失拍卖机会。人类的代码则不会出现这种情况。
  • 缺乏策略: AI 代理经常盲目出价,或者规划出浪费燃料的路线。它们无法“察言观色”,也无法预测竞争对手的行为。

底线结论

论文得出结论:LLM 目前还不是“研究生级别的程序员”。

它们非常擅长编写可以运行的代码(没有语法错误),但目前在编写需要在复杂现实场景中进行长期规划和策略对抗的竞争性代码方面,表现得非常糟糕。

类比:
想象你有一个机器人,它可以写出一份完美的蛋糕食谱。它确切知道需要多少杯面粉。但如果你要求它在一家物价每分钟都在变动、竞争对手试图抢走顾客、且预算有限的城市里经营一家面包店,这个机器人很可能会破产。它能写出食谱,但它无法经营生意。

研究人员表示,现在是时候停止仅仅检查代码是否“有效”(通过测试),而应该开始检查代码是否能在现实世界中真正“取胜”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →