Don't Blame the Large Language Model: How Agent Harness Evolution Shapes Coding Agent Quality
本文通过对 Qwen Code CLI 的 35 个连续版本进行深入研究,展示了首个受控纵向研究,证明了智能体控制层(agent harnesses)的快速演进而非底层大语言模型,是导致编程智能体质量波动的主要驱动因素。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个这样的世界:你的电脑不再只是等待你输入命令,而是能真正为你分担工作。这就是“编程智能体”(coding agents)的时代——这些聪明且自主的程序可以阅读代码、修复漏洞,甚至能独立编写新的软件。但这里有一个秘诀:这些智能体不仅仅是一个“大脑”(那个庞大的 AI 模型);它们还需要一个“身体”和一套“神经系统”才能运转起来。这个身体被称为“智能体支架”(agent harness)。你可以把 AI 模型想象成一个才华横溢但有些懒散的天才,而他需要一位经理来递给他合适的工具、提醒他规则并组织他的思路。支架就是那位经理。它决定了 AI 可以使用哪些工具、向它展示多少信息,以及如果第一次尝试失败了该如何循环并重试。大家都认为,如果你不断聘请更好的经理并升级办公室,天才就会变得更聪明、工作得更快。但如果这位“经理”实际上因为增加了太多规则或复杂的指令而让事情变得更糟呢?这正是这篇论文所提出的核心问题:随着这些“经理”系统不断进行更新,它们究竟是在帮助 AI 更好地完成工作,还是仅仅让其变得更慢、更昂贵了?
这篇论文的作者决定扮演侦探,去解开一个软件开发者们一直在抱怨的谜团。他们注意到,每当这些编程智能体进行更新时,它们往往会开始犯更多的错误,或者完成任务所需的时间变得长得多。人们通常会将此归咎于 AI 本身的大脑,认为模型变笨了。但研究人员怀疑真正的罪魁祸首是这个“经理”(支架)变卦太快。为了证明这一点,他们设计了一个非常严格的实验。他们挑选了一个特定的 AI 模型,并将其“关进笼子”使其无法发生任何改变。然后,他们选取了“经理”软件(具体为 Qwen Code CLI),并让它经历了 35 个不同版本的迭代,从最初的版本一直到最新的版本。对于每一个版本,他们都让智能体去解决 50 个真实的编程谜题,并且每次使用的都是完全相同的 AI 大脑。
结果令人惊讶,甚至有些滑稽。尽管“经理”软件在不断更新——有时甚至一天发布两个以上的新版本——但 AI 实际解决谜题的能力并没有变得更好。事实上,成功率基本保持不变,始终在 30% 左右徘徊,无论他们对软件进行了多少次更新。早期的版本在修复漏洞方面的表现与那些花哨、复杂的新版本不相上下。然而,这里有一个巨大的陷阱:较新的版本极其浪费。最新版本的“经理”让 AI 使用了近两倍的“Token”(这就像是 AI 用来思考的燃料或货币),并且进行的工具调用次数也是旧版本的两倍。这就像是将汽车引擎升级为一个超级复杂的版本,虽然消耗了两倍的汽油,却没让车跑得更快。
研究人员进行了深入调查,以找出这种现象发生的原因。他们查看了“经理”软件中的代码变更,发现当开发者添加大量新功能或试图同时修复许多小漏洞时,AI 就会感到困惑并浪费更多精力。他们还发现,“经理”身体的某些部分是危险的,不可轻易触碰。修改 AI 与其大脑沟通的方式(即“LLM 提供者”层)或它记忆事物的方式(即“上下文管理”层),往往会导致智能体踉跄并失败。另一方面,修复安全漏洞或添加简单的扩展插件则是安全的。最令人震惊的是,软件团队竟然完全不知道这些问题正在发生。他们的自动化测试只检查软件是否“崩溃”,而不检查 AI 是否真的在做好工作或是在浪费金钱。这就像一家工厂只检查组装线是否在运转,却从未检查生产出来的汽车是否真的装有轮子。
最后,论文指出我们需要停止为这些错误责备 AI 大脑。真正的问题在于,“经理”软件在缺乏适当质量检查的情况下进化得太快了。开发者们添加了如此多的功能和变更,以至于 AI 被拖累,需要消耗更多的资源来达到与之前完全相同的结果。作者呼吁建立一种新型的“质量保证”机制,专门检查智能体在每次更新后是否依然保持高效且有效,而不仅仅是检查它是否还能正常启动。在此之前,升级这些编程智能体可能仅仅是在为同样的性能支付更高的代价。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。