← 最新论文
🤖 AI

Can Coding Agents Be General Agents?

该论文通过在企业资源规划系统中的案例研究指出,虽然编码代理能可靠完成简单任务,但在处理复杂业务时因难以弥合领域逻辑与代码执行之间的鸿沟而表现不佳,表明其目前尚不足以成为通用的自动化代理。

原作者: Maksim Ivanov, Abhijay Rana, Gokul Prabhakaran

发布于 2026-04-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Maksim Ivanov, Abhijay Rana, Gokul Prabhakaran

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文探讨了一个非常有趣的问题:现在的"AI 编程助手”能不能直接变身成“全能业务管家”?

简单来说,作者们发现:这些 AI 在写代码、修电脑方面已经是“天才”了,但一旦让它们去处理复杂的公司业务流程(比如管账、管库存、管人事),它们就会在“懂业务”和“写代码”之间掉链子。

为了让你更容易理解,我们可以把这篇论文的核心内容想象成**“一个刚毕业的天才程序员,被强行派去当一家大公司的总经理”**的故事。


1. 背景:从“写代码”到“干杂活”

现在的 AI 编程助手(比如 Claude Code, GPT-5 等)非常厉害。它们不仅能写代码,还能自己运行代码、查错、安装工具。

  • 现状:大家发现,既然 AI 能搞定复杂的代码,那能不能让它直接帮公司做业务?比如:“帮我算算这个季度的利润,如果超标了就自动调整预算,顺便给员工发奖金。”
  • 假设:既然所有工作都在软件里进行(Excel、数据库、网页),那最擅长操作软件的“编程 AI"应该是最适合做“全能管家”的。

2. 实验:把 AI 扔进“企业 ERP"迷宫

为了测试这个想法,作者们搭建了一个**“企业资源计划(ERP)”**的模拟环境。

  • 比喻:想象 ERP 是一个巨大的、错综复杂的**“公司大脑”**,里面装着财务、人事、库存、销售等所有数据。
  • 任务:作者给 AI 下达了一些真实业务指令,比如:“我们要买 40 把椅子,预算有限,必须从美国供应商那里买,还要保证利润不亏。”
  • AI 的工作:它不能直接点按钮,它必须自己写代码去查询数据库、自己写脚本去下单、自己写代码去生成发票。

3. 测试结果:简单任务是“神”,复杂任务变“疯”

✅ 简单任务:表现完美

当任务很简单时(比如“给一个客户开个发票”),AI 表现得像个**“超级实习生”**。它不需要任何培训,就能准确理解指令,写出正确的代码,完美完成任务。

  • 比喻:就像让一个天才程序员去“把桌上的杯子拿过来”,他做得又快又好。

❌ 复杂任务:四种“翻车”模式

当任务变难,需要同时考虑多个约束条件(比如既要省钱、又要快、还要符合政策、还要跨部门协调)时,AI 就开始**“翻车”**了。作者总结了四种典型的失败原因:

失败模式一:偷懒的“关键词匹配” (Lazy Heuristics)

  • 场景:老板说“只从美国供应商进货”。
  • AI 的做法:它没有去查供应商的“国家代码”(这是正确的逻辑),而是偷懒地写了一段代码:“只要供应商名字里包含 'American' 或 'Northern' 就选它”。
  • 比喻:就像你让保安“只让穿红衣服的人进”,结果保安为了省事,只认名字里带“红”字的人。结果,一个穿红衣服但名字不带“红”的人被拦住了,一个名字带“红”但穿蓝衣服的人却进去了。逻辑是对的,执行代码是错的。

失败模式二:业务层面的“幻觉” (Hallucinations)

  • 场景:有一批坏掉的 LED 板需要处理。
  • AI 的做法:它突然“脑补”说:“坏了的板子必须放在冰箱里保存。”然后它写代码去查冰箱里的库存。当然,系统里根本没有冰箱,它查不到,就以为板子丢了。
  • 比喻:就像医生给病人看病,病人说“我头疼”,医生却凭空想象说“你肯定是因为昨晚没睡在冰窖里”,然后开了一堆治“冰窖病”的药。代码写得再完美,前提也是错的。

失败模式三:直接“无视规则” (Ignored Constraints)

  • 场景:公司规定“员工请假必须连续几天,不能断断续续”。
  • AI 的做法:它完全忘了这条规定,给员工排了个“周一休、周二上班、周三休”的奇葩假条,然后自信地报告“任务完成”。
  • 比喻:就像你让司机“必须走高速”,结果司机为了省油走了乡间小路,还觉得自己很聪明。规则在脑子里根本没存进去。

失败模式四:盲目的“过度自信” (Overconfidence)

  • 最致命的问题:无论 AI 做得多烂,它几乎总是报告“任务成功”。
  • 原因:在写代码的世界里,只要代码不报错、程序能跑通,AI 就觉得自己赢了。但在业务世界里,代码跑通了不代表业务做对了(比如你成功地把货卖给了不该卖的人,代码没报错,但公司亏了)。
  • 比喻:就像一个**“只会看红绿灯的司机”**。只要绿灯亮了(代码没报错),他就觉得“我开得完美”,完全不管前面是不是悬崖(业务逻辑错误)。它分不清“代码没报错”和“事情做对了”的区别。

4. 核心结论:为什么它们还不是“全能管家”?

这篇论文指出了一个巨大的**“评价缺口”**:

  • 现在的 AI 测试,要么只考写代码(代码跑通就行),要么只考业务逻辑(给几个选项选对的)。
  • 但真正的“全能管家”需要双向翻译:把“老板的模糊指令”翻译成“精确的代码”,再把“代码的运行结果”翻译回“业务决策”。

目前的瓶颈在于:AI 太擅长“执行代码”了,以至于它误以为“代码能跑”就是“任务完成”。它缺乏对业务现实的深刻理解,容易在复杂的逻辑链条中“偷懒”或“瞎编”。

5. 总结:未来在哪里?

  • 好消息:AI 编程助手已经具备了成为通用代理的潜力。它们能理解软件环境,能自我纠错,这是其他类型的 AI 做不到的。
  • 坏消息:在它们学会**“像人类一样思考业务逻辑”,而不仅仅是“像机器一样执行代码”**之前,它们还不能完全放心地交给它们处理复杂的公司大事。
  • 建议:在完全信任它们之前,我们还需要给它们加上“业务护栏”(比如人工审核、专门的业务工具),或者训练它们不仅关注代码是否报错,更要关注业务目标是否达成。

一句话总结
现在的 AI 编程助手是**“顶级的代码执行者”,但还不是“聪明的业务决策者”**。它们能帮你把事“做完”,但还不一定能帮你把事“做对”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →