← 最新论文
💻 computer science

Building an Internal Coding Agent at Zup: Lessons and Open Questions

Zup 公司通过构建内部编程助手 CodeGen 的经验表明,相较于模型本身的性能,针对性的工具设计(如字符串替换而非全文重写)、分层安全机制以及渐进式的人工监督策略才是决定企业级编程代理能否从原型走向生产并产生实际价值的关键因素。

原作者: Gustavo Pinto, Pedro Eduardo de Paula Naves, Ana Paula Camargo, Marselle Silva

发布于 2026-04-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Gustavo Pinto, Pedro Eduardo de Paula Naves, Ana Paula Camargo, Marselle Silva

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇文章讲述了巴西科技公司 Zup 如何从零开始,打造并成功部署一个**内部“代码编写机器人”(代号 CodeGen)**的故事。

如果把传统的 AI 编程助手比作一个只会写草稿的实习生,那么 Zup 想要打造的 CodeGen 则是一个能独立干活、甚至能自己修电脑、跑测试的“全能管家”

但作者发现,光有一个聪明的“大脑”(大语言模型)是不够的。就像给一个天才司机配了一辆没有刹车、没有方向盘的赛车,他开得再快也很容易出车祸。这篇文章的核心就是分享他们如何给这个“天才司机”装上刹车、方向盘和导航系统,让它真正能在公司里安全、高效地工作。

以下是用通俗语言和比喻对文章核心内容的解读:

1. 核心挑战:从“玩具”到“真家伙”

很多公司都能做出在测试题上拿高分的 AI 机器人,但一旦让它去处理公司里真实的、复杂的代码库,它就容易“发疯”。

  • 比喻:这就好比你在模拟器里练车很厉害,但真让你开上早高峰的北京环路,如果没有交通规则和刹车,你不仅会撞车,还可能把整条路堵死。
  • 问题:如果机器人乱删文件、乱删库(rm -rf),或者把几千行代码改得面目全非,员工谁敢用?

2. 四大关键决策(如何把“野马”驯成“家马”)

作者总结了四个最重要的设计思路,他们发现工程设计的智慧比模型本身的智商更重要

A. 工具设计:给机器人发“精准手术刀”,而不是“大锤”

  • 做法:以前让 AI 修改文件,是让它把整个文件重写一遍。但这就像让一个厨师把整盘菜倒掉重做,很容易出错(比如漏掉几行代码)。
  • 创新:他们设计了一个“精准替换”工具。AI 只需要告诉它:“把第 10 行的‘苹果’改成‘香蕉’"。
  • 比喻:就像修手表,你不需要把整个手表砸碎重造,只需要用镊子精准地换掉那个坏掉的齿轮。这种“小步快跑”的修改方式,大大减少了出错率。

B. 安全护栏:不仅要锁门,还要检查所有窗户

  • 做法:他们发现,如果只禁止 AI 直接删除文件,它可能会通过“命令行工具”去执行删除命令,达到同样的破坏效果。
  • 创新:安全策略必须是全局的。就像银行金库,不能只锁大门,如果窗户没关,小偷还是能进来。他们给所有能执行危险操作的工具都加了多层保险。
  • 比喻:这就像给机器人戴上了“紧箍咒”,不管它想用什么招数(工具),只要涉及危险动作(如删除文件、强制推送代码),就必须有人类点头确认。

C. 人类监督:从“手把手教”到“放手让它飞”

  • 做法:一开始,机器人做的每一个修改(改代码、运行命令)都需要人类员工点击“确认”才能执行。
  • 创新:随着员工发现机器人越来越靠谱,他们逐渐从“确认模式”切换到“全自动模式”。
  • 比喻:这就像教小孩骑自行车。刚开始你扶着后座(确认模式),等孩子骑稳了,你慢慢松手,最后让他自己骑(全自动模式)。这种循序渐进的信任建立,比强制要求员工无条件信任要有效得多。

D. 架构选择:先自己造轮子,再买成品

  • 做法:一开始他们想用现成的框架(像 LangChain),但发现那些框架像“流水线”,不适合机器人这种“反复思考、反复行动”的循环模式。
  • 创新:他们决定先自己写核心代码,把逻辑跑通。后来发现,现成的框架也进化到了和他们自己写的一样的水平。
  • 比喻:就像你想开一家餐厅,一开始觉得买现成的厨房设备太贵或不合适,就自己造了个灶台。等你把菜炒明白了,发现市面上的设备也升级了,这时候你再买,就知道该怎么挑了。先懂原理,再选工具,才不会被供应商忽悠。

3. 系统的“三驾马车”

为了支撑这个机器人,他们设计了一个三层架构:

  1. 命令行界面 (CLI):这是机器人的“手和脚”,直接安装在员工的电脑上,负责干活(读文件、改代码)。
  2. 后端 API:这是“神经中枢”,负责连接员工和机器人,处理身份验证和任务分发。
  3. Maestro (指挥家):这是机器人的“大脑皮层”,负责指挥整个流程:听指令 -> 思考 -> 调用工具 -> 看结果 -> 再思考。

4. 留下的思考(未来还要解决什么?)

虽然机器人已经能用了,但作者也抛出了几个还没完全解决的问题,就像给未来的工程师留的“作业”:

  • 说明书怎么写? 怎么给机器人写工具说明书,让它不误解?(目前还在靠试错)。
  • 信任怎么量化? 能不能根据任务的难易程度,自动决定是需要人类确认,还是直接放手?
  • 记忆怎么管? 机器人怎么记住几个月前的项目细节,又不会把过期的信息当真理?

总结

这篇文章告诉我们:打造一个能真正帮上忙的 AI 编程助手,关键不在于模型有多聪明,而在于你怎么给它设计“工具”、怎么给它设“规矩”、以及怎么让人类员工愿意信任它。

这就好比,你不需要给汽车装一个超级大脑,你需要的是给它装上可靠的刹车、清晰的导航,以及一个懂得何时该踩油门、何时该踩刹车的司机。Zup 的 CodeGen 就是这样一个懂规矩、有分寸、能进化的“好员工”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →