← 最新论文
🤖 AI

Context-Augmented Code Generation: How Product Context Improves AI Coding Agent Decision Compliance by 49%

本文介绍了一项受控基准测试,证明通过引入产品上下文检索系统(Brief)来增强 AI 编码代理,相较于仅访问代码库,可使其对团队特定产品决策的遵从度提高 49 个百分点,在真实软件工程任务中达到 95% 的遵从率。

原作者: Drew Dillon, Kasyap Varanasi

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Drew Dillon, Kasyap Varanasi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你雇佣了一位才华横溢、速度极快的学徒程序员,为公司网站构建一个新功能。这位学徒(即人工智能)能够阅读你写过的每一行代码,理解你的计算机如何运作,并能编写出真正可运行且不崩溃的新代码。

但问题在于:这位学徒并不了解你公司那些不成文的规则。

在真实的办公室中,团队在编码时都有各自的“秘密暗号”。也许有一条规则规定:“我们再也不使用那个特定的日历小部件了”,或者“每次导出数据时,必须记录日志以供安全审计”,又或者“我们总是将测试代码放在所测试代码的旁边”。这些规则并未写在代码本身中;它们存在于会议纪要、设计文档或团队的集体记忆之中。

缺乏这些背景信息,这位才华横溢的学徒可能会构建出一个功能正常、技术上可编译的功能,但却违反了团队最重要的规则。这就像用错误类型的砖块建造了一座漂亮的房子,因为建筑师不知道城市有特定的分区法规。

实验:两种方法

这篇论文的作者设计了一项测试,以验证向人工智能提供这些“不成文规则”是否有所帮助。他们创建了一个模拟办公环境(一个代码仓库),其中包含 8 项不同的任务,例如“添加深色模式切换”或“创建搜索栏”。在这些任务中隐藏了 41 个特定的“陷阱”或规则,人工智能必须遵循这些规则才能获得满分。

他们测试了人工智能的两个版本:

  1. “仅代码”学徒(基线): 该人工智能仅获得代码文件,并被指示“构建此功能”。它必须通过观察现有代码模式来猜测规则。
  2. “上下文感知”学徒(增强版): 该人工智能拥有相同的代码文件,但还拥有一份“公司手册”(称为 Brief)。在编写任何一行代码之前,该人工智能可以提出问题,例如“我们的设计规则是什么?”或“客户抱怨什么?”。此外,它在开始构建之前还有一份逐步计划(规范)。

结果:巨大的飞跃

差异是巨大的。

  • “仅代码”学徒 遵循规则的比例仅为 46%。它经常忽略那些看不见的规则。例如,在一个任务中,它查看了代码,看到了一个用于分页的辅助函数,便决定:“哦,这已经完成了!”于是没有编写任何代码。它忽略了当前的分页功能已损坏,需要特定修复这一事实。
  • “上下文感知”学徒 遵循规则的比例高达 95%。通过查阅“手册”,它确切地知道应使用哪些小部件、应添加哪些安全日志,以及如何构建代码结构。

重大胜利: 上下文感知版本将合规率提高了 49 个百分点

原因分析:“不可见”规则与“可见”规则

论文发现了一个清晰的模式:

  • 可见规则: 如果规则写在代码内的注释中(例如,“出于安全考虑请使用此函数”),两位学徒都能找到并 100% 地遵循它。
  • 不可见规则: 如果规则仅存在于产品文档中(例如,“我们使用 PostHog 进行功能标志管理,但它不在代码中”),“仅代码”学徒的识别率为 0%。而“上下文感知”学徒的识别率为 100%,因为它在开始之前查阅了该规则。

这不仅仅是“知道”规则

论文还指出,“上下文感知”人工智能不仅仅是“查阅”规则;它的工作方式也不同。它在编码之前创建了一份详细的计划(规范),其中包含需求清单。此外,它还进行了“构建中咨询”,这意味着它可以在工作过程中暂停并询问:“我这样做对吗?”

作者承认,他们无法完美区分有多少成功源于拥有信息,又有多少源于拥有更优的工作流程。然而,数据强烈表明,拥有正确的信息(产品上下文) 是解决另一款人工智能无法看到的问题的关键。

“正确”的代价

有趣的是,“上下文感知”人工智能的运行成本略高(API 费用增加了约 28%),因为它花时间阅读手册并撰写计划。然而,由于它生成的代码可以立即合并到主项目中,每个成功任务的实际成本反而下降了 68%

“仅代码”人工智能每次尝试的成本较低,但它生成的代码需要人类进行修复和重写,从长远来看反而更昂贵。“上下文感知”人工智能编写了更多代码、编写了测试,并避免了已弃用的模式,这意味着它 100% 的时间都达到了“可合并”状态。

核心结论

这篇论文是一个概念验证。它表明,为了让人工智能编码代理在专业团队中真正发挥作用,它们不能仅仅阅读代码。它们需要访问组织知识——那些存在于代码文件之外的决策、客户投诉、设计偏好和安全规则。

当你向人工智能提供“全貌”时,它就不再靠猜测,而是开始构建团队真正需要的东西。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →