想象一下,一家大型软件公司(微软)决定给它的数千名工程师配备一种全新的、超级聪明的助手。这不仅仅是一个拼写检查器;它是一个“命令行智能体”(command-line agent),可以自主编写代码、修复漏洞并构建功能,只要你告诉它要做什么。这就像是给每位工程师配备了一个住在他们电脑终端里的私人机器人管家。
在2026年初,微软推出了两个版本的这些机器人:Copilot CLI(由微软拥有的 GitHub 开发)和 Claude Code(由 Anthropic 开发)。
该公司曾有三个主要的担忧:
- 到底谁会去尝试这些机器人?
- 谁会持续使用它们,还是说他们只是玩玩而已,过了一天就放弃了?
- 这些机器人是否物有所值?(这些机器人的运行成本很高,每年需要消耗数百万美元的“Token”费用)。
以下是研究人员发现的结果,通过简单的语言进行了解释:
1. “饮水机旁谈话”效应(采用率)
决定一名工程师是否尝试该机器人的最关键因素并不是他们的职位、在公司的资历或年龄,而是他们认识谁。
- 类比: 想象一下,一场派对上开始了一种新的舞蹈热潮。如果你看到你的朋友们正在跳这种舞,尤其是你的老板或你最亲近的同事也在跳,那么你极有可能也会去尝试。
- 发现: 如果一名工程师看到他们的同僚(即那些与他们一起进行代码审查的人)或他们的上级领导(其直属上司的上司)正在使用该工具,他们尝试该工具的可能性就会大大增加。事实上,如果一个特定同僚群体中有超过25%的人在使用该工具,一名工程师尝试该工具的概率就会跃升超过200%。
- 令人惊讶的转折: 那些已经是旧版 AI 工具(集成在代码编辑器中)重度用户的人,实际上更不容易坚持使用这种新的命令行机器人。这就像是一个非常喜爱现有汽车的人可能会尝试新车型,但如果他们太喜欢现在的车了,就不会永久切换过去。
2. “忙碌的小蜜蜂”效应(留存率)
一旦人们尝试了该工具,谁会继续使用它呢?
- 类比: 把这个工具想象成一种新型的高科技电钻。一位每天都在钻孔的专业承包商,是最有可能继续使用这种新电钻的人。而一个很少钻孔的爱好者可能只会试用一次,然后就把电钻放回盒子里。
- 发现: 那些原本就很忙碌(合并大量代码)的工程师是那些能够坚持使用该工具的人。他们提交的代码越多,就越会持续使用这个机器人。初级工程师和管理层在是否坚持使用方面并没有表现出明显的模式。
3. “超强生产力”提升(影响力)
最重要的课题是:这些机器人真的有帮助吗?
- 类比: 想象一下,你给一群作家一台能自动完成句子内容的魔法打字机。他们会写出更多的书吗?
- 发现: 是的。使用这些工具的工程师比不使用这些工具时多合并了 24% 的拉取请求(Pull Requests,即代码变更)。
- “无衰减”的惊喜: 通常情况下,当人们得到一个新玩具时,他们会兴奋一个月,然后感到厌倦。这项研究观察了四个月的时间,发现这种提升从未消失。工程师们不仅变得更快了,而且开始处理他们以前会避开的更大、更复杂的项目。一位工程师表示:“我不再只考虑狭隘的解决方案;我可以利用智能体进行更广泛的思考。”
4. 工具对决:Copilot 对阵 Claude
微软提供了两种不同的机器人。哪一个效果更好?
- 发现: Copilot CLI(微软自家的产品)带来的额外工作量大约是 Claude Code 的两倍。
- 原因: 论文提出了两个可能的理由:
- 微软的工程师可能更擅长使用自家公司开发的工具,因为该工具更契合他们的特定工作流。
- 这两种工具可能用于不同类型的任务,但微软开发的这款工具似乎在他们的特定环境下解锁了更多的“已合并代码”。
5. 底线结论
研究得出结论,这些 AI 智能体不仅仅是一种“新鲜感”(即很快就会让人厌倦的有趣玩具)。它们是实实在在且持久的生产力加速器。
然而,作者们也提出了一个至关重要的警告:更多的代码并不自动意味着更好的代码。
- 类比: 如果你给一位厨师一台切菜速度快了 24% 的机器,他可以做出更多的汤。但这并不意味着汤的味道会更好。这项研究衡量的是制作了“多少”汤,而不是汤的“品质”如何。
简而言之: 如果你想让你的团队使用这些 AI 工具,不要只是发一封邮件。要确保你的团队看到他们的同事和领导也在使用它们。而且,如果他们确实使用了,请预期他们会完成显著更多的工作,前提是他们本身就是勤奋的员工。但请记住,你仍然需要检查这些额外的工作是否真的具有高质量。
技术摘要:命令行 AI 编程代理的采用与影响
问题陈述
考虑推广代理式命令行工具(例如 Anthropic 的 Claude Code、GitHub 的 Copilot CLI)的组织面临三个关键的不确定性:哪些工程师会采用这些工具,他们是否会在一段时间内保持使用,以及这些工具产生的输出是否足以抵消其涉及的高昂 Token 成本(在大规模应用时可能每年达到数百万美元)。虽然以往关于开发者 AI 采用的研究主要依赖于调查问卷,或通过公共代码库信号推断使用情况(这会将“非使用”与“不可见的实际使用”混淆),但目前缺乏来自企业环境的观测数据,能够同时追踪所有符合条件的工程师群体及其真实的用法日志和输出指标。
研究方法
作者在微软进行了一项实地研究,研究对象是两种获准使用的代理式命令行工具:Copilot CLI 和 Claude Code。该研究分为两个独立的分析部分,覆盖了四个月的时间窗口(2026 年 1 月 5 日至 4 月 29 日)。
1. 采用研究 (The Adoption Study)
- 范围: 专门针对 Copilot CLI,以确保具有统一的合格采用者群体(排除通过管理计划已获得 Claude Code 访问权限的工程师)。
- 样本: 拥有 Copışot CLI 访问权限的微软软件工程师。
- 阶段:
- 初始使用: 在工程师-周面板数据上建模为离散时间风险函数,以确定谁首先尝试该工具。
- 留存率: 定义为持续使用(在采用后的前 14 天内至少有 5 天有活动)。
- 预测因子: 分析了五组因素:职业阶段、工龄、基准 Pull Request (PR) 活动、先前的 IDE Copilot 使用情况,以及社交暴露度(评审同行、跨级同行及直属经理的使用情况)。
- 控制变量: 包括周固定效应、部门固定效应,并对工程师进行聚类标准误处理,以解释日历时间、组织差异和重复观察的情况。
2. 产出研究 (The Outcomes Study)
- 范围: 涵盖了 Copilot CLI 和 Claude Code 的采用者。
- 产出指标: 合并后的 Pull Requests (PR) 每位工程师的数量,其定义为在创建后 28 天内被合并的 PR。
- 方法:
- 第一部分(合成控制法): 使用 CausalImpact(贝叶斯结构时间序列模型),将早期采用者的 PR 吞吐量与基于非采用者构建的合成反事实进行比较。
- 第二部分(个体内部分析): 使用固定效应泊松回归,将每位工程师视为其自身的对照组,比较使用工具的周与未使用工具的周。这使得剂量-反应分析(将 PR 提升量与工具使用天数相关联)、工具对比以及子群分析成为可能。
核心贡献
本文提供了首个利用开发者层面的遥测数据来分析代理式命令行工具(而非 IDE 辅助 AI 工具)的采用动态和产出影响的实地研究。
- 数据粒度: 不同于以往通过公共信号推断采用情况的研究,本研究观察了全体符合条件的工程师,并将使用情况直接与内部 HR 数据和 PR 活动挂钩。
- 采用过程的分解: 它将“初始使用”与“留存”区分开来,证明了预测这两个阶段的因素是不同的。
- 产出的因果推断: 研究超越了自我报告的生产力,通过使用合成控制和个体内部设计来衡量实际合并的 PR 吞吐量,从而减轻选择偏差。
关键结果
采用与留存驱动因素
- 社交暴露是主要因素: 初始使用的最强预测因子是社交可见度。如果工程师的同行正在使用该工具,他们尝试 Copilot CLI 的可能性会显著增加。
- 跨级同行(共享同一位上级经理的同行)表现出最强的信号:同行中使用率超过 25% 与尝试该工具的概率增加 +216% 相关。
- 直属经理的使用情况与初始使用概率增加 +82% 相关。
- 先前的 IDE Copilot 使用情况: 频繁使用 IDE Copilot 的工程师更有可能尝试 Copilot CLI,但不太可能保留它(与留存率呈负相关)。这表明,拥有现有 AI 工作流的工程师可能不会在新的 CLI 工具上建立持久的习惯。
- 基准活动: 基准 PR 活动较高的工程师更有可能尝试并留存该工具。
- 人口统计学特征: 与行为因素相比,职业阶段和工龄对采用和留存的影响极小。初级个人贡献者尝试该工具的可能性略低,而管理者与中级贡献者之间没有显著差异。
对产出的影响
- 持续的生产力提升: 采用者合并的 PR 数量比未使用工具时增加了约 24%。这种提升在四个月的观察期内持续存在,未表现出在以往 IDE 辅助工具研究中观察到的“新颖性消退”现象。
- 剂量-反应关系: 生产力增益随使用强度而增加。每周使用工具 5 天以上的工程师,其合并 PR 的数量比零使用周提升了 +50%。
- 工具对比: Copilot CLI 在 PR 提升方面优于 Claude Code。Copilot CLI 的采用者看到了 +24.9% 的提升,而 Claude Code 的提升为 +11.4%。作者假设这可能是由于组织对齐(微软拥有 GitHub)或任务组合的差异所致。
- 子群收益: 生产力提升并不均匀。
- 职业阶段: 初级个人贡献者和高级管理人员比中级贡献者获得了更大的相对提升。
- 工龄: 工龄极短(<1 年)或极长(>15 年)的工程师比处于中间阶段的工程师看到了更大的提升,但由于入职期的干扰因素,<1 年的结果需谨慎对待。
意义与主张
本文主张,代理式命令行工具既非普遍采用,也非仅仅是新颖效应。
- 战略意义: 组织应将可见的同行使用视为推广策略的核心,因为社交网络比人口统计学目标更能有效驱动采用。
- 价值主张: 合并 PR 数量持续 24% 的增长,为这些工具能够推动具体产出指标提供了直接证据。然而,作者明确指出,吞吐量的增加并不自动等同于价值或软件质量的提升,这仍然是一个开放的研究课题。
- 行为洞察: 留存是由行为(工具如何融入工作流)而非静态属性驱动的。先前使用 IDE Copilot 的用户难以保留 CLI 使用习惯这一发现表明,“首次使用”AI 的用户可能更容易与新的代理式工具形成持久习惯。
研究结论认为,虽然这些工具成功提高了工程速度(以 PR 衡量),但领域内仍需达成共识的衡量标准,以确定这种增加的吞吐量是否带来了更好的软件质量。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。