← 最新论文
💻 computer science

SWE-chat: Coding Agent Interactions From Real Users in the Wild

该论文介绍了 SWE-chat,这是首个从开源开发者真实工作流中收集的大规模 AI 编程代理交互数据集,揭示了当前代理在“氛围编程”与人工主导之间的双峰分布模式,并指出其产出代码存活率低、安全漏洞多且常需用户频繁修正等现实局限性。

原作者: Joachim Baumann, Vishakh Padmakumar, Xiang Li, John Yang, Diyi Yang, Sanmi Koyejo

发布于 2026-04-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Joachim Baumann, Vishakh Padmakumar, Xiang Li, John Yang, Diyi Yang, Sanmi Koyejo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲述了一个关于**"AI 编程助手”在真实世界中如何被使用**的大调查。

想象一下,你请了一位超级能干的**“数字实习生”**(AI 编程代理)来帮你写代码。以前,我们只知道这个实习生在“模拟考场”(实验室测试)里表现很好,能解出各种难题。但没人知道,当它真正进入你的“办公室”(真实的开源项目),和你一起工作时,到底发生了什么。

斯坦福大学的研究团队做了一个大胆的实验:他们开发了一个叫 Entire.io 的工具,就像给这位“数字实习生”装上了一个**“黑匣子记录仪”**。这个工具悄悄记录了 200 多个开源项目中,6000 多次真实的“人机协作”过程。他们把这些数据整理成了一个新的数据集,叫 SWE-chat

这篇论文就是他们分析这些“黑匣子”数据后,讲给世界听的**“职场真相”**。

以下是用通俗语言和比喻总结的四个核心发现:

1. 两种极端的工作模式:要么“甩手掌柜”,要么“亲力亲为”

研究发现,人类和 AI 的合作方式非常两极分化,就像走钢丝:

  • “氛围编程” (Vibe Coding): 占 41%。这就像你完全信任实习生,把任务丢给他,说:“帮我搞定这个功能,你看着办。”然后你几乎不碰键盘,最后代码全是 AI 写的。
  • “纯手工模式”: 占 23%。你只把 AI 当个“查字典”的,代码全是你自己敲的,AI 只负责解释一下。
  • 真相: 真正的“人机协作”(你写一部分,AI 写一部分)其实并没有想象中那么普遍。大家要么完全依赖 AI,要么完全靠自己。

2. AI 写的代码,有一半是“次品”

虽然 AI 很厉害,但它写的代码并不都能直接上线。

  • 存活率低: 只有 44% 的 AI 生成代码最终被人类保留并提交了。这意味着,AI 写了 100 行代码,人类最后只挑了 44 行用,剩下的 56 行都被人类删掉或重写成了。
  • 比喻: 就像 AI 是个不知疲倦的**“疯狂厨师”**,它一口气做了 10 道菜,但只有 4 道是你觉得能吃的,剩下的都被你倒掉了。

3. “甩手掌柜”模式既贵又危险

当人们选择完全让 AI 写代码(“氛围编程”)时,代价很大:

  • 更费钱、更费时间: 这种模式下,每写出一行可用的代码,消耗的计算资源(Token)和金钱是正常协作模式的 3 倍
  • 更不安全: 这是最惊人的发现。AI 独立写的代码,引入安全漏洞(比如让黑客能轻易入侵的后门)的概率,是人类自己写的代码的 9 倍,是“人机协作”模式的 5 倍
  • 比喻: 让 AI 独自“甩手掌柜”式工作,就像让一个**“不懂交通规则的新手司机”**独自开快车。虽然速度快,但撞车(出安全漏洞)的概率极高,而且修车的成本(浪费的金钱和时间)也更高。

4. 人类并没有“躺平”,而是在疯狂“纠错”

很多人以为 AI 越聪明,人类就越轻松。但数据表明:

  • 人类很“挑剔”: 在 44% 的交互回合中,人类都在**“怼”AI**。他们会打断 AI,指出错误,或者重新下达指令。
  • AI 很少提问: 尽管人类在疯狂纠错,但 AI 却很少主动停下来问:“老板,你确定要这么做吗?”(只有不到 2% 的情况会主动提问)。
  • 比喻: 这就像你雇了一个**“话痨且固执的实习生”**。他一直在埋头苦干,但你发现他方向错了,不得不一次次把他叫停、纠正。而他却很少抬头问你:“老板,我是不是搞错了?”

总结:我们该怎么做?

这篇论文告诉我们,AI 编程助手目前还像个“天才但鲁莽的实习生”

  • 不要完全放手: 完全依赖 AI 写代码(Vibe Coding)虽然看起来很酷,但效率低且风险大。
  • 最好的模式是“师徒制”: 人类和 AI 共同编写代码(Collaborative Coding)是最安全、最省钱、最高效的。人类负责把控方向和审查,AI 负责执行细节。
  • 未来的方向: 我们需要训练 AI 学会**“多问一句”**,在犯错前停下来确认,而不是盲目地继续写代码。

一句话总结: AI 编程很强大,但它还不是完美的“替身”。在真实世界里,人类必须保持“驾驶位”的掌控权,时刻盯着 AI 这个“副驾驶”,才能把车开得又快又稳。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →