← 最新论文
🤖 AI

How AI Coding Agents Communicate: A Study of Pull Request Description Characteristics and Human Review Responses

该研究基于 AIDev 数据集,实证分析了五种 AI 编程代理生成的拉取请求描述特征及其对人类审查者互动行为与合并结果的影响,揭示了不同代理在呈现风格上的差异如何显著影响人机协作效率。

原作者: Kan Watanabe, Rikuto Tsuchida, Takahiro Monno, Bin Huang, Kazuma Yamasaki, Youmei Fan, Kazumasa Shimari, Kenichi Matsumoto

发布于 2026-02-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Kan Watanabe, Rikuto Tsuchida, Takahiro Monno, Bin Huang, Kazuma Yamasaki, Youmei Fan, Kazumasa Shimari, Kenichi Matsumoto

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在观察一场**“机器人与人类程序员之间的相亲大会”**。

想象一下,GitHub(一个全球最大的代码共享社区)是一个巨大的**“代码集市”**。以前,只有人类程序员在这里摆摊,写代码、提交修改(Pull Request,简称 PR),然后等待其他人类“摊主”来检查、挑刺或点赞。

但现在,AI 编程助手(比如 GitHub Copilot、Devin 等)也加入了集市。它们不仅能写代码,还能自动把修改好的代码打包成一个“摊位申请”,提交给人类审核。

这篇研究就是去观察:这些 AI 机器人是怎么写“摊位申请书”(PR 描述)的?人类审核员看到这些申请书时,反应有什么不同?

🕵️‍♂️ 研究背景:为什么我们要关心这个?

以前我们只关心 AI 写的代码**“对不对”(功能有没有 Bug)。但研究发现,即使代码是对的,如果 AI 写申请书的方式让人看不懂,或者态度让人不舒服,人类审核员也会拒绝**它,或者花很长时间才通过。

这就好比:你写了一封求职信,虽然你能力很强,但如果你把信写得乱七八糟,或者语气傲慢,HR 可能根本不想读,直接把你拒之门外。

🔍 他们做了什么?(研究方法)

研究人员收集了5 种不同的 AI 机器人(Claude Code, GitHub Copilot, Cursor, Devin, OpenAI Codex)提交的3 万多个“摊位申请”。

他们主要看了两件事:

  1. 申请书长什么样?(AI 是怎么描述的:是长篇大论?还是列了清单?有没有用表情符号?有没有礼貌用语?)
  2. 人类审核员怎么反应?(审核员是秒回还是几天才回?是夸它还是骂它?最后这个申请是通过了,还是被扔进了垃圾桶?)

💡 核心发现:机器人性格大不同

研究发现,这 5 个 AI 机器人就像5 种性格迥异的求职者,它们的表现大不相同:

1. 不同的“写作风格”

  • OpenAI Codex(优等生): 它的申请书结构最清晰。它喜欢用标题、列表,像写教科书一样条理分明。人类审核员最喜欢它,因为它让人一眼就能看懂。
  • GitHub Copilot(话痨): 它写的字最多,代码块也塞得满满当当。虽然内容多,但人类审核员觉得太啰嗦,反而不容易抓重点。
  • Cursor(礼貌怪人): 它写的代码不多,但特别有礼貌(满篇“请”、“谢谢”)。虽然态度好,但审核员反而对它最挑剔,负面评价最多。
  • Devin(碎碎念): 它喜欢把一个大任务拆成几十个小步骤(提交很多次),让审核员不得不点很多次鼠标去检查,非常累人。
  • Claude Code(实干家): 它写的字很多,但喜欢用表情符号来增加可读性,审核员对它的反馈比较积极。

2. 人类的“反应”

  • 谁最受欢迎? OpenAI CodexCursor通过率最高。OpenAI Codex 因为结构清晰,审核最快;Cursor 虽然被骂得最惨(负面评论多),但因为修改得少,反而很快就被接受了。
  • 谁最倒霉? GitHub Copilot 虽然讨论最热烈(评论最多),但通过率最低,而且审核时间最长。这说明人类审核员被它冗长的描述搞得晕头转向,最后反而不想通过了。
  • 情绪的影响: 有趣的是,审核员的情绪(是开心还是生气)并不直接决定代码能不能通过。有时候审核员骂得很凶(负面评论),但代码质量高,最后还是通过了;有时候审核员客客气气(中性评论),但代码太烂,最后还是被拒了。

🎯 结论与启示:AI 该怎么“说话”?

这篇论文告诉我们一个重要的道理:在人类和 AI 合作的世界里,代码写得好只是及格线,会“沟通”才是加分项。

  • 结构就是效率: 如果 AI 能把修改说明写得像**“带目录的说明书”**(用标题、列表),人类审核员就能更快看懂,审核速度就会变快。
  • 礼貌不是万能的: 光说“请”和“谢谢”没用,如果内容乱七八糟,人类还是会烦。
  • 不要过度解释: 像 GitHub Copilot 那样把代码堆得满满当当,反而是一种负担。

一句话总结:
AI 机器人要想在人类程序员的世界里混得好,不能只靠“代码写得好”,还得学会**“把话说明白”**。就像在集市上摆摊,不仅货要好,招牌和说明书也得写得让人一眼就能看懂,生意才能做成!

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →