← 最新论文
💻 computer science

SWE-Together: Evaluating Coding Agents in Interactive User Sessions

本文介绍了 SWE-Together,这是一个源自真实用户-智能体编程会话的多轮基准测试,它利用反应式基于大语言模型(LLM)的用户模拟器,根据最终仓库的正确性以及所需的纠错反馈轮数来评估编程智能体,从而揭示了更强的智能体能以更少的干预实现更高的成功率。

原作者: Yifan Wu, Zhuokai Zhao, Songlin Li, Ho Hin Lee, Jiacheng Zhu, Shirley Wu, Tianhe Yu, Serena Li, Lizhu Zhang, Xiangjun Fan, Shengzhi Li

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Yifan Wu, Zhuokai Zhao, Songlin Li, Ho Hin Lee, Jiacheng Zhu, Shirley Wu, Tianhe Yu, Serena Li, Lizhu Zhang, Xiangjun Fan, Shengzhi Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在招聘一名新的软件工程师。过去,为了测试他们,你会给他们一份编写得完美无缺、长达 10 页的说明书,然后说:“实现这个功能。”你会等待他们完成,查看最终的代码,然后给他们一个评分。如果代码运行成功,他们得 A;如果失败了,他们得 F。

问题所在: 现实生活并不是这样的。在真实的工作中,你不会拥有一份完美的说明书。你从一个模糊的想法开始,工程师构建了一些东西,你意识到你漏掉了一个关键细节,你纠正了他们犯的一个错误,并在中途澄清了你的目标。旧的测试方法并没有衡量工程师处理这种混乱、往复式对话的能力。它们只衡量了最终产品,忽略了在到达终点之前需要多少“手把手”的指导。

解决方案:SWE-Together
这篇论文的作者创建了一个新的测试场,叫做 SWE-Together。把它想象成一个针对编程智能体(AI 程序员)的“可重玩视频游戏”。

它是如何运作的,我们可以将其拆解为简单的部分:

1. 素材来源:真实世界的录像

研究人员并没有发明虚假的测试题,而是去现实世界中“钓鱼”。他们查看了 11,260 段真实人类与 AI 编程助手之间的实际对话。从这堆海量数据中,他们精心挑选了 109 个特定的任务,这些任务非常适合作为测试。

  • 筛选标准: 他们丢弃了那些过于混乱、没有明确目标或无法复现的对话。他们只保留了那些人类目标明确、AI 进行了实质性工作且结果可以被验证的对话。

2. “机器人用户”模拟器

这是最聪明的部分。要测试一个新的 AI,他们不能只是重放旧人类的消息,因为新的 AI 可能会采取不同的路径。如果新的 AI 犯了不同的错误,旧人类的下一条消息可能就无法衔接上了。

因此,他们构建了一个 智能机器人用户

  • 运作方式: 想象一位导演正在观看一场戏。导演完全知道原始人类想要实现什么目标。随着新的 AI 演员进行表演,机器人用户会进行观察。如果 AI 偏离了轨道,或者错过了原始人类会注意到的要点,机器人用户就会介入并说:“等等,我其实是指 X,”或者“你漏掉了 Y。”
  • 目标: 机器人用户表现得就像原始人类一样,但它会根据新 AI 的表现来调整介入的时机。这确保了即使每个 AI 采取的路径不同,它们也是在同一个“意图”下接受测试。

3. 新的评分卡

在旧的测试中,你只有一个分数:代码是否运行成功?
在 SWE-Together 中,他们使用了一份包含两部分的评分卡:

  • A 部分:最终成绩(正确性): AI 最终是否构建出了要求的程序?
  • B 部分:“手把手”得分(用户纠错): 这是重大的创新。他们统计 机器人用户不得不纠正 AI 的次数。
    • 类比: 想象两个学生正在参加数学考试。两人都得到了正确答案。
      • 学生 A 是靠自己搞定的。
      • 学生 B 虽然得到了正确答案,但那是老师在提示了三次并纠正了一个重大错误之后才得到的。
    • 在 SWE-Together 中,学生 A 的得分更高,因为他需要的干预更少。论文中称之为“用户纠错”(User Correction)。

他们的发现

研究人员测试了七个目前最强大的 AI 模型。以下是发生的情况:

  1. 更聪明的 AI 需要更少的帮助: 存在一个明显的模式。更“聪明”的 AI 模型(如 Claude Opus 4.8)获得了更高的最终得分,并且需要来自机器人用户的纠错次数更少。较“弱”的模型得分较低,且需要机器人用户不断地进行提醒和纠正。
  2. 机器人用户具有说服力: 他们测试了人类是否能分辨出机器人用户和真实人类的区别。结果是:人类无法分辨。模拟效果非常好,以至于人类无法可靠地将两者区分开来。
  3. 效率: 一些模型更快且使用的“Token”(单词/计算能力)更少,而另一些模型虽然慢一些,但准确度更高。

核心结论

该论文认为,我们不应该再把 AI 编程员当作是在参加一场带有完美答案解析的闭卷考试。我们需要像测试他们在真实办公室工作一样去测试他们。

SWE-Together 证明了,最好的编程智能体不仅仅是那些最终能修复代码的智能体,更是那些能够倾听、理解模糊指令,并在不需要人类不断介入说“不,我不是那个意思”的情况下,就能自行纠正错误的智能体。

简而言之: 这是一个奖励 AI 成为一名优秀的协作伙伴,而不只是一个优秀的代码生成器的基准测试。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →