← 最新论文
🤖 machine learning

SWE-INTERACT: Reimagining SWE Benchmarks as User-Driven Long-Horizon Coding Sessions

该论文介绍了 SWE-Interact,这是一个评估编码智能体在真实的、多轮的、用户驱动的软件工程任务上表现的新基准,它揭示了在传统的单轮基准测试上的强劲表现并不能可靠地转化为有效进行现实世界开发所需的交互式、迭代式工作流。

原作者: Mohit Raghavendra, Anisha Gunjal, Aakash Sabharwal, Yunzhong He

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Mohit Raghavendra, Anisha Gunjal, Aakash Sabharwal, Yunzhong He

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在雇佣一位才华横溢但缺乏经验的建筑师来建造一座房子。

旧方式(传统基准测试)
在过去,研究人员测试这些 AI“建筑师”的方法是,在第一天就交给它们一份完整的、长达 50 页的蓝图。蓝图列出了每一个细节:木材的类型、油漆的确切色调、每个插座的位置以及水龙头的品牌。AI 的任务仅仅是阅读这份计划并完美地建造出这座房子。

  • 问题所在: 这并不反映真实的建筑过程。在现实世界中,客户很少能准备好一份完美的蓝图。他们通常只会说:“我想要一间温馨的房子,带一个大厨房,”然后随着进度的推进改变主意。

新方式(SWE-INTERACT)
这篇论文引入了 SWE-INTERACT,一种模拟真实建筑项目的测试。

  • 设定: 与完美的蓝图不同,AI 从一个模糊的需求开始:“给我造一座房子。”
  • 客户(模拟器): 一个计算机程序充当“客户”。它不仅仅是坐在一旁观察;它会主动在施工现场走动。
    • 它看着地基说:“嘿,我之前没意识到我想要个地下室。”
    • 它看着厨房说:“实际上,我想把炉灶放在这里,而不是那里。”
    • 它检查着布线并说:“等等,我需要更多插座。”
  • 目标: AI 必须通过倾听这些不断变化的意见、修正错误并逐步建造房屋,从而弄清楚客户“真正”想要的是什么,同时还要应对客户不断增加的新需求。

重大发现
研究人员在两种场景下对世界上最聪明的 AI 编程模型进行了测试。以下是他们的发现:

  1. 擅长阅读,不擅长倾听: 那些在根据完美蓝图盖房(“单轮对话”测试)方面表现出色的模型,在面对客户不断改变主意时,表现却显著下降。它们的成功率从约 50% 降到了 25%
  2. “过度自信”的错误: 最优秀的模型(如 GPT-5.5 和 Opus 4.8)足够大胆,即使在指令模糊的情况下也会开始建造。它们能够进行恢复并在客户纠正时修复问题。然而,它们在试图表现得过于聪明时,往往会忘记之前的指令或犯下技术性错误。
  3. “放弃”的错误: 较弱的模型会被模糊的开端搞糊涂,要么过早放弃,要么完全忽略客户的新指令。

为什么这很重要
把它想象成一个电子游戏。旧的测试就像是一个你已知所有敌人位置和 Boss 长相的关卡。新的测试则像是一个实况角色扮演游戏(LARP),其中的“游戏主持人”(客户)会在你游玩的过程中不断改变剧情。

论文得出结论:成为一名优秀的程序员不仅在于知道如何编写代码(蓝图),还在于是否具备耐心和技巧,去与一个直到看到成品后才知道自己想要什么的真人进行协作。目前的 AI 模型正在向这个方向进步,但在真正取代现实世界中复杂、协作性的真人开发者之前,它们还有很长的路要走。

简而言之: 这篇论文构建了一个新的“健身房”,旨在训练 AI 程序员不仅要学会服从命令,还要学会如何与那些在过程中不断摸索需求的真人进行“协作”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →