← 最新论文
💻 computer science

SWE-Bench Mobile: Can Large Language Model Agents Develop Industry-Level Mobile Applications?

本文介绍了 **SWE-Bench Mobile**,这是一个基于真实 iOS 生产代码库构建的基准测试,旨在评估大模型智能体在处理包含多模态输入和大规模混合代码库等复杂工业级移动应用开发任务时的能力,研究发现现有智能体在处理此类任务时仍面临巨大挑战。

原作者: Muxin Tian, Zhe Wang, Blair Yang, Zhenwei Tang, Kunlun Zhu, Honghua Dong, Hanchen Li, Xinni Xie, Guangjing Wang, Jiaxuan You

发布于 2026-02-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Muxin Tian, Zhe Wang, Blair Yang, Zhenwei Tang, Kunlun Zhu, Honghua Dong, Hanchen Li, Xinni Xie, Guangjing Wang, Jiaxuan You

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇文章介绍了一个名为 SWE-Bench Mobile 的新研究。如果我们要用大白话来解释,可以把它想象成一场**“AI 程序员的‘大厂实战模拟考’”**。

以下是为你准备的通俗版解读:

1. 背景:现在的 AI 程序员,只是“做题家”吗?

想象一下,现在的 AI(比如 ChatGPT、Claude)就像是一个非常聪明的**“刷题高手”**。你给它一道数学题,或者一段简单的代码,它能写得飞快,准确率极高。

但是,真正的**“高级工程师”**在公司里是怎么工作的呢?他们不是只写一行代码,他们需要:

  • 看懂需求文档(PRD): 读懂产品经理那长达几千字的“碎碎念”。
  • 看懂设计稿(Figma): 盯着设计师画的精美图片,把颜色、间距、按钮位置一个不差地还原出来。
  • 在“迷宫”里找代码: 公司的代码库像一座巨大的、有几十万个房间的迷宫,你得找到正确的房间才能改东西。
  • 多线作战: 改一个功能,可能得同时动 5 个甚至 10 个不同的文件,还得保证改完后别的零件不会坏掉。

问题来了: 现在的 AI 真的能胜任这种“大厂搬砖”的工作吗?


2. 这个研究做了什么?(模拟考场搭建)

研究人员觉得,现有的考试太简单了,全是“填空题”。于是他们决定搞一个**“超级模拟考”**。

他们从一家拥有 3 亿用户的社交大厂(小红书)里,拿出了真实的、正在使用的 iOS 开发任务。

  • 考卷内容: 不只有代码,还有产品经理写的文档、设计师画的图、以及一个足足 5GB 大小的、极其复杂的代码“迷宫”。
  • 考试要求: AI 不能只写一段代码,它必须提交一个“补丁”(Patch),就像给软件打补丁一样,改完后必须通过一系列严格的自动化测试,证明功能真的做对了。

3. 考试结果:AI 表现如何?(现实很骨感)

结果非常令人意外:目前的 AI 程序员,在面对这种“实战”时,表现得相当吃力。

如果把这次考试的最高分(12%)比作及格线,那么大部分 AI 甚至连“及格”都不到。

我们可以用一个**“装修工”**的比喻来理解 AI 的失败:

  • “只改了一半”: 你让 AI 装修整个厨房,它把橱柜刷好了,但忘了换水龙头,也忘了装灯泡。在代码里,这叫“文件覆盖不全”。
  • “看不懂图纸”: 你给它一张精美的装修效果图,它虽然把柜子做出来了,但颜色和尺寸跟图纸完全对不上。这叫“多模态理解能力不足”。
  • “不懂规矩”: 在大厂里,改代码有个规矩叫“功能开关”(Feature Flag),就是改完后先别急着全量上线,得有个开关慢慢试。AI 经常忘了加这个开关,这在现实中是非常危险的。

4. 核心发现(给 AI 界的“避坑指南”)

研究人员还发现了一些很有趣的现象:

  1. “工具比大脑更重要”: 同样的“大脑”(比如 Claude 4.5 模型),装在不同的“身体”(不同的 AI 助手软件,如 Cursor vs OpenCode)里,表现天差地别。有的能拿 12 分,有的只能拿 2 分。这说明给 AI 配什么样的工具、怎么教它用工具,跟它本身聪不聪明一样重要。
  2. “简单指令胜过复杂指令”: 很多人觉得给 AI 写长篇大论的指令(Prompt)效果更好,但研究发现,告诉它“写代码要考虑各种意外情况(防御性编程)”这种简单的叮嘱,反而比写一大堆复杂的流程说明更管用。

5. 总结:未来在哪里?

结论是: 现在的 AI 程序员还不能直接“接管”工作,它们目前更像是一个**“实习生”或者“副驾驶”**。

它们能帮你写写简单的逻辑,但如果你想让它们独立完成一个复杂的移动端 App 功能,它们还是会“掉链子”。

这个研究的意义在于: 它给全世界的 AI 开发者立了一个**“硬指标”**。它告诉大家:别再只盯着那些简单的数学题了,真正的挑战在于如何让 AI 真正走进复杂的、真实的代码世界里去。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →