← 最新论文
🤖 machine learning

Composer 2 Technical Report

本文介绍了专为代理软件工程设计的 Composer 2 模型,该模型通过持续预训练和大规模强化学习显著提升了长期规划与多步执行能力,并在 CursorBench 及 SWE-bench 等基准测试中达到了业界领先的性能水平。

原作者: Cursor Reseach, :, Aaron Chan, Ahmed Shalaby, Alexander Wettig, Aman Sanger, Andrew Zhai, Anurag Ajay, Ashvin Nair, Charlie Snell, Chen Lu, Chen Shen, Emily Jia, Federico Cassano, Hanpeng Liu, Haoyu
发布于 2026-03-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Cursor Reseach, :, Aaron Chan, Ahmed Shalaby, Alexander Wettig, Aman Sanger, Andrew Zhai, Anurag Ajay, Ashvin Nair, Charlie Snell, Chen Lu, Chen Shen, Emily Jia, Federico Cassano, Hanpeng Liu, Haoyu Chen, Henry Wildermuth, Jacob Jackson, Janet Li, Jediah Katz, Jiajun Yao, Joey Hejna, Josh Warner, Julius Vering, Kevin Frans, Lee Danilek, Less Wright, Lujing Cen, Luke Melas-Kyriazi, Michael Truell, Michiel de Jong, Naman Jain, Nate Schmidt, Nathan Wang, Niklas Muennighoff, Oleg Rybkin, Paul Loh, Phillip Kravtsov, Rishabh Yadav, Sahil Shah, Sam Kottler, Alexander M Rush, Shengtong Zhang, Shomil Jain, Sriram Sankar, Stefan Heule, Stuart H. Sul, Sualeh Asif, Victor Rong, Wanqi Zhu, William Lin, Yuchen Wu, Yuri Volkov, Yury Zemlyanskiy, Zack Holbrook, Zhiyuan Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这是一份关于 Composer 2 的技术报告,你可以把它想象成 Cursor 团队给他们的“超级编程助手”写的一份成长日记

简单来说,Composer 2 不再仅仅是一个会写代码的“打字员”,它进化成了一个能独立解决复杂工程问题的“资深工程师”

为了让你更容易理解,我们用几个生活中的比喻来拆解这份报告的核心内容:

1. 它是怎么变强的?(两阶段训练法)

想象一下,要培养一个顶尖的程序员,光靠看书是不够的,还得有实战。Composer 2 的训练分成了两步:

  • 第一阶段:疯狂“刷题”与“读书”(持续预训练)

    • 比喻:就像让一个大学生先读遍图书馆里所有的编程书、代码库和文档。
    • 做法:团队选了一个底子很好的模型(Kimi K2.5),然后给它喂了海量的代码数据。这不仅仅是让它认识单词,而是让它理解代码背后的逻辑、架构和“行规”。
    • 目的:把它的“知识库”填满,让它从“初学者”变成“博学专家”。
  • 第二阶段:在“模拟战场”里打怪升级(强化学习 RL)

    • 比喻:光有理论不行,得去实战。这就好比让这位专家进入一个高度逼真的虚拟游戏,里面全是真实的编程任务(比如修 Bug、加新功能、重构旧代码)。
    • 做法
      • 模型会尝试去解决问题,就像玩家在游戏里尝试不同的打法。
      • 如果它做对了,就给它发“糖果”(奖励);如果做错了,或者绕了弯路,就让它“扣分”。
      • 最关键的是,这个“游戏”的环境和 Cursor 用户实际用的软件一模一样。它不是在解抽象的数学题,而是在真实的代码库里“搬砖”。
    • 结果:通过成千上万次的试错,它学会了如何像人类工程师一样规划步骤调试错误,甚至知道什么时候该停下来思考,而不是盲目乱写。

2. 它有什么特别的本领?

  • 超长记忆与“做笔记”的能力(自总结)

    • 比喻:人类记不住太长的对话,但 Composer 2 学会了“做笔记”。
    • 做法:当任务非常长(比如要改几千行代码)时,它会在过程中不断生成“摘要”,把之前的关键信息浓缩成几句话,存进“短期记忆”里。这样即使任务很长,它也不会“忘乎所以”,能保持逻辑连贯。
  • 懂得“看人下菜碟”(智能奖惩机制)

    • 比喻:它知道什么时候该“快”,什么时候该“慢”。
    • 做法
      • 如果是简单的改错,它被鼓励秒回,不拖泥带水。
      • 如果是复杂的难题,它被允许多思考一会儿,多尝试几种方案。
      • 如果它写了一堆没用的废话,或者把任务搞砸了,系统会惩罚它。这让它学会了高效且精准地工作。

3. 它是怎么被测试的?(CursorBench)

以前的测试就像是在做“标准化试卷”(比如 SWE-bench),题目都很死板,答案唯一。但这和真实工作不一样。

  • 真实世界的挑战
    • 比喻:以前的考试是“填空题”,题目说“把 A 改成 B"。而 Composer 2 面对的是“开放式项目”,老板只说了一句:“这个系统有点慢,你帮我看看怎么回事。”
    • CursorBench:这是团队自己搞的一套真实场景测试。任务来自他们工程师真实的日常需求:
      • 提示语很模糊(只有几句简短的报错)。
      • 需要修改的代码量巨大(平均要改 181 行代码,而普通测试只改几行)。
      • 需要去查日志、看文档、甚至去网上搜资料。
    • 结果:在这样的高难度“实战”中,Composer 2 的表现远超以前的版本,甚至能和最顶尖的通用大模型(如 GPT-5 系列)掰手腕,而且成本更低

4. 它的“超能力”背后是什么?(基础设施)

为了支撑这种高强度的训练,团队搭建了一个超级工厂

  • 分布式训练:就像几千个工人同时在不同的车间里干活,但通过高速网络实时同步进度。
  • 故障自愈:如果某个机器坏了,系统会自动把任务转移到其他机器上,就像交通堵塞时自动变道,保证训练不中断。
  • 真实环境模拟:它不是在空荡荡的房间里练习,而是在一个完全模拟真实开发环境的容器里训练,里面装了真实的浏览器、终端和代码库。

总结:这意味着什么?

Composer 2 不仅仅是一个更聪明的聊天机器人,它是一个真正的“代理(Agent)”。

  • 以前:你问它,它答你。你让它写个函数,它给你代码。
  • 现在:你告诉它一个模糊的目标(比如“修复这个生产环境的崩溃”),它能自己规划自己查错自己写代码自己测试,直到把问题解决。

核心启示
这篇报告告诉我们,要让 AI 真正帮人类干活,不能只靠“背更多的书”(增加数据量),更重要的是在真实的工作环境中进行“实战演练”(强化学习),并且要专门针对特定领域(编程)进行深度定制

这就好比,与其让一个博学家去当外科医生,不如专门培养一个在手术室里摸爬滚打了几万小时的专科医生。Composer 2 就是这样一位专攻软件工程的“超级实习生”,而且它已经能独当一面了。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →