LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents
LEGO-RL 是一个通过进程内 LLM 代理、鲁棒的沙盒编排以及集成监控,将原生执行挂钩与策略梯度优化相结合,从而实现编码智能体可扩展强化学习的框架,它在保持高训练-推理一致性的同时,显著提升了模型在不同环境下的 SWE-bench Verified 表现。
原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,研究人员正在教计算机扮演自主软件工程师的角色。这些数字智能体不仅仅是回答问题;它们能够导航复杂的代码库,使用工具修复漏洞,并运行测试以观察其更改是否奏效。为了学习这些技能,这些智能体使用一种称为强化学习的方法。想象一名正在学习解谜的学生:他们尝试一个动作,如果这个动作让他们更接近解决方案,他们就会获得微小的奖励。随着时间的推推移,他们会逐渐明白哪些动作会导致成功。对于编程智能体而言,这个过程涉及生成长序列的动作,观察计算机程序运行,并接收一个简单的“是”或“否”信号,用以指示他们编写的代码是否真的解决了问题。挑战在于,这些智能体在混乱的、现实世界的计算环境中运行,而事情可能会以不可预测的方式出错。如果环境崩溃、奖励系统被误导,或者记录智能体想法的计算机丢失了实际发生的内容,学习过程就会崩溃。智能体可能会学会利用系统的漏洞,或者仅仅因为接收到的反馈不可靠而停止学习。
一个研究团队开发了一个名为 LEGO-RL 的新系统来解决这些特定问题。他们的目标是将现有的、复杂的编程智能体连接到强大的学习算法,而不要求这些智能体改变其工作方式。可以将智能体想象成一名熟练的工人,他知道如何精确地使用一套特定的工具并遵循特定的工作流程。以往尝试训练这些工人的做法通常需要重建他们的整个工作空间以适配训练软件,这经常会导致错误或改变工人的自然行为。LEGO-RL 团队则构建了一座桥梁,让训练软件能够完全按照智能体的原样进行观察,实时捕捉每一个动作和想法,同时保护学习过程免受现实世界混乱的影响。
他们解决方案的核心是一个确保训练计算机看到的与智能体所见所做完全一致的框架。当智能体生成响应时,一个特殊的组件会捕法捕捉原始的词流,以及在任何其他软件对其进行修改或压缩之前,智能体为每个词分配的精确概率。这一点至关重要,因为管理智能体环境的软件通常会重写历史或压缩信息以节省空间。如果训练系统依赖这些被改写过的版本,它将基于对事件的扭曲记忆来计算智能体的学习进度。通过在生成瞬间捕捉数据,研究人员确保了学习信号始终忠实于智能体的实际决策。此外,他们还构建了一个可以重放智能体所做特定内部选择的系统,确保即使是具有多个专门部分的复杂模型也能从正确的路径中学习。
为了保持学习过程的可靠性,团队创建了一个高度组织化的环境,其中每次测试都在各自独立的、安全的容器中运行。这防止了一个损坏的测试导致整个系统崩溃,也阻止了智能体寻找捷径来绕过评分系统。例如,他们在测试期间向智能体隐藏了答案,并确保用于评判工作的软件无法被篡改。他们还设计了让系统能够优雅处理故障的机制。如果智能体陷入困境或环境崩溃,系统会识别问题,丢弃该次特定的尝试,并继续进行,而不会让错误破坏学习数据。这使得即使在复杂的编程任务中频繁发生失败的情况下,训练仍能平稳持续。
研究人员通过使用三种不同的现有编程智能体框架来训练大型语言模型,测试了这个系统。他们发现该系统在所有三种框架下都表现得非常出色。模型的解决现实软件问题的能力显著提升。在使用其中一个流行框架时,成功率从 64% 跳升至 70% 以上;在使用另一个框架时,从 62% 提高到了接近 68%;而在第三个框架下,它从 57% 攀升至接近 67%。至关重要的是,研究人员验证了学习过程是诚实的;智能体所做的行为与训练系统所计算的内容之间的数学关系几乎完美,相关性高于 99%。这证明了该系统不仅仅是运气好,而是确实在从正确的数据中学习。
除了提高分数之外,该系统还提供了一个清晰的窗口,用于观察智能体是如何学习的。研究人员可以实时观察训练过程,看到为什么某个测试失败,或者智能体的行为在数周的训练中是如何变化的。他们观察到,随着智能体的进步,它们开始更频繁地检查自己的工作,阅读它们刚刚编辑过的文件以确保更改是正确的。他们还注意到,智能体开始采取更多步骤来解决问题,通过与计算机进行更长、更复杂的对话来达成解决方案。这种细致程度让研究人员能够快速诊断问题,例如当智能体停止使用工具而开始编写文本时,并据此调整训练。
LEGO-RL 的成功表明,扩展编程智能体的训练规模不仅仅需要更快的计算机或更大的模型。它需要一个既尊重智能体工作流完整性,又能为学习提供稳定、可观察环境的系统。通过构建一个能够忠实捕捉数据、防御错误并提供深度可见性的框架,研究人员展示了教导复杂的软件智能体实现可靠进步是可能的。他们的工作表明,自主编程的未来不在于将智能体强行塞入僵化的模具,而在于构建灵活、鲁棒的系统,使其能够从软件开发的混乱现实中学习。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。