OpenForgeRL: Train Harness-native Agents in Any Environment
OpenForgeRL 是一个开源框架,它通过轻量级代理和 Kubernetes 编排器将推理与训练解耦,实现了在多样化环境中对原生挂载(harness-native)AI 智能体的端到端训练,在复杂的工具和 GUI 基准测试中达到了最先进的性能,同时提供了关于挂载选择和强化学习如何塑造智能体行为的见解。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个计算机不仅仅是回答问题,而是能真正为你做事的世界。它们可以编写代码、预订机票或整理你的数字文件。为了实现这一点,科学家们构建了“AI智能体”——能够思考、规划并使用工具的智能程序。但棘手之处在于:这些智能体并非在真空中工作。它们需要一个“护套”(harness),这就像是一个复杂的控制室或专门的驾驶舱。这个护套负责管理智能体的记忆,将其连接到互联网,并帮助它使用计算器或网络浏览器等工具。把护套想象成飞行员的座椅,而智能体则是飞行员;你不能只在电子游戏中训练一名飞行员,就指望他能驾驶一架真实的波音747。真实的飞机有特定的按钮、应急协议和驾驶舱布局,而这些都是电子游戏从未展示过的。
长期以来,一直存在一个大问题:“电子游戏”(简单的训练环境)与“真实的飞机”(现实世界中使用的复杂护套)并不匹配。研究人员可以轻松地训练智能体,但当他们将智能体放入真实、混乱的护套中时,智能体往往会感到困惑或失败。这篇题为《OpenForge RL》的论文解决了这个完全匹配的问题。它引入了一种全新的方法,让这些数字飞行员直接在它们最终将要飞行的“真实驾驶舱”内进行训练,通过一个系统,让它们可以在不搞垮整个训练设施的前提下,同时在数千种不同的“飞机”上进行练习。
问题所在:在电子游戏中训练 vs. 驾驶真实的飞机
想象一下,你正在试图教一个机器人修理汽车。如果你在一个简单的电子游戏中训练它,其中引擎只是一个红按钮,轮胎只是一个蓝方块,那么机器人学到的就是按下红色并抓取蓝色。但当你把那个机器人放到一个拥有真实引擎、真实轮胎和无数其他工具的真实车库时,它会僵住。它不知道如何处理真实的复杂性。
这就是 AI 智能体一直以来面临的情况。现代智能体非常强大,但它们依赖于复杂的“护套”(如 Claude Code 或 Codex)来管理它们的思考和工具。这些护套就像真实的驾驶舱:它们拥有状态化记忆(记得五步之前发生了什么)、多进程工作流(同时运行多个任务)以及复杂的工具连接。然而,研究人员训练 AI 的标准方式(使用强化学习)通常假设一个简单、扁平的环境。他们试图在简化的护套版本中训练智能体,这造成了“训练-部署不匹配”。这就像是在一个没有真实紧急制动器的模拟器上训练飞行员,然后期望他们在刹车失灵时能降落一架真实的飞机。
解决方案:OpenForge RL(云端车库)
该论文的作者构建了 OpenForge RL,这是一个充当大规模云端车库的框架。OpenForge RL 并没有试图将真实的、复杂的护套强行塞进一个简单的训练盒子里,相反,它采取了相反的做法:它将训练盒发送到真实的护套中去。
以下是它的工作原理,我们使用一个有趣的类比:
- 远程 Pod(云端车库): 想象你拥有一支位于云端的微型自动驾驶车库舰队。每个车库都是一个容器,承载着特定的“护套”(比如某种特定的汽车型号)。OpenForge RL 使用“Kubernetes 编排器”(可以理解为一个超级高效的车库管理员)来即时启动数千个这样的远程车库。
- 代理(双向镜): 在每个车库内部,AI 智能体尝试完成一项任务。一个“轻量级代理”充当了双向镜的角色。它让智能体能够与真实的护套以及真实的环境(如真实的计算机或网络浏览器)进行交互,但同时又在暗中记录下每一次动作、每一个想法和每一次工具点击。
- 训练循环: 代理将这些记录下来的“飞行日志”传回主训练大脑(该大脑使用 veRL 等标准工具)。大脑从这些真实世界的日志中学习,更新智能体的大脑,然后将新版本的智能体再次发送到远程车库中进行尝试。
其神奇之处在于,训练是在真实的护套内、真实的实境中进行的,但管理所有这些不同环境的繁重工作是由云端处理的。这意味着研究人员可以同时在 “ZeroClaw”、“OpenClaw”、“Codex” 甚至视觉 GUI 智能体(使用鼠标和键盘的智能体)上训练智能体,而无需为每种新工具重新编写训练代码。
他们的发现:真实训练效果更好
团队使用两类智能体测试了这个系统:Claw 智能体(使用文本和工具执行任务,如搜索邮件或管理文件)和 GUI 智能体(观察屏幕并使用鼠标点击网页或计算机中的按钮)。
他们仅使用几百到几千个任务就训练了这些智能体——这比一些使用数百万任务的大型模型要少得多。结果令人印象深刻:
- 对于 Claw 智能体: 他们的模型 OpenForge-Claw 在 ClawEval 基准测试中得分 31.7 (pass@3),在 QwenClawBench 中得分 33.7。这显著优于其他规模相近(约 300 亿参数)的开源模型。事实上,它的表现甚至超过了一些规模大出数倍的模型。
- 对于 GUI 智能体: 他们的模型 OpenForge-GUI 在 OSWorld-Verified 上达到了 37.7 分,在 Online-Mind2Web 上达到 63.0 分,在 WebVoyager 上达到 72.3 分。这意义重大,因为 GUI 任务极其困难;智能体必须“看到”屏幕并弄清楚在哪里点击。OpenForge-GUI 匹配甚至超越了许多规模更大且经过更多数据训练的模型。
“护套”的启示:并非所有驾驶舱都是平等的
他们最有趣的发现之一不仅是训练有效,还在于不同的护套是如何影响学习过程的。作者在四种不同的护套中测试了他们的智能体:ReACT(一个简单的循环)、ZeroClaw(轻量级)、OpenClaw 和 Codex(非常复杂)。
他们发现,有些护套比其他护套更难学习。
- 较简单且对齐良好的护套(如 ZeroClaw)允许智能体学习得更快,表现也更好。
- 更复杂的护套(如 Codex)则更难掌握。智能体在其中的挣扎更多,虽然强化学习(RL)有所帮助,但相比于简单的护套,其带来的收益较小。
这表明,“驾驶舱”的设计与飞行员的训练同样重要。一个设计良好的护套能让智能体变得更聪明、更可靠。
RL 究竟教会了智能体什么
作者还仔细观察了在基础训练(SFT)之上添加强化学习(RL)后,智能体究竟学到了什么。他们发现 RL 不仅仅是让智能体在广义上变得“更聪明”;它特别提高了可靠性:
- 自我验证: 智能体开始检查自己的工作。例如,如果它们创建了一个文件,它们更有可能重新读取该文件以确保其正确无误。
- 工具覆盖率: 它们开始使用更多样化的工具,而不是仅仅局限于它们熟悉的那么一两个。
- 错误恢复: 这是最棘手的部分。虽然 RL 帮助智能体从微小的错误中恢复,但错误恢复能力仍然很弱。即使经过训练,如果智能体犯了严重的错误,它们往往无法修复错误,只会直接放弃。作者认为,这项特定技能可能需要专门的数据或不同的训练方法才能掌握。
核心结论
OpenForge RL 证明了你不需要为了训练 AI 智能体而简化现实世界。通过使用一个将训练与环境解耦的云端系统,你可以直接在它们实际使用的复杂、混乱的真实护套中训练智能体。
该论文指出,这种方法允许研究人员构建不仅更具能力,而且在特定工作中更可靠的智能体。虽然智能体在处理复杂的错误恢复方面仍有不足,但与其在“电子游戏”中训练,直接在“真实驾驶舱”中进行训练,是迈出的重要一步。这意味着在未来,我们可能会看到 AI 智能体真正准备好与我们并肩作战,不仅是在模拟器中,而是在我们每天使用的实际数字工具中。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。