← 最新论文
🤖 AI

AliyunConsoleAgent: Training Web Agents in Real-World Cloud Environments via Distillation and Reinforcement Learning

本文介绍了 AliyunConsoleAgent,这是一个具有成本效益的网络智能体框架,它通过结合在蒸馏轨迹上的监督微调以及在真实环境中结合鲁棒奖励机制的强化学习的双阶段训练范式,在验证云控制台文档方面达到了接近最先进的性能。

原作者: Bojie Rong, Zheyu Shen, Qiaoping Wang, Pengfei Kang, Yang Xu, Yawen Wei, Hanyu Wu, Zhi Zhao, Leihao Pei, Linquan Jiang

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Bojie Rong, Zheyu Shen, Qiaoping Wang, Pengfei Kang, Yang Xu, Yawen Wei, Hanyu Wu, Zhi Zhao, Leihao Pei, Linquan Jiang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位规模宏大、时刻在变化的游乐园(云控制台)的经理。每天,公园都会增加新的游乐设施、更换售票亭并更新安全规则。与此同时,编写指南手册(文档)的是另一个团队,他们更新速度较慢,且主要靠人工手动完成。

问题所在:
由于公园变化极快,指南手册很快就会过时。书中的某一步骤可能会说“点击蓝色按钮”,但在实际的公园里,这个按钮现在变成了红色,或者已经被触摸屏取代了。
逐一检查指南手册中的每一条指令是否与真实的公园相符是一场噩 quite 噩梦。这需要人类团队每年花费数百万小时,而目前他们只能检查约 1% 的指令。如果他们不进行检查,顾客就会迷路并感到沮丧。

旧方案(以及它为何失败):
公司曾尝试雇佣“超级智能机器人”(前沿专有模型)。这些机器人极其聪明,能够阅读指南手册并在公园中完美导航。然而,它们成本极高(就像为每一次检查都聘请一支博士团队),而且存在风险(你必须向它们展示私密的公园地图,这违反了安全规则)。你无法负担为完成数百万次检查所需的成本。

新方案:AliyunConsoleAgent
作者开发了他们自己的“可训练机器人”(一个拥有 320 亿参数的 AI 模型),它运行起来更便宜,也更安全,可以在他们自己的服务器上运行。但标准的机器人并不足够聪明,无法处理变化多端的游乐园。因此,他们使用了两步训练法:

1. “影子阶段”(监督微调)

首先,他们让超级智能机器人担任新机器人的影子

  • 类比: 想象一位大师级厨师(超级机器人)正在烹饪一道复杂的菜肴。新机器人通过观察大师,记住了每一次切菜、搅拌和调味的步骤。
  • 结果: 新机器人学会了在公园中导航的基础知识并遵循指令。它变得相当出色,但它仅仅是在模仿。如果公园发生了轻微变化,它会感到困惑,因为它并不真正“理解”目标,它只是在记忆步骤。

2. “试错阶段”(强化学习)

接下来,他们让机器人在一个模拟版本的公园中通过实践来学习。

  • 挑战: 在真实的云环境中,机器人的失败往往不是因为笨,而是因为“公园”还没准备好。例如,它试图删除一台服务器,但该服务器尚未创建。如果机器人因此受到惩罚,它会学到错误的教训(认为自己不擅长删除服务器),而不是正确的教训(它应该先构建服务器)。
  • 解决方法(高确定性展开): 团队使用 Terraform(一种像搭乐高一样构建基础设施的工具)构建了一个特殊的“训练场”。在机器人尝试执行任务之前,该系统会自动构建精确的前置条件(例如构建服务器、设置网络),以便机器人只要做出正确的动作就能成功。
  • 奖励机制: 他们没有使用人类来给机器人评分,而是使用了一个双通道裁判
    1. 规则检查器: 它查看官方的“审计日志”(相当于公园的安全监控录像),查看操作是否真的发生了。服务器是否被删除了?是/否。这是 100% 客观的。
    2. 专家评审团: 如果没有明确的日志,两个其他的 AI 模型会充当裁判。只有当两者都认为机器人成功时,才会给出“通过”的判定。这防止了机器人通过“作弊”或欺骗单个裁判来获益。

结果

经过这种训练,机器人从一个盲目跟随者进化成了一个自主问题解决者

  • 之前: 如果指南说“关闭自动续费”,但开关已经是关闭状态,机器人只会停下来并说“我无法执行”。
  • 之后: 机器人会思考:“等等,如果开关已经是关着的,我无法执行‘关闭’操作。我需要先把它‘打开’,然后才能执行‘关闭’,以此证明我确实完成了操作。”它自己悟出了其中的逻辑。

核心结论:

  • 性能: 他们的新机器人(AliyunConsoleAgent-32B)几乎与昂贵的“超级机器人”一样出色(差距仅为 1.8%)。
  • 成本: 运行成本降低了 92%
  • 影响: 他们利用该系统审计了超过 54,000 条指令,并发现了近 4,400 个真实错误,供产品团队进行修复。

简而言之,他们通过让一个机器人通过“影子”学习天才,并在一个准备完美的“训练场”中通过实践纠正错误(而不受控于自身之外因素的惩罚),从而教会了一个本地化、低成本的机器人如何像天才一样思考。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →