← 最新论文
💻 computer science

Training One Model to Master Cross-Level Agentic Actions via Reinforcement Learning

本文介绍了 CrossHA,这是一种通过结合监督微调与多轮组相对策略优化(Multi-Turn Group Relative Policy Optimization)的新型流水线进行训练的统一智能体模型,该模型能够自主选择并切换异构动作空间,从而在 Minecraft 环境中动态、长程的任务中实现了最先进的性能和适应性。

原作者: Kaichen He, Zihao Wang, Muyao Li, Anji Liu, Yitao Liang

发布于 2026-06-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Kaichen He, Zihao Wang, Muyao Li, Anji Liu, Yitao Liang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人玩《我的世界》(Minecraft)。在过去,研究人员必须为游戏的各个部分构建不同的“大脑”。一个大脑擅长行走(使用简单的、分步的指令),另一个大脑擅长点击菜单(使用精确的鼠标移动),还有第三个大脑擅长使用高级快捷方式(比如“前往最近的树木”)。

问题在于,这些机器人非常僵化。如果一个任务需要先行走然后再点击菜单,机器人就会感到困惑或陷入停滞,因为它在同一时间只能使用一种类型的“语言”。

核心理念:“瑞士军刀”智能体

这篇论文介绍了一种名为 CrossHA 的新型 AI 智能体,它就像一位拥有完整厨房的大厨。它不再被迫只能使用勺子或只能使用刀具,而是学会了观察食材(任务)并立即决定:“我现在需要粗略地剁一刀(简单的移动),还是精细地切一片(精确的点击)?”

它是第一个能够无缝切换不同“动作语言”的模型,且无需人类在每一步都告诉它该用哪种语言。

他们是如何教它的(训练配方)

研究人员并没有只是将数据倾倒给模型;他们使用了一个三阶段的训练流水线,类似于人类学习复杂技能的过程:

  1. “品尝”阶段(监督微调):
    首先,他们向模型展示了数千个人类使用不同方法玩游戏的例子(有些人在走路,有些人在点击,有些人在使用快捷方式)。这里的目标仅仅是教会模型理解所有这些不同方法的“词汇量”,以便它能理解它们。这就像是在教一个学生阅读英语、西班牙语和法语,但还没有要求他们写故事。

  2. “冲刺”阶段(单回合强化学习):
    接下来,他们给了模型一些简短的、单步的挑战。如果模型尝试使用错误的“语言”来解决问题(例如,试图通过走动穿过一扇锁着的门,而不是点击把手),它会得到低分。如果它选择了正确的工具来完成工作,它就会得到奖励。这教会了模型如何在单个时刻快速、聪明地做出关于“选择哪个工具”的决策。

  3. “马拉松”阶段(多回合强化学习):
    最后,他们让模型进行完整的、长期的游戏。目标不仅仅是做对一步,而是高效地完成整个任务。模型学会了有时使用“快速但粗略”的方法更适合穿越一片田野,但切换到“缓慢但精确”的方法对于制作一件精致的物品则是必要的。它学会了在漫长的旅程中平衡速度与精度。

结果:为什么这很重要

研究人员在《我的世界》中超过 800 个不同的任务上测试了这个模型,范围涵盖了从砍伐树木到制作复杂物品以及战斗怪物。

  • 旧方法: 仅针对单一方法(如仅限行走)进行训练的机器人,在行走方面表现出色,但在制作方面表现糟糕。它们就像是一个只知道跑步却不知道如何开门的人。
  • CrossHA 方法: 这个新模型在所有方面都是最好的。它不仅仅是平均得分高,更因为它知道何时切换档位。

“聪明驾驶员”的类比:
想象一下开车。

  • 固定动作机器人 就像是一个只知道在高速公路上行驶的司机。如果遇到土路,他们会翻车;如果遇到停车场,他们会迷失方向。
  • CrossHA 则像是一位熟练的驾驶员,知道何时在高速公路上挂高档以提高效率,以及何时换成低档并小心转向以应对狭窄的停车位。它不需要副驾驶告诉它何时换挡,它能感知路况并自我调节。

总结

论文声称,通过训练一个模型来掌握所有这些不同的“动作空间”,并通过强化学习(通过奖励进行的试错法),他们创造出了一个比以往那些受限于单一动作类型的模型更聪明、更灵活、更高效的智能体。

他们通过展示该模型能够处理《我的世界》中超过 800 个复杂的挑战,并表现优于所有现有方法,证明了这一点。目前,代码和模型已向公众开放。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →