← 最新论文
🤖 AI

Coachable agents for interactive gameplay

本文提出了一个结合了通用价值函数近似器与专门训练技术的框架,旨在使强化学习智能体能够在视频游戏和机器人等多样化领域中实现实时的、用户控制的“风格”修改,同时确保它们在适应特定行为偏好的同时保持任务性能。

原作者: Roberto Capobianco (Sony AI, Zurich, Switzerland), Harm van Seijen (Sony AI, North America, various locations), Nolan D. Bard (Sony AI, North America, various locations), Neil Burch (Sony AI, North Am
发布于 2026-07-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Roberto Capobianco (Sony AI, Zurich, Switzerland), Harm van Seijen (Sony AI, North America, various locations), Nolan D. Bard (Sony AI, North America, various locations), Neil Burch (Sony AI, North America, various locations), Fatima Davelouis (Sony AI, North America, various locations), Josh Davidson (Sony AI, North America, various locations), Alisa Devlic (Sony AI, Zurich, Switzerland), Yunshu Du (Sony AI, North America, various locations), Ishan Durugkar (Sony AI, North America, various locations), Siddhant Gangapurwala (Sony AI, North America, various locations), Daniel Hernandez (Sony AI, North America, various locations), G. Zacharias Holland (Sony AI, North America, various locations), Sahil Jain (Sony AI, North America, various locations), Kenta Kawamoto (Sony AI, Tokyo, Japan), Raksha Kumaraswamy (Sony AI, North America, various locations), Patrick MacAlpine (Sony AI, North America, various locations), Dustin R. Morrill (Sony AI, North America, various locations), Declan Oller (Sony AI, North America, various locations), Francesco Riccio (Sony AI, Zurich, Switzerland), Akanksha Saran (Sony AI, North America, various locations), Craig Sherstan (Sony AI, Tokyo, Japan), Kaushik Subramanian (Sony AI, Zurich, Switzerland), Thomas J. Walsh (Sony AI, North America, various locations), Samuel Barrett (Sony AI, North America, various locations), Kizza N. Frisbee (Sony AI, North America, various locations), Mady Govil (Sony AI, North America, various locations), Johannes Günther (Sony AI, North America, various locations), Varun R. Kompella (Sony AI, North America, various locations), James A. MacGlashan (Sony AI, North America, various locations), Maxwell Svetlik (Sony AI, North America, various locations), Michael D. Thomure (Sony AI, North America, various locations), Jaden B. Travnik (Sony AI, North America, various locations), Kevin Waugh (Sony AI, North America, various locations), Elahe Aghapour (Sony AI, North America, various locations), Florian Fuchs (Sony AI, Zurich, Switzerland), Andreanne Lemay (Sony AI, North America, various locations), Shruti Mishra (Sony AI, Zurich, Switzerland), Takuma Seno (Sony AI, Tokyo, Japan), Peter Stone (Sony AI, North America, various locations), Michael Spranger (Sony AI, Tokyo, Japan), Peter R. Wurman (Sony AI, North America, various locations)

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个才华横溢、超级聪明的游戏角色,或者是一个经过训练以赢得胜利的机器人。通常情况下,这些 AI 系统就像是精锐运动员,他们已经掌握了一种特定的、绝对最快、最高效的获胜方式:如果要求它们打扫房间,它们会走一条最完美的路径;如果让它们驾驶赛车,它们每次都会走最完美的赛车线。

但如果你的需求并不是“完美”呢?如果你想让它们像个鲁莽的冒险家一样开车,或者为了不吵醒睡觉的婴儿而安静地打扫房间,又或者让它们只使用某种特定类型的魔法来对抗游戏中的 Boss 呢?

这篇论文介绍了一种新的训练 AI 智能体的方法,通过这种方法,它们可以被“教练”引导,从而在无需从头开始重新训练的情况下,在运行中改变其风格。

以下是他们实现这一目标的步骤,使用了简单的类比:

1. 问题所在:“一招鲜”的运动员

把标准的 AI 智能体想象成一名记住了单圈完美表现的 F1 车手。他们速度极快,但如果你要求他们“像游客一样开车”或“开得激进一点”,他们就不知道该怎么做。他们只知道那一种获胜的最优路径。在现实世界中,用户往往更在意任务是“如何”完成的,而不仅仅是“是否”完成了。

2. 解决方案:“风格教练”

研究人员构建了一个系统,让 AI 学习的是一整个行为家族,而不仅仅是一种行为。他们称之为“风格调节”(Style-Conditioned)学习。

想象一位人类教练在指导运动员。教练不仅仅是说“跑快点”,而是说“跑快点,但手臂放低”或者“跑快点,但转弯幅度大一点”。运动员学会了完成主任务(跑步),但会根据教练的指令调整他们的次要动作(风格)。

在这篇论文中,“教练”是用户在 AI 开始执行任务时给出的指令。AI 有一个“控制旋钮”(称为风格向量),用户可以通过旋转这个旋钮来即时改变其行为。

3. 他们是如何训练 AI 的(训练健身房)

为了教会 AI 这些风格,他们并没有让它进行常规训练。他们创建了特殊的训练场景:

  • 奖励系统: 他们给了 AI 两种类型的分数。
    1. 任务分数: 赢得比赛、击败敌人或向前行走所获得的分数。
    2. 风格分数: 以“某种特定方式”完成任务所获得的分数。例如,“如果你使用火焰箭,获得额外加分”,或者“如果你为了省油而慢速驾驶,获得额外加分”。
  • “通用型”大脑: 他们使用了一种特殊的 AI 大脑(称为 UVFA),这种大脑能够理解“获胜”是目标,但“如何获胜”是可以变化的。这就像一位厨师,他知道如何做出一份美味的牛排(任务),但可以根据顾客的要求,瞬间在用盐、胡椒或松露油之间切换调味方式(风格)。

4. 三次测试驾驶

团队在三个非常不同的世界中测试了这个“可教智能体”(Coachable Agent)框架,以证明它在任何地方都有效:

  • 赛车(《GT赛车 7》):
    他们训练了一个 AI 来驾驶赛车。通常,AI 会为了赢得最快时间而驾驶。有了这个新系统,我们可以告诉 AI:“为了节省燃料而驾驶”或“为了节省轮胎而驾驶”。

    • 结果: AI 学会了通过减慢速度和更加谨慎的驾驶来将燃油续航里程延长 60%,或者通过漂移过弯来展示风格,同时仍能完成比赛。它甚至可以通过旋转一个刻度盘,被指令变为“激进驾驶”或“保守驾驶”。
  • 视频游戏英雄(《地平线:西之绝境》):
    这是重头戏。AI 扮演一名对抗巨大机械生物的英雄。游戏中有很多武器、陷阱和元素力量(火、冰、电)。

    • 结果: 研究人员可以告诉 AI,“仅使用陷阱战斗”或“仅使用火焰武器”,或者“不要使用你的最强武器”。
    • AI 不仅仅是盲目服从;它变得非常聪明。如果被告知使用“冰”,它会先选择一个较弱的冰属性武器来冻结敌人,然后在敌人被冻结时切换到强力武器进行收割。它学会了组合风格,比如同时使用特定的武器和特定的元素效果。
  • 机器人步行者(人形机器人):
    他们训练了一个数字机器人跨越地面行走。

    • 结果: 他们可以告诉机器人以“短步幅”或“长步幅”行走,甚至可以改变其手臂姿态(比如托着托盘或摆动双臂)。机器人可以在保持平衡的同时,瞬间在这些行走风格之间切换。

5. “运行时”控制的魔力

这篇论文最重要的部分在于,用户不需要等待 AI 学习新风格。AI 在训练期间就已经学会了所有的风格。

当用户实际操作或使用机器人时,他们可以即时选择风格。

  • 类比: 想象一个音乐播放器。通常,你需要下载一首新歌才能听到不同的流派。有了这个系统,AI 就像一位 DJ,脑海里装满了所有的流派。你可以按下按钮,它就能瞬间从“爵士乐”(冷静、安全的驾驶)切换到“摇滚乐”(快速、激进的驾驶),而无需停止音乐。

总结

这篇论文表明,我们可以教会 AI 智能体具备灵活性。与其让它成为一个只会按一种方式行事的僵化机器人,这些“可教智能体”可以随时调整它们的个性与策略。无论是节省燃料的赛车、使用特定武器的游戏英雄,还是以特定步态行走的机器人,用户都可以决定任务是“如何”完成的,而不只是“完成”任务本身。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →