← 最新论文
🤖 machine learning

ASH: Agents that Self-Hone via Embodied Learning

原作者: Benjamin Schneider, Xavier Schneider, Victor Zhong, Sun Sun

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Benjamin Schneider, Xavier Schneider, Victor Zhong, Sun Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图学习如何玩一款非常漫长且复杂的电子游戏,比如《宝可梦》或《塞尔达传说》,但你没有说明书,没有老师,也没有人告诉你该按哪些按钮。大多数试图做到这一点的计算机程序在几个小时后就会陷入停滞,因为它们依赖于预先编写的规则或人类精心标注的海量数据。

这篇论文介绍了一种名为ASH(通过具身学习自我打磨的智能体)的新系统。不要把 ASH 想象成遵循脚本的机器人,而要把它想象成一个懂得使用谷歌的求知人类玩家

以下是 ASH 的工作原理,分解为简单步骤:

1. “卡住”的时刻

ASH 开始玩游戏。它拥有短期记忆(过去 30 秒内发生的事情)和长期记忆(它以前见过的重要时刻)。它会一直玩下去,直到撞上墙壁。也许它不知道如何与怪物战斗,或者不知道在迷宫中该走哪条路。用论文中的术语来说,就是它“卡住”了。

2. “谷歌搜索”

当 ASH 卡住时,它不会放弃。相反,它会查看屏幕上刚才看到的内容,然后前往互联网(具体来说,是一个庞大的 YouTube 视频集合),寻找其他人玩该游戏的视频。它会搜索那些与它当前卡住的时刻看起来完全一样的视频。

3. “智能过滤器”

互联网充满了噪音。ASH 不会随意观看视频;它使用一种特殊工具来寻找关键时刻。想象一下观看一个长达 20 小时的游戏视频;你不需要看完整个视频就能学会如何打 Boss。你只需要看到那特定的 30 秒,即他们想出策略的那段时间。ASH 会自动找到这些“高光集锦”,并将它们保存到其长期记忆中。

4. “逆向工程”

这里是棘手之处:ASH 找到的互联网视频通常只显示屏幕,而不显示按键操作。ASH 拥有一个“翻译器”(称为逆动力学模型),它会观察视频并推测:“好吧,要从这个画面变成那个画面,玩家一定按了'A'键,然后按了‘上’键。”它将无声的视频转化为一系列指令。

5. “自我提升”循环

现在,ASH 利用这些新指令进行练习。它会更新自己的“大脑”(即其策略),以便下次卡住时知道该怎么做。然后它继续玩游戏。如果稍后在另一个问题上再次卡住,它会重复整个过程:卡住、搜索互联网、学习技巧,然后继续前进。

结果:为何这很重要

研究人员在两款截然不同的游戏中测试了 ASH:

  • 《宝可梦 绿宝石》:一款策略游戏,你需要旅行、捕捉怪物并进行战斗。
  • 《塞尔达传说:缩小帽》:一款动作游戏,你需要奔跑、跳跃、解谜并在实时中对抗敌人。

他们将 ASH 与其他人工智能方法进行了比较:

  • “教科书”式学习者:这些系统试图从大量预标注的动作数据集中学习。由于无法处理以前未见过的情况,它们很早就卡住了。
  • “天才”模型:这些是试图在不训练的情况下猜测答案的大型人工智能模型。它们经常“产生幻觉”(编造内容),撞墙或与不存在的角色对话。
  • ASH:ASH 不断变得更好。当其他系统在大约 6 小时后停止进步时,ASH 持续运行了 8 小时,学会了战斗、捕捉怪物和解谜等新技能。它完成了两款游戏中几乎所有的主要目标。

大局观

该论文声称,ASH 证明了你不需要人类编写奖励系统或标注每一个视频来教会人工智能完成漫长而复杂的任务。相反,如果你赋予人工智能卡住、在互联网上寻求帮助并从中学习的能力,它就能自学掌握漫长且开放式的冒险。

这就像教孩子骑自行车,不是通过写说明书,而是让他们跌倒,让他们观看别人骑车的视频,然后再尝试。ASH 是第一个在复杂电子游戏中成功自动执行这一循环的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →