Preemptive Solving of Future Problems: Multitask Preplay in Humans and Machines
本文介绍了“多任务预演”,这是一种新颖的算法,它利用对未 pursued 但可及的任务的反事实模拟来学习预测性表征,从而解释人类在复杂环境中的泛化能力,并显著提升智能体在新型多任务场景中迁移技能的能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象你正穿过一个陌生的街区寻找一家咖啡店。走着走着,你经过了一家健身房、一家杂货店和一个公园。尽管你只是在找咖啡,但你的大脑却悄悄地在心里记下健身房和杂货店的位置。稍后,如果你突然需要牛奶,就不必从头开始;你可以立刻回想起杂货店就在两个街区之外。
本文提出,人类一直在进行这种“心理预演”,并介绍了一种名为**多任务预演(Multitask Preplay)**的新计算机算法,试图模仿人类的这一超能力。
以下是该理念、实验及结果的拆解,辅以简单的类比:
问题所在:“小抄”与“地图”
要理解这篇论文,不妨想象学习电子游戏的两种方法:
- “小抄”(无模型方法): 你玩了一百万次游戏。你记住了“如果我按上、然后右、然后跳,就能得分”。一旦掌握模式,这既快又容易,但如果游戏发生变化(例如目标移动),你就得从头再来。你无法适应。
- “地图”(有模型方法): 你构建了一个完美的心智地图,涵盖整个世界。你可以瞬间算出如何到达任何地方。但构建这张地图需要消耗大量的脑力和时间,而且每次做决定时都要重新计算。
大多数当前的人工智能试图成为其中一种。然而,人类似乎做的是介于两者之间的事。他们构建地图,但也会在休息或做其他事情时,在脑海中“预演”各种场景,从而为未来做好准备。
核心理念:“多任务预演”
作者提出,当你走向咖啡店(任务 A)时,你的大脑并不会止步于此。它会在后台模拟:如果要去杂货店(任务 B)或健身房(任务 C)会是什么样子,即使你实际上并不去那里。
- 隐喻: 想象你是一位正在炖一大锅汤(你的主要任务)的厨师。当汤在慢炖时,你并非只是坐在那里。你会在脑海中练习切蔬菜,为稍后可能要做的沙拉做准备。当你真正需要沙拉时,就不必再琢磨如何切菜;你已经在脑海中“预演”过这个动作了。
- 算法: 计算机程序会利用它刚刚走过的一条路径(例如去咖啡店),在后台运行一次模拟:“好吧,如果我要去杂货店而不是咖啡店,我该怎么做?”它将这种“虚假”的经历保存在记忆中。稍后,当杂货店成为真实目标时,计算机因为之前练习过,已经知道路该怎么走了。
实验验证(实验过程)
研究人员在两个不同的“世界”中,用人类和计算机测试了这一理念:
1. 网格世界(一个简单的迷宫)
- 设置: 人类控制迷宫中的一个红色三角形寻找蓝色方块(训练任务)。随后,他们需要寻找一个红色方块(新任务)。
- 测试: 有时,红色方块的位置使得通往它的最佳路径与刚刚走过通往蓝色方块的路径部分重叠。
- 结果: 人类并没有仅仅选择数学上最短的路径。相反,他们经常选择一条稍长的路径,复用刚刚练习过的路线。
- 意义: 即使复用旧路径并非最短,人类的速度也更快。这表明他们在执行第一个任务时,就像多任务预演算法一样,在脑海中“缓存”了该路线。其他人工智能模型要么无法解决迷宫,要么耗时更长,因为它们没有“预演”替代路线。
2. 我的世界(Minecraft)世界(一个复杂的 3D 游戏)
- 设置: 他们转向了一个更复杂的游戏,名为"Craftax"(类似《我的世界》),玩家必须在一个巨大且部分隐藏的世界中寻找特定的石头(钻石、红宝石)。
- 转折: 有时,玩家甚至不知道稍后会被测试寻找哪种石头。
- 结果: 即使不知道未来的目标,人类仍然复用了训练期间的路径。如果他们在训练期间曾走过新石头附近,他们找到新石头的速度就会更快。
- 人工智能对比: 标准的人工智能模型在这里彻底失败。它们无法泛化。但多任务预演人工智能取得了成功,通过在已知目标的学习过程中模拟对未知石头的追寻,其表现与人类相当。
人工智能模拟:"10,000 个新世界”测试
最后,研究人员在一个大规模模拟中测试了该算法,人工智能必须学会导航 10,000 个不同的独特世界。
- 挑战: 现实世界的任务往往共享部分环节。要获得钻石,你需要一把镐。要获得镐,你需要木头。这些“子任务”经常同时发生。
- 胜利: 多任务预演人工智能学会了识别这些模式。通过在致力于主要目标的同时模拟“子任务”(例如制作镐),它构建了一个灵活的大脑。当被投入一个从未见过的全新世界时,它解决复杂任务的速度比其他人工智能方法快得多。
结论
该论文声称,人类天生擅长基于当前行为“预演”未来的可能性。我们不仅仅是为了手头的任务而学习;我们也是为了可能需要的下一个任务而学习。
通过教导计算机做同样的事情——在处理当前任务的同时模拟替代目标——我们可以创造出更擅长适应新情况的人工智能,而无需从头开始重新学习一切。事实证明,聪明的秘诀不仅仅在于努力处理当下,还在于对未来进行白日梦。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。