When to Plan: Learning to Select Between Reactive Control and Deliberative Planning
本文介绍了一种强化学习方法,用于训练一种元推理策略,该策略通过使用反应式策略不确定性评分来预测何时需要规划,从而在快速反应控制与较慢的审慎规划之间动态分配计算资源,以此在优化导航任务性能的同时,适应反应式策略的改进。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在尝试解开一个谜题。有时,你只需扫一眼碎片,就能瞬间把它们拼凑在一起,因为你已经见过这种模式成千上万次了。那是你大脑的“快车道”。但在其他时候,谜题变得很奇怪,或者碎片缺失,或者图案倒过来了。在那些时刻,你的快车道撞上了墙,你必须停下来,深入思考,甚至可能在采取行动前先画一张地图。那就是“慢车道”。
这篇论文存在于人工智能的世界中,具体来说是一个叫做**元推理(meta-reasoning)**的领域。把元推理想象成大脑的管理者。它不负责实际的工作;相反,它决定工作将如何进行。研究人员一直提出的核心问题是:我们如何教会一个机器人或计算机程序,知道何时使用其快速、本能的反射,以及何时放慢速度进行艰难、缓慢的思考?我们之所以关心这一点,是因为如果一个机器人总是思考缓慢,它会太迟钝而无法接住球或躲避汽车。但如果它总是行动迅速,它可能会撞上那些它并不理解的东西。目标是构建一个能够准确知道何时切换档位的智能体。
这篇论文的作者 Adam Labiosa 和 Josiah P. Hanna 决定教给 AI 智能体这项技能。他们创建了一个“元智能体”(meta-agent),充当计算机大脑的交通警察。这个智能体在其工具箱中有两个主要工具:反应策略(Reactive Policy)和规划器(Planner)。
反应策略就像是一种反射。它是一个超快速的神经网络,观察情况并立即说:“做这个!”因为它不需要停下来思考,所以速度极快。然而,它有一个盲点:它只知道如何处理以前见过的场景。如果你把它放在一个全新的、奇怪的房间里,它可能会陷入恐慌并做出糟糕的举动。
另一方面,规划器则像是一位谨慎的建筑师。它需要时间来模拟不同的路径,向前展望,并计算出完美的动作序列。它在面对新情况或棘手情况时要可靠得多,但它很慢。使用规划器会消耗“时间”,就像在回答问题前花费额外的几分钟去思考一样。
这篇论文的主要发现是一种教导元智能体如何在两者之间进行选择的巧妙方法。元智能体并不是靠猜测,而是观察一个特定的信号:不确定性(uncertainty)。反应策略是由几个协同工作的神经网络组成的团队。如果所有的网络对于该做什么达成一致,不确定性就很低,元智能体就会说:“前进吧,使用快速反射!”但如果这些网络开始互相争论,不确定性就会升高。这告诉元智能体:“喔,这看起来很奇怪。快速反射可能会搞砸。让我们停下来,使用慢速规划器。”
研究人员在各种类似视频游戏的场景中测试了这个想法,从在网格中推动箱子到引导机械臂穿过障碍物。他们发现,这种聪明的自适应智能体比那些被迫始终快速或始终缓慢的智能体更能有效地达成目标。事实上,在一些棘手的场景中,他们的智能体比“始终规划”的机器人快了多达 2.5 倍,并且比“始终反应”的机器人成功率更高。
其中一个最酷的发现是,这个系统具有自我改进的能力。研究人员设定了一个场景,让“快速反射”智能体通过向“慢速规划器”学习,随着时间的推移变得更好。随着反射智能体学到的知识越来越多且变得越来越自信,元智能体注意到了不确定性信号的下降。因此,元智能体开始更加信任反射,最终转向几乎完全由快速的反应式控制。这就像一个学生,起初每做一道数学题都要向老师寻求帮助,但随着他们变得越来越聪明,他们意识到自己可以独立解决大部分问题,于是就不再寻求帮助了。
论文还探讨了不同因素如何改变智能体的行为。他们发现,如果“思考的成本”(进行规划所需的时间)上升,智能体会自然而然地变得更加“懒惰”,更多地依赖其反射。他们还发现,如果环境变得非常混乱和嘈é,智能体会停止使用长而复杂的计划,因为那些计划很容易被噪声干扰,转而使用较短的计划或快速的反射。
简而言之,这篇论文表明,通过赋予 AI 一种衡量自身困惑(不确定性)的简单方法,我们可以教会它在快速反射与深思熟虑的规划之间达到完美的平衡。它不仅仅适用于某一种特定的游戏;这种方法似乎能适应不同类型的挑战,证明了哪怕是一点点自我意识,也能让人工智能智能体变得更聪明、更高效。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。