Decoupled Thinking, Learning, and Action for Continually Growing Autonomous Robots
本文提出了解耦式思考-学习-行动(D-TLA)框架,该框架通过独立且相互作用的模块使自主机器人能够实现持续适应,在保持常规性能表现的同时,显著提升对罕见事件的识别能力及在新任务中的成功率。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个不仅仅是遵循脚本,而是能够思考问题、从经历中学习并根据这些知识采取行动的机器人。为了让机器在现实世界中真正发挥作用,它需要持续完成三件事:它必须对正在发生的事情进行推理,它必须将过去的经验转化为可以再次使用的技能,并且它必须移动身体来改变世界或收集新信息。长期以来,工程师们一直试图将这些能力构建成一个紧密相连的单一链条,即机器人先思考,然后学习,最后行动,并遵循严格的顺序。但这种方法存在缺陷。如果机器人卡在了一个难题上进行思考,它就会停止移动并停止学习,即使它本可以轻松地继续日常工作。挑战在于,如何让这三个部分在互不干扰的情况下同时运作,同时仍能在必要时让它们相互交流。
成都信息工程大学的一位研究人员提出了一种构建这类机器的新方法,称为“解耦的思考—学习—行动”(Decoupled Thinking–Learning–Action)框架。该研究人员并没有强迫机器人为每一个步骤都等待中央大脑下达指令,而是设计了一个系统,让思考、学习和行动成为三个并行的独立过程。它们就像车间里的三个独立的工人,不需要请求许可即可开展工作,但可以通过互相留便条的方式来改进最终产品。思考模块可以建议更安全的移动方式或指出需要学习的内容,但如果行动模块正忙于解决另一个谜题,它并不会冻结行动模块。同样,学习模块可以在机器人忙于思考新危险时,在后台继续研究过去的错误与成功。这种分离使得机器人在思考过程被占用时,仍能保持工作并不断改进。
研究人员在一个模拟仓库中测试了这个想法,其中机器人需要搬运包裹。在一次测试中,他们让机器人的思考过程在一段较长时间内卡在一个困难的识别问题上,以模拟机器对某个物体感到困惑的情况。在旧系统中,由于机器人必须等待思考过程结束后才能进行任何操作,机器人停止了移动,无法完成其常规任务。当思考过程长时间处于忙碌状态时,这类常规工作的成功率下降到了约一半。相比之下,新系统则保持了完美运行。即使在思考部分被占用时,它仍能百分之百完成常规运输任务,并继续从其行动中学习。至关重要的是,该系统并未让机器人陷入盲目行动,思考模块仍然可以发送一条“停止”指令,以防机器人做出危险动作。当研究人员移除这种发送安全提示的能力时,机器人开始在近百分之八十的情况下做出不安全的举动。这证明了这三个部分可以在保持独立的同时,并不与彼此隔离。
第二个测试观察了机器人面对罕见且棘手问题时的学习情况。研究人员创造了一种情境:一个包裹起初看起来完好无损,但在机器人搬运一段时间后才会散架。这要求机器人需要理解随时间变化的模式,而不仅仅是单张快照。一个仅仅依靠在工作中自然等待这些罕见事故发生的机器人,只能学会识别大约百分之七十的情况,它完全错过了最困难的模式。然而,新系统利用其思考模块意识到自己缺少某种特定的经验。随后,思考部分告诉行动模块,要刻意执行某些动作,以创造出观察到该失效现象所需的精确条件。通过引导机器人收集正确类型的数据,该系统几乎完美地学会了识别这些罕见失效,成功率达到了百分之九十七。机器人不仅获得了更多数据,而且因为它通过思考过程知道缺失了什么,所以它获得了“正确”的数据。
最后的测试表明,这种学习可以反向作用,改变机器人未来的思考方式。机器人接受了已知问题的训练,但随后面临了一个结合了多种不同危险因素的全新复杂情况。旧的思考方式(拥有一套固定的响应列表)无法处理这种新的组合,成功率仅为百分之十四左右。然而,新系统分析了其过去的失败,并意识到它需要一种新的思考方式来处理这种特定的组合。它生成了一项新的思考活动,对其进行了测试,并将其整合进自己的思维中。经过这个学习阶段后,机器人在处理这种新复杂情况时的成功率达到了百分之七十四。值得注意的是,它并没有丧失处理旧有熟悉问题的能力;它保持了百分之九十六的成功率。机器人是在没有忘记旧能力的前提下,长出了新的能力。
这项研究表明,为了让机器人实现长期的适应与成长,它们需要一种允许思考、学习和行动作为独立但相互关联的流进行处理的结构。通过让这些过程独立运行,机器人避免了因某一部分忙碌而陷入停滞。通过允许它们通过“建议”而非“命令”来相互影响,机器人可以保持安全并收集学习所需的正确信息。结果显示,这种方法使机器能够随着时间的推移变得更加强大和安全,在解决新问题的同时记住如何处理旧问题,且无需一个单一的中央控制器来管理其存在的每一刻。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。