← 最新论文
💻 computer science

Cognitively-Grounded On-Device Runtime Learning for Ground Robots in Unknown Physical Environments

本文介绍了 CogRun,这是一个全自主端侧框架,通过将一种新型学习智能体与一个专门面向安全的理性智能体相结合,使安全至关重要的地面机器人在没有先验地图或网络连接的情况下,能够在未知环境中执行以认知为基础的运行时学习。

原作者: Yihao Cai, Yanbing Mao, Christian Lebiere

发布于 2026-09-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Yihao Cai, Yanbing Mao, Christian Lebiere

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个机器人被派往一片它从未见过的森林,任务是穿越一条布满枯枝、隐藏坑洞和不平整地面的路径。在人工智能领域,这个场景代表了一个根本性的障碍。如今大多数机器人是在完美的模拟世界或受控实验室中训练的,学习在可预测且静态的环境中移动。当这些机器被部署到像荒野森林或灾难现场那样混乱、多变的现实世界时,它们往往会陷入困境。它们预设的知识反而成了累赘,因为它们所面临的世界与它们学习的世界并不匹配。此外,这些机器人通常依赖于与云端强大计算机的持续连接来处理决策。在偏远、崎岖的地形中,这种连接经常中断,导致机器人陷入困境或无法进行实时调整。因此,挑战在于创造一种能够完全依靠自身进行即时学习,同时又能保持足够安全以无需人工干预即可运行的机器。

一组研究人员通过一个名为 CogRun 的新系统解决了这一挑战,该系统旨在让地面机器人在实际穿越未知物理空间时能够安全地学习。其核心思想是赋予机器人一种完全在其自带机载计算机上进行的即时学习能力,而无需将数据传回服务器。这种方法使机器人能够在遇到新障碍物和变化条件的那一刻进行调整。该系统的构建基于这样一个理解:在现实世界中学习是危险的;如果一个机器人仅仅为了测试什么有效而尝试各种新动作,它可能会摔倒或撞毁。为了解决这个问题,研究人员设计了一个框架,其中机器人的学习过程由一个独立的、非学习型的安全系统进行持续监控和引导。这确保了机器人在摸索如何更好地移动时,绝不会迈出可能导致其倾覆或碰撞的步伐。

该框架通过将机器人的“大脑”分为三个协同工作的不同部分来运作。第一部分是“学习智能体”(Learning Agent),它是好奇的探索者。它尝试不同的动作,观察结果,并根据其经历来改进性能。然而,由于这个智能体仍在学习阶段,它可能会犯错。为了防止这些错误演变成灾难,第二部分——“理性智能体”(Rational Agent)充当了严格的安全守护者。这个智能体不进行学习,它依赖于既定的、经过验证的规则来确保机器人保持直立并避免碰撞。如果学习智能体建议了一个看起来有风险的动作,理性智能体会立即接管控制权,执行一个安全的动作。第三个组件是“协调器”(Coordinator),它实时监测机器人的状态,并决定在任何给定时刻由哪个智能体掌管。如果机器人移动得安全,协调器会让学习智能体驾驶;一旦机器人进入危险情况,协调器就会将控制权交给理性智能体,直到危险过去。

该系统的独特之处在于它如何处理经验记忆。当机器人学习时,它会产生大量关于其行为及后续结果的数据。大多数系统将这些数据存储在一个简单的列表中,并随机抽取样本进行学习。研究人员发现这种方式效率低下,尤其是在环境不断变化的情况下,旧的或无关的数据会干扰学习过程。因此,CogRun 使用了一种受人类记忆启发的方法。它根据三个因素对记忆进行优先级排序:过去经验与当前情境的相似度、发生的近期程度以及类似情况发生的频率。这使得机器人能够将学习重点放在最相关的时刻,例如它差点在湿叶子上滑倒的那一刻,而不是浪费时间在数小时前环境完全不同的数据上。

为了测试该系统,研究人员将其部署在一个四足机器人在真实的未知森林中。环境充满了死亡地带、深陷的洼地以及可能隐藏跌落风险的叶片覆盖下的坑洞。机器人被要求从起点向终点行进三十米。在这些测试中,机器人必须在没有任何预先地图的情况下学习如何穿越地形。结果显示,该系统在整个学习过程中成功保持了机器人的安全。虽然标准的安全系统可以防止机器人摔倒,但它往往过于谨慎,导致移动效率低下。然而,CogRun 系统却让机器人在短短几十次尝试中就学会了一条平滑且高效的路径。机器人学会了调整步态和速度来应对不平整的地面,最终比使用固定的、预设策略的机器人更快地到达了目标。

团队还在模拟森林环境中的一辆越野自动驾驶车辆上测试了该系统,以观察该方法是否适用于不同类型的机器。他们将该系统与其他尝试处理安全问题的先进学习方法进行了对比。在这些模拟中,其他系统经常失去平衡或撞上障碍物,往往无法完成任务。相比之下,CogRun 系统完成了绝大多数的运行且没有发生安全违规。机器人学会了在密集的树木和岩石路径中导航,即使在地形发生意外变化时也能保持稳定性。研究人员指出,系统将基于规则的安全动作与基于学习的动作进行融合的能力至关重要。通过仔细混合安全守护者的谨慎动作与学习智能体的适应性动作,机器人可以在不跨越危险界限的前提下探索新的解决方案。

这项工作证明,机器人可以在不依赖云端连接或环境预设地图的情况下,在现实世界中进行持续学习。通过将寻求改进的学习智能体与保证安全的理性智能体相结合,并利用优先处理最相关经验的记忆系统,研究人员创建了一个允许机器适应物理世界不可预测性的框架。实验表明,这种方法可以显著提高机器人在复杂、未知环境中运行的安全性和效率,为能够协助灾难恢复、探索以及其他人类操作者难以进入的危险或不可预测环境的任务中,开发更强大的机器铺平了道路。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →