← 最新论文
💻 computer science

Motion Primitive Discovery in a Humanoid Robot via Self-Organising Maps for Phase Recognition

受镜像神经元系统的启发,本文为 NICO 类人机器人提出了一种两层架构,该架构利用自组织映射来编码手臂和手的运动学,并利用回声状态网络来实现对运动原语的精确在线相位识别。

原作者: Radovan Gregor, Igor Farkaš

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Radovan Gregor, Igor Farkaš

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,试图教一个机器人理解人类的手势,比如挥手或击掌,而不仅仅是死记硬背一份“如果-那么”的规则列表。这就是被称为“社会认知”的领域的核心,科学家们试图研究机器如何能够“领会”人类正在做什么以及为什么要这么做。为了实现这一点,研究人员经常从人类大脑中寻找灵感,特别是被称为“镜像神经元”的一组迷人的细胞。这些特殊的脑细胞不仅在你亲自执行某个动作时会放电,当你观察别人做这个动作时也会放电。这就像你的大脑里有一个内部电影院,会在其中重播这个动作以理解它。机器人学领域的大问题是:我们能否构建一个以这种方式工作的计算机系统?机器人不只是通过看一段视频来猜测,而是能建立一套属于自己的运动“词汇量”,并利用它来瞬间识别当前正处于动作的哪个阶段?这对于需要与人类协作的机器人至关重要,因为如果机器人能预判你正准备拿起杯子,它就可以让开位置,或者在你开口请求之前就把餐巾递给你。

Radovan Gregor 和 Igor Farkaš 撰写的这篇论文正是对这一想法的探索,他们使用了一个名为 NICO 的类人机器人。该团队构建了一个受镜像神经元概念启发的两层系统,旨在教机器人实时识别其自身动作的“阶段”。把这想象成在教机器人跳舞。他们系统的第一层使用了两个特殊的映射,称为自组织映射(SOM),它们充当了运动模式的图书馆。一张图谱学习机器人手臂的运动,另一张图谱学习手的形状。当机器人练习七种不同的动作(如拿起物体、进食或挥手)时,这些图谱会自动将成千上型的微小动作整理成整齐、有序的组。这就像机器人正在发现自己的“运动原语”(motion primitives),它们就像是运动的基本乐高积木。研究人员发现,手臂图谱和手部图谱学习的是不同且互补的内容:手臂图谱擅长追踪路径和时机,而手部图谱则是识别手指精确形状(例如力量抓握与精细捏取)的高手。

一旦这些“乐高积木”被发现,系统的第二层就会启动。这部分使用了一种称为回声状态网络(ESN)的神经网络,它充当了一个短期记忆库。它观察机器人运动过程中所使用的“积木”序列。研究人员想要回答的核心问题是:机器人是否需要知道关于情况的所有信息——比如它拿着什么物体、距离有多远或最终目标是什么——才能识别出它现在正在做什么?或者,仅仅依靠运动序列本身就足够了吗?

为了找出答案,他们进行了数千次模拟,让机器人执行这些动作。他们以两种方式测试了系统:首先,让 ESN 仅通过它刚刚看到的臂部和手部运动序列来猜测当前的运动阶段;然后,给它额外的“上下文”线索,比如动作名称或物体距离。结果非常明确。当系统仅依赖运动序列(即“运动原语”)时,它识别当前阶段的准确率约为 93.9%。当他们加入所有额外的上下文线索时,准确率仅略微上升到约 94.9%。

这表明,由运动本身讲述的“故事”才是最重要的部分。关于物体或目标的额外信息是有帮助的,就像一个小提示,但它并不是理解的主要驱动力。机器人的内部运动图谱已经承担了大部分重任。作者得出结论,通过让机器人将其自身的运动组织成这些拓扑图,并观察这些图谱随时间的变化流,机器人可以准确地识别出它在当下的动作。虽然这一切都是在 NICO 机器人的计算机模拟中进行的,但研究结果支持了这样一种观点:自组织的运动表示是一种强大的方法,可以构建出能够理解并预判人类行为的机器人,而无需建立一个包含每种可能场景的海量数据库。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →