Neurosymbolic Framework for Concept-Driven Logical Reasoning in Skeleton-Based Human Action Recognition
本文提出了一种基于骨架的人体动作识别的神经符号框架,通过将运动基元映射到可解释的逻辑概念,弥合了深度学习与符号推理之间的鸿沟,从而在实现具有竞争力的性能的同时提供透明且人类可读的解释。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试教计算机理解人类的动作,比如一个人跳跃、挥手或戴上眼镜。目前,大多数计算机程序是通过查看一个“黑盒”来做到这一点的。它们观察骨架的移动并猜测动作,但无法告诉你为什么会做出这样的猜测。这就像一个在数学考试中答对了题,却无法展示解题过程的学生。
本文介绍了一种名为REASON的新系统,它更像一位人类教师。它不只是猜测,而是将动作分解为小的、可理解的“概念”,并利用逻辑规则来推断正在发生什么。
以下是其工作原理,使用简单的类比说明:
1. “概念库”(词汇表)
想象你要描述一段舞蹈。你可以只说“他们动了”,但这很模糊。相反,你可以将其分解为具体的动作:“手臂上举”、“膝盖弯曲”、“向前移动”、“快速”。
研究人员利用智能人工智能(大语言模型)构建了一个概念库,生成了这些具体动作概念的字典。
- 空间概念:这些关乎身体部位在哪里(例如,“手臂举起”、“膝盖弯曲”)。
- 时间概念:这些关乎动作如何以及何时发生(例如,“向上移动”、“手先动”、“快速”)。
这至关重要,因为两个动作在定格画面时可能看起来一样(例如戴上眼镜与摘下眼镜),但动作的方向和顺序是不同的。该系统学习这些“基于时间”的线索来区分它们。
2. 翻译器(解码器)
计算机首先查看原始骨架数据(关节的点和线)。这就像看一团乱涂乱画的笔迹。
系统使用一种特殊的翻译器(STC-解码器)将那些杂乱的笔迹转化为来自概念库的清晰“概念”列表。
- 类比:这就像翻译器将外语转换为英语单词。计算机看到“关节在移动”,翻译器则说:“啊,这意味着‘手臂上举’和‘向上运动’。”
3. 逻辑引擎(推理)
一旦计算机拥有了概念列表,它就不会只是猜测动作。它使用逻辑规则,类似于流程图或食谱。
- 类比:想象一名保安在检查规则清单。
- 规则 1:如果(腿部弯曲)且(身体向上移动)且(手臂摆动)→ 那么这就是跳跃。
- 规则 2:如果(手靠近脸部)且(运动方向是向上)→ 那么这就是戴上眼镜。
- 规则 3:如果(手靠近脸部)且(运动方向是向下)→ 那么这就是摘下眼镜。
系统会自动学习这些规则。它会找出哪些概念的组合会导致哪种动作。
4. 为何这很特别(“玻璃盒”)
大多数 AI 模型都是“黑盒”——你输入数据,得到一个答案,但你不知道中间的步骤。
这个系统是一个“玻璃盒”。因为它使用逻辑规则,你可以查看内部,确切地看到发生了什么:
- “计算机认为这是跳跃,因为它看到了‘腿部弯曲’和‘向上运动’。”
- 如果计算机犯了错误,你可以确切地看到它搞错了哪个“概念”(例如,它认为运动方向是“向下”,而实际上是“向上”)。
结果
研究人员在标准数据集上测试了该系统,这些数据集用于让计算机识别人类动作。
- 性能:它的表现与最先进的“黑盒”模型一样好,甚至更好。
- 可解释性:与其他模型不同,它能够用清晰的英语逻辑解释其推理过程(例如,“我选择‘跳跃’是因为腿部弯曲且身体向上移动”)。
总结
本文提出了一种系统,它不仅仅记忆“跳跃”看起来是什么样。相反,它学习跳跃的成分(弯曲腿部、向上移动)以及将它们组合起来的食谱(逻辑规则)。这使得计算机能够以一种既高度准确又易于人类理解和信任的方式来理解人类动作。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。