Classifying daily activities needs posture, reconstructing them needs motion
本研究表明,虽然静态身体姿态足以进行日常活动分类,但运动的时间动态对于重建自然运动至关重要,从而揭示了人类运动分析中识别与生成之间的根本解离。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你的大脑就像一个超级敏锐的侦探,每当你走进一个房间时,它都在试图破解一个谜题。这个谜题不是关于犯罪,而是一个简单的问题:“那个人在做什么?”那个人是在走路、跳舞,还是可能只是在挠头?几十年来,科学家们一直想知道,即使在视觉信息混乱或不完整的情况下,我们的大脑是如何如此迅速地解开这个谜题的。事实证明,我们的大脑非常擅长捕捉“生物运动”——即生物体运动的特定方式。但为了理解我们是如何做到的,研究人员必须将运动分解为数学。把运动想象成一首歌:你可以通过歌词(文字,或者身体的静态姿态)来描述一首歌,也可以通过旋律和节奏(动作,或者身体随时间变化的运动方式)来描述它。这个领域的核心问题是:当我们识别一个动作时,我们主要是在阅读“歌词”,还是在聆听“节奏”,亦或是两者皆需?这一点至关重要,因为如果我们能弄清楚这首“歌曲”的哪一部分最重要,我们就能构建出更好的计算机,以帮助医生追踪患者的康复情况、创造逼真的电子游戏角色,或者设计像人类一样运动的机器人。
在这项研究中,来自女王大学的两名研究人员决定扮演侦探,去研究 16 种不同的日常活动,比如爬行、行走和开合跳。他们拍摄了人们进行这些动作的视频,并将它们输入到三个不同的“数学侦探”中,以观察哪一个能最好地猜出正在进行的活动。第一个被称为 TMPs 的侦探,试图将运动分解成一种流畅、连贯的节奏,就像一份乐谱。第二个侦探,勒让德系数 (Legendre coefficients),则显得有些僵硬;它会问:“身体的平均姿态是什么?”并几乎完全忽略了节奏。第三个,自动编码器 (Autoencoder),是一个“黑箱”人工智能,它试图在没有特定规则的情况下自行学习模式。
这里是论文发现的转折点: “节奏”侦探(TMPs)和“平均姿态”侦探(Legendre)在猜测活动方面都表现得极其出色,正确率达到了约 96%。然而,“黑箱”人工智能的正确率仅为 89% 左右。但真正的魔力发生在他们尝试使用这些数学模型来“重现”动作时。 “平均姿态”侦探是猜测“正在进行什么活动”的冠军,但如果你要求它绘制动作,它会产生一个冻结的、雕塑般的图像。它知道身体处于“爬行”的形状,但它完全不知道如何让身体爬行。这就像是知道了一首歌的歌词,却没有任何旋律。
另一方面,“节奏”侦探(TMPs)是唯一能够重现平滑、自然运动的模型。它完美地捕捉到了肢体的流动感和摆动感。研究还发现,你并不需要追踪全身来猜出活动内容。通过仅仅关注 9 个特定的关节——手腕、肘部、膝盖、脚踝和颈部——这些模型仍然可以高精度地猜出活动。这仿佛身体的“歌词”主要写在手部和足部的姿态之中。
论文得出了一个引人入胜的结论:为了识别某人“在做什么”,你的大脑(或计算机)主要只需要看到他们身体的静态形状。仅仅靠“歌词”就足以解开谜题。但如果你想要理解动作是如何展开的,或者想要自然地重现它,你绝对需要“旋律”和节奏。研究人员指出,虽然一张冻结的照片足以告诉你某人正在做“开合跳”,但你需要通过运动才能看到跳跃的力量感和流动感。这意味着,对于像分类活动这类简单的任务,我们可以使用非常简单、紧凑的数学模型。但如果我们想要生成真实的动作,我们就需要复杂且动态的模型。这是一个明确的分野:姿态告诉我们“是什么”,而运动告诉我们“如何做”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。