← 最新论文
💻 computer science

Teaching Foundation Models to Read mmWave: Pose-Guided Kinematic Representation for Human Behavior Understanding

本文介绍了 mmMind,这是一种雷达-语言模型,它利用姿态引导的预训练技术将毫米波雷达数据与大语言模型进行对齐,以实现隐私友好的人类行为理解,并通过一个新的真实世界基准测试以及在描述生成和问答任务中的卓越性能进行了验证。

原作者: Duo Zhang, Zhehui Yin, Zhiyun Yao, Haotong Qin, Xusheng Zhang, Hongliu Yang, Jianyu Sun, Junzhe Wang, Zizhou Fan, Michele Magno, Daqing Zhang

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Duo Zhang, Zhehui Yin, Zhiyun Yao, Haotong Qin, Xusheng Zhang, Hongliu Yang, Jianyu Sun, Junzhe Wang, Zizhou Fan, Michele Magno, Daqing Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个超级聪明的机器人助手理解房间里的人正在做什么,但有一个限制:你不能让机器人使用它的眼睛。摄像头很棒,但在卧室或浴室等地方使用它们会让人感到隐私受到侵犯,而佩戴特殊的传感器又很麻烦。因此,科学家们转向了一种被称为毫米波(mmWave)雷达的另一种“视觉”。你可以把这种雷达想象成蝙蝠利用回声定位的方式:它发出看不见的无线电波,这些波在人体上反射并返回,从而创建一个点云,展示人体的位置以及移动的速度。它是私密的、非接触式的,并且不会捕捉到任何可辨识的图像。

然而,这里有一个大问题:这些雷达点非常杂乱、稀疏且难以被机器人的大脑(大语言模型,简称 LLM)理解。LLM 就像一个能读万卷书、写好故事的优秀学生,但如果你只递给它一 handful 散乱、充满噪声的点,它完全不知道这些点的含义。这就像是试图通过仅仅给出一组没有节奏或流动感的随机坐标,来向某人解释一段舞蹈动作。那么大问题是:我们如何将这些令人困惑、隐形的雷达点转化为机器人能够阅读并理解的清晰故事,从而让它在从未“看到”我们的情况下,准确地告诉我们正在做什么?

这正是名为 mmMind 的新项目大显身手的地方。北京大学和苏黎世联邦理工学院的研究人员构建了一个巧妙的系统,通过一种“秘密训练技巧”,教会了雷达感知机器人如何“阅读”人类的动作。想象一下,你正在教一名学生描述一段舞蹈。通常,你可能会直接展示混乱的视频并让他们猜测。但在 mmMind 中,老师首先向学生展示这段舞蹈,并同时提供一张完美的、与舞者关节同步的骨架图。学生学会了将杂乱的雷达点与这个清晰的骨架结构联系起来。一旦学生通过这些“骨架”课程掌握了节奏和身体形态,老师就会把骨架图拿走。现在,当学生只看到那些杂乱的雷达点时,他们依然能在脑海中“看到”那个骨架,并完美地描述那段舞蹈。

论文介绍了 mmMind,这是一个使用这种“姿态引导”(pose-guided)训练方法的模型。在训练阶段,系统观察雷达数据以及与之对应的 3D 姿态(即骨架)。它学习将稀疏、多噪的雷达点转化为一种平滑、连续的运动语言,从而保留身体的结构以及随时间变化的特征。一旦学习完成,系统就会丢弃骨架数据。从那时起,它只需要原始的雷达信号就能理解人类的行为。研究人员随后让这个具备雷达感知能力的模型与大语言模型进行对话,使其能够回答问题、撰写描述,甚至就它所“看到”的内容进行交谈。

为了证明这在现实世界中行之有效,团队不仅使用了计算机模拟,还构建了一个庞大的新数据集——mmMind-Bench。他们记录了 17.9 小时真实人员在七种不同室内环境(如客厅和办公室)中的活动。他们捕捉了 23 名参与者完成的各种动作,从行走、坐下到做开合跳或跌倒。至关重要的是,他们并没有仅仅用“跳跃”这类简单的词汇来标注动作,而是创建了详细的双语(中英文)描述、问题以及多轮对话,用以描述身体是如何移动的、运动的方向以及事件的先后顺序。

结果表明,这种方法取得了显著进展。在测试描述动作、回答关于运动的问题以及识别模型从未见过的动作等任务时,mmMind 的表现始终优于以往的方法。例如,在描述动作方面,它的得分达到了 86.8,大幅领先于次优方法。在识别全新的、未见过的动作时,其正确率达到了 91.2%。研究人员发现,如果移除“骨架”训练步骤,模型的性能会大幅下降,这表明学习身体结构对于理解运动至关重要。他们还发现,尝试将雷达数据压缩成简单的离散代码(例如将运动转化为一组数字列表)会降低模型的准确性,这证实了保持运动作为一种平滑、连续的流向效果更好。

尽管该系统令人印象深刻,但作者也谨慎地指出了它的局限性。它并不完美,例如在计数精确数字方面(比如某人跳跃了多少次,或者转动的精确速度),特别是在雷达信号较弱或人仅部分可见的情况下。他们还指出,目前该系统在区分房间内的多个人员方面需要帮助;它依赖于一个外部工具,先将混合在一起的雷达点分类为个体,然后 mmMind 才能进行分析。然而,这项工作表明,通过通过雷达教 AI 理解人类身体的“运动学”(即运动的物理特性),我们可以构建出既了解我们在做什么,又无需拍摄我们照片的隐私友好型助手。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →