想象一位使用助行器的老人。理想情况下,他们应握住把手、挺直身体并安全行走。但有时,他们可能会过度前倾、扭曲身体,或将手从扶手上移开。这些微小的失误可能将原本有益的工具变成绊倒隐患,导致跌倒。
本文就像一支工程师团队,试图为这些助行器打造一位“智能守护者”。他们希望验证:计算机能否在无需用户佩戴任何特殊传感器或摄像头的情况下,实时观察行走者并即时判断:“此人姿势是否正确?”或“他们是否即将跌倒?”
以下是他们如何实现的简明解释:
设置:“鹰眼”助行器
研究人员将一台标准助行器配备了一双“眼睛”(摄像头)和一个“大脑”(小型计算机)。他们并未使用笨重昂贵的设备,而是采用了一种巧妙的软件技巧,称为MediaPipe。
可将 MediaPipe 想象为一位数字骨架绘制师。当摄像头捕捉到人物时,该软件会立即在人物身上绘制出火柴人轮廓,识别出包括鼻子、肩膀、肘部和膝盖在内的 33 个关键点。它无需向计算机发送庞大的视频文件,而仅传输这些点的坐标。这就像发送一条描述姿势的短信,而非 4K 视频,从而实现了快速高效。
竞赛:谁是最佳侦探?
研究人员组织了一场竞赛,让五位不同的“侦探”(计算机模型)角逐,看谁最能识别使用者的姿势。他们针对三个具体问题测试了这些侦探:
- 助行器检查:此人是否真的在使用助行器?
- 起始检查:他们是从坐姿还是站姿开始的?
- 姿势检查:他们具体在做什么?(例如:站立、坐下、向左倾斜、抬手等)。
这五位侦探分别是:
- 几何方法:一种基于简单规则的体系。它就像一位老师说:“如果你的鼻子位于肩膀左侧超过 10 英寸,你就是在倾斜。”它不学习,仅测量距离。
- SVM 与 XGBoost:这些如同经验丰富的统计学家,通过寻找数据中的模式来做出决策。
- CNN(卷积神经网络):这些是“深度学习”模型,本质上是数字大脑,通过反复观察数据来学习复杂模式,类似于儿童学习识别形状的过程。
结果:谁获胜了?
竞赛中出现了一些令人惊讶的胜者和一些表现不佳者:
- 二元冠军(是/否问题):对于“是否在使用助行器?”或“是坐是站?”这类简单问题,XGBoost侦探几乎完美。在训练期间,其答案正确率高达 99.8%。它就像一盏几乎从不犯错的超精准交通灯。几何方法和CNN在此类任务中也表现优异,得分均超过 98%。
- 复杂挑战(姿势谜题):当要求识别具体且复杂的姿势(例如“前倾并扭转”)时,任务难度大幅增加。
- 几何方法在此处最为可靠,准确率约为 90%。它就像一位严格的教练,深知良好姿势的精确规则。
- XGBoost模型同样强劲,训练期间准确率达 99%,但在测试新且未见过的对象时略有下降(约 74%)。
- **深度学习模型(CNN)**在处理这些复杂的多选项问题时稍显吃力。虽然它们擅长识别简单模式,但当面临过多不同姿势供选择时,“大脑”有时会感到困惑。
核心结论
该论文得出结论:若要使智能助行器既安全又有效,未必需要最复杂、最重型的 AI。
- 对于简单检查(是否在使用助行器?是否坐着?),XGBoost模型堪称 powerhouse。它快速、准确,且擅长处理二元选择。
- 对于识别不良姿势(用户是否危险地倾斜?),几何方法(基于简单规则的体系)出人意料地有效且稳健,实现了近 90% 的准确率。
研究表明,通过结合这些方法,智能助行器可扮演一位警觉的守护者。它能检测老年人是否过度倾斜或将手从助行器上移开,并在跌倒发生前发出警报。然而,作者指出,这些模型仍需在真实世界中与实际老年用户进行测试,以确保它们在混乱的真实生活场景中能完美运作。
简而言之:他们构建了一种数字骨架追踪系统,能够判断助行器使用者是挺直站立还是即将踉跄,其原理是结合简单的数学规则与智能的模式识别算法。
技术摘要:基于骨架的助行器辅助步态姿态分类以提升安全性
问题陈述
全球老龄化人口面临显著的健康挑战,包括平衡能力、肌肉质量和行动能力的下降,这些情况极大地增加了跌倒风险。虽然助行器等辅助设备是降低这些风险的标准手段,但其误用——特别是姿势不正确或操作不当——反而可能导致跌倒。目前的姿态分类方案通常依赖需要大量处理能力或可穿戴标记的全身数据集,这些方案可能具有侵入性、成本高昂且难以被老年人维护。因此,亟需一种非侵入式、实时的系统,能够利用辅助设备上的机载摄像头监测用户姿态,检测危险姿态并预防跌倒,而无需用户佩戴额外的传感器。
方法论
本研究提出并比较了五种不同的建模方法,用于基于骨架数据对助行器使用情况、初始位置(坐姿与站姿)以及特定姿态进行分类。该系统利用配备 USB 摄像头、激光雷达(LiDARs)、力敏电阻(FSRs)和惯性测量单元(IMU)的社会辅助助行器(SAW)。
数据采集与预处理:
- 数据收集: 数据来自 21 名健康参与者(年龄 21–48 岁),他们在受控条件下执行预定义的练习(手臂上举、躯干弯曲、坐姿、站姿)。
- 姿态关键点检测: 采用 Google MediaPipe 的姿态检测框架(BlazePose)实时提取 33 个三维身体关键点。这种方法避免了原始图像处理的需要,仅传输基于文本的坐标以提高效率。
- 特征提取: 对原始关键点坐标进行预处理,提取 48 个几何特征,包括关节之间的距离和角度。
模型架构:
- 卷积神经网络(CNN): 测试了两种架构:一个 4 层 CNN(使用原始关键点和工程特征进行测试)和一个 6 层 CNN(仅使用原始关键点)。这些模型利用卷积、批归一化、最大池化和 Dropout 层。
- 编码器 - 解码器 CNN(EDCNN): 一种专为降维和重建设计的架构,包含具有三个卷积层的编码器和具有转置卷积层的解码器,联合训练用于分类。
- 支持向量机(SVM): 一种监督算法,用于识别分离各类别的最佳超平面。
- 极端梯度提升(XGBoost): 一种使用决策树的集成学习方法,结合 MultiOutputClassifier 以同时预测多个变量。
- 几何方法: 一种基于规则的非学习方法,建立基准姿态,并利用欧几里得距离和实证确定的阈值对偏差进行分类,辅以 FSR 数据用于检测抬手动作。
分类任务:
模型被训练以预测三个输出:
- 助行器选择: 二分类(使用助行器与未使用)。
- 初始位置: 二分类(坐姿与站姿)。
- 姿态分类: 多分类(监督模型为 17 种特定姿态;几何方法为 8 种姿态)。
关键结果
研究在训练/验证集和未见过的测试数据上,使用准确率、精确率、F1 分数、敏感性和特异性评估了性能。
二分类(助行器选择与初始位置):
- XGBoost 表现最佳,实现了近乎完美的训练准确率(助行器选择为 100%,初始位置为 99.9%),并保持了高预测准确率(分别为 99.84% 和 99.69%)。
- 深度学习模型: 4 层 CNN、6 层 CNN 和 EDCNN 在二分类任务中也表现出强劲性能,训练准确率通常超过 98%。
- SVM 表现不一,助行器选择的准确率达到 97.4%,但初始位置的结果较低(90.3%)。
多类姿态分类:
- 挑战: 与二分类任务相比,所有模型在 17 类姿态任务中都面临显著困难。
- XGBoost: 在 17 类任务中实现了 99.24% 的训练准确率,但预测准确率降至 74.1%。当简化为单输出风险分类(站姿、坐姿或不良姿态)时,其预测准确率达到 85.0%。
- 深度学习: 在深度学习模型中,4 层 CNN 在 17 类任务中取得了最高的预测准确率,为 76.0%。EDCNN 和 6 层 CNN 的预测准确率较低(分别为 66.0% 和 75.7%)。
- 几何方法: 在针对 8 种姿态的特定测试中,该方法实现了 89.87% 的总准确率。它在静态姿势(站姿:98.15%)和抬手动作(98% 以上)方面表现异常出色,但在跌倒模拟中的表现有所下降(例如:向后跌倒:60.02%)。
比较指标:
- 对于二分类任务,XGBoost 和几何方法通常产生了最高的 F1 分数。
- 深度学习模型表现出具有竞争力的性能,但在多类分类的复杂性面前更为吃力,特别是随着架构深度的增加(例如 6 层 CNN)。
意义与主张
该论文声称,机器学习,特别是 XGBoost 和几何方法,在增强智能助行器中的人机交互以预防跌倒方面具有巨大潜力。主要贡献包括:
- 机载处理的可行性: 研究表明,使用骨架关键点(文本数据)而非原始图像可以实现高效处理,使得在 Raspberry Pi 4 等资源受限设备上进行实时监测成为可能。
- XGBoost 在二分类任务中的优越性: XGBoost 被确定为确定关键二分类状态(助行器使用情况、坐姿与站姿)最有效的模型,这对于在坐站转换过程中触发刹车等安全机制至关重要。
- 风险因素检测: 虽然多类姿态分类仍然具有挑战性,但以合理的准确率检测“不良姿态”或偏离站姿的情况(例如倾斜、抬手)(XGBoost 单输出的 F1 分数为 83%),为早期跌倒风险检测提供了一种可行方法。
- 隐私与非侵入性: 通过利用安装在助行器上的无标记摄像头系统,该方法避免了与可穿戴传感器相关的隐私问题和可用性障碍。
承认的局限性
作者指出,数据集相对较小(21 名参与者),限制了泛化能力。此外,多类姿态分类的准确率仍低于二分类任务,表明需要更复杂的架构。研究还强调,深度学习的计算需求可能会阻碍其在单板计算机上的部署,且未评估延迟和功耗。未来的工作将致力于现实世界的验证以及整合额外的传感器模式。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。