平衡是人类运动中静默的引擎,是一种让我们能够行走、伸手和转身而不会跌倒的无形技能。它是如此基础,以至于我们很少注意到它,直到它失效为止,届时后果可能非常严重,尤其是对于老年人而言。当稳定性丧失时,结果往往是跌倒,这是导致老年人受伤和死亡的主要原因。虽然医生长期以来一直依赖关于既往跌倒情况的简单提问或基础体能测试来评估一个人的稳定性,但这些方法往往无法捕捉到一个人实际运动能力的细微差别。它们难以区分一个仅仅是稳健的人与一个异常敏捷的人,并且经常会遇到一个“天花板”,即即使是最优秀的个体也与仅仅合格的人获得相同的最高分。为了超越这些局限性,研究人员需要一种既精确又易于获取的方法来衡量平衡能力,从而捕捉从受损人群到精英人群的完整人类稳定性光谱。
斯坦福大学的一个研究小组开发了一种名为“斯坦福平衡水平评估”(Stanford Balance Level Evaluation,简称 StaBLE)的新方法,旨在利用仅有的智能手机实现数字化的精准平衡测量。该方法并非依赖临床医生的主观判断或粗略的评分系统,而是记录一个人执行一系列具有挑战性的身体任务的过程,并利用计算机视觉详细分析他们的动作。该团队招募了 180 名能力各异的参与者,范围涵盖了患有影响平衡的医疗状况的个体到专业的芭蕾舞演员和体操运动员。他们要求这些参与者执行 18 种不同的任务,例如闭眼单腿站立、跳跃和倒退行走,同时由布置在周围的三部智能手机进行拍摄。随后,该系统将视频片段转换为一个单一且连续的分数,该分数反映了个人完成每项目标的表现,从动作的速度到姿态的稳定性。
这种新评估的结果表明,它能够捕捉比传统临床测试更广泛的能力范围。当研究人员将这种新的数字评分与现有方法进行比较时,他们发现旧的测试往往无法区分高水平的表现者。例如,在标准评估中,研究中的几乎所有精英运动员都获得了最高可能的分数,这使得无法分辨出谁才是真正的平衡能力最强。相比之下,StaBLE 分数将这些运动员区分开来,揭示了旧测试所忽略的其表现中的细微差异。新分数也与年龄强相关,显示出随着年龄增长,平衡能力呈现明显的下降趋势,并且与人们对自身平衡感的信心感官高度一致。至关重要的是,数字评分能够区分那些存在跌倒风险的人与那些不存在风险的人,而一些传统测试在观察有跌倒史的人群时未能做出这种区分。
为了使这种评估在日常使用中具有实用性,研究人员调查了是否可以在不损失准确性的情况下缩短测试时间。他们使用统计方法来确定哪些特定的任务提供了最有价值的信息。他们发现,包含一项动态平衡测试(即人在单腿站立时向不同方向伸手)在内的五个特定任务的小型子集,可以高精度地预测总分。这个缩短后的版本可以在不到十分钟内完成,使其能够在诊所或社区中心开展。这项研究表明,通过将多样化的身体挑战与数字分析相结合,可以创造出一种既客观又足够灵敏的平衡评估工具,能够检测出表现的提升或下降。这项工作表明,平衡测试的未来可能在于易于获取的、基于视频的工具,这些工具能够以以往只有昂贵、专业的实验室才能实现的清晰度来测量人类的运动。
技术摘要:StaBLE —— 数字指标捕捉平衡性能
问题陈述
平衡是人类运动能力和独立性的基础,然而其评估在临床和研究领域仍是一项重大挑战。现有方法存在两极分化:临床筛查工具(如 Mini-BESTest、4阶段平衡测试、SPPB)虽然易于广泛使用,但依赖于粗略的定序评分系统,表现出“天花板效应”,限制了其区分高水平个体或检测细微进步的敏感性。相反,基于实验室的运动学测量虽然具有高精度,但由于成本、设备要求以及对专业操作人员的需求,难以在广泛范围内推广。此外,回顾性跌倒史常被用作平衡能力的替代指标,但这容易受到报告偏差的影响,且无法捕捉平衡控制的多维特性。目前迫切需要一种定量、客观且易于获取的平衡评估方法,以克服现有量表的局限性,同时保持对不同人群的可行性。
方法论
作者开发了斯坦福平衡水平评估(Stanford Balance Level Evaluation, StaBLE),这是一个旨在利用数字动作捕捉技术捕捉广泛平衡能力的综合方案。
- 参与者: 研究招募了 180 名参与者(年龄 18–87 岁),其平衡能力各异,涵盖了从功能障碍者(前庭功能障碍、帕金森病、周围神经病变)到精英平衡者(职业芭蕾舞演员、杂技演员、大学体操运动员)的不同群体。
- 方案: 评估由 18 项具有平衡挑战性的任务组成,包括静态站立、动态运动(跳跃、伸手触及)以及步态任务。其中五项任务包含闭眼环节,以挑战感觉整合能力。
- 数据采集: 数据通过 OpenCap 进行采集,这是一种开源的无标记动作捕捉系统,利用三台智能手机摄像头和一台笔记本电脑实现。实验设置进行了标准化处理,包括特定的相机高度、方向以及背景幕布,以最大限度地减少视觉噪声。单名实验员即可执行该方案,完成所有运动试验大约需要 25–35 分钟。
- 特征工程: 从视频数据中提取了 76 个数字特征来量化任务表现。这些特征测量了生物力学目标,例如峰值垂直质心速度、峰值跖屈、摆动偏差和保持时间。
- 评分算法:
- 归一化: 每个特征根据整个数据集中的最小值和最大值被归一化至 [0, 1] 量程。对于最大化目标(如速度)和最小化目标(如摆动),均进行了相应的缩放处理。
- 聚合: 归一化后的特征被平均用于创建 18 个任务得分。这些得分进一步聚合为一个单一的 StaBLE 得分,得分越高表示表现越好。
- 处理失败情况: 对于无法完成任务或无法达到特定目标的参与者,其对应特征的得分被设定为 0。
关键结果
- 分布与天花板效应: 在该队列中,StaBLE 得分呈现左偏分布(均值:0.64,范围:0.08–0.84)。至关重要的是,该得分展现出无天花板效应;即使在精英平衡者中,也没有人获得满分 1.0。相比之下,现有量表显示出显著的天花板效应(例如,24/26 名精英平衡者在 Mini-BESTest 的“提踵”任务中获得了最高分)。
- 有效性与相关性:
- 年龄: 与年龄呈强负相关(ρ=−0.76,p<0.001)。
- 自我效能感: 与特定活动平衡信心(ABC)量表呈正相关(ρ=0.60,p<0.001)。
- 临床量表: StaBLE 得分与 Mini-BESTest (τ=0.55)、4阶段平衡测试 (τ=0.55) 以及短体能问卷 (SPPB) (τ=0.57) 的估算得分显著相关。
- 跌倒风险区分: 通过 StaBLE 得分,能够显著区分被识别为“有跌倒风险”(通过 CDC STEADI 标准)与“无跌倒风险”的参与者(Kolmogorov-Smirnov 检验:KS=0.67,p<0.001)。此外,StaBLE 得分还能区分有跌倒史与无跌倒史的人群,而现有量表(4阶段平衡测试、SPPB)在该数据集中的统计差异并不显著。
- 任务子集选择: 通过前向子集选择法,作者发现由五个任务组成的子集(Y-平衡、闭眼单腿站立、倒退行走、转向行走、闭眼单腿站立提踵)即可解释全量 StaBLE 得分 88% 的方差。这表明存在一种缩短时间(低于 10 分钟)且仍能保持预测能力的评估潜力。
意义与主张
论文声称 StaBLE 通过以下方式实现了平衡数字健康指标的重要进展:
- 克服天花板效应: 通过利用连续的运动学特征而非定序临床评分,StaBLE 能够区分从功能障碍到精英水平的整个能力谱系,而不会触及性能上限。
- 易获取性与可扩展性: 该方案利用了普及的智能手机技术和无标记动作捕捉(OpenCap),允许在非实验室环境(如舞蹈工作室、社区中心)中由单名操作员进行高质量的数据采集。
- 客观量化: 该得分提供了一个客观、数据驱动的测量手段,避免了临床观察的主观性以及回顾性自我报告的局限性。
- 风险区分: 该指标成功识别了跌倒风险组与非风险组之间,以及有跌倒史与无跌倒史者之间的平衡能力统计差异,而传统量表在这些方面表现出局限性。
作者保持了审慎的态度,指出该得分仅是单一点位性能的“快照”,并需要在测试-再测试信度、针对训练的纵向反应以及前瞻性跌倒预测方面进行进一步验证。他们强调,虽然该得分可以识别平衡缺陷,但尚未能精准定位具体的底层子系统原因(例如,由于设备限制,未包含反应性平衡)。这项工作为未来的临床转化和更具特异性的诊断指标开发提供了经过验证的基准。
每周获取最佳 bioengineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。