SIR-PhysNet: a deadline-aware ultra-lightweight pipeline for camera-based heart-rate monitoring on embedded hardware
该论文介绍了 SIR-PhysNet,一种超轻量级、具有截止日期感知能力的 rPPG 流水线,它将几何与光照处理卸载到固定成本的操作中,并使用解析傅里叶掩模进行心率提取,从而实现在如树莓派 5 等资源受限的边缘设备上的实时、高精度监测,在这些设备上,性能瓶颈在于人脸检测而非网络推理。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个这样的世界:无需一根电线、一个传感器或一次接触,就能读取你的心跳。这就是基于摄像头的健康监测所承诺的前景,这一领域将普通的视频转化为观察人体最重要生命节律的窗口。其背后的科学原理依赖于一个简单且无形的真相:每当你的心脏跳动时,它都会向你的脸部泵出一股微小的血液涌流,使你的肤色发生百分之零点几的变化。这些变化对于肉眼来说过于细微,但摄像机却能捕捉到它们。通过分析这些细微的光影和色彩变化,就可以计算出心脏跳动的频率。这项技术已经正在被考虑用于汽车中以监测驾驶员疲劳、在医院中追踪患者,以及在智能家居中照看老年人。然而,为了在现实世界中发挥作用,进行数学运算的计算机必须足够快,能够跟上视频的节奏,并且必须足够小巧高效,使其能够运行在可以放在架子上或口袋里的设备上,而不仅仅是在庞大的数据中心里。
东北大学的一个研究小组构建了一个专门旨在解决速度和尺寸问题的全新系统。他们将自己的创造物称为 SIR-PhysNet,这是一个作为将原始视频转化为心率数值的完整工作流的流水线。他们面临的核心挑战不仅是让数学运算变得精确,还要确保整个过程能在下一帧视频到达之前完成任务。在他们的设置中,系统必须处理视频流、寻找面部、清理图像,并在每 2.5 秒内计算出一个新的心率估计值。如果计算机耗时过长,系统就会落后,数据就会变得毫无价值,监测也会失败。研究人员发现,最大的瓶颈不在于系统的复杂“大脑”,而在于寻找面部的“眼睛”。
为了构建一个能在树莓派 5(一种常用于爱好者和工程师的小型、廉价计算机)上运行的系统,团队不得不重新思考如何分配工作。大多数之前的尝试都试图教一个单一的、庞大的计算机程序去做所有事情:寻找面部、忽略阴影、处理头部运动以及计算心率。这种方法需要大量的内存和处理能力,使得小型设备无法负担。新的方法 SIR-PhysNet 将工作分成了两个截然不同的部分。首先,它使用简单的固定规则来准备图像。在计算机通过视频寻找模式之前,它先使用标准的图像工具锁定面部、修正头部角度并消除光线变化的影响。这一步就像是在分析艺术品之前,先给画作加上画框并擦净玻璃;它让后续计算机的工作变得轻松许多。通过使用这些简单的工具来承担繁重的预处理工作,研究人员得以将系统的复杂部分缩小到极小的规模,仅需其他模型一小部分的内存和功率。
系统的第二部分是实际的心率计算器。由于图像已经被第一步清洗并稳定下来,这部分系统不需要一个庞大、沉重的网络。它是一个仅拥有 0.26 百万参数(这个数字代表了它需要记忆的信息量)的紧凑模型。该模型并没有试图重建整个血液脉冲波的形状——这对仅仅是为了计数跳动来说是一个复杂且不必要的任务——而是直接预测心跳的主导频率。然后,它使用数学滤波器从信号中提取出速率。这种设计选择意味着该系统极其高效,仅使用 0.12 十亿次浮点运算(gigaflops)的计算能力,这是衡量其每秒执行计算次数的指标。
研究人员在多个不同的视频数据集上测试了他们的系统,包括人们在跑步机上锻炼时的录像,在这种情况下,头部运动和汗水使任务变得非常困难。在一个标准的、受控的数据集上,该系统的准确度达到了与更大型、更复杂模型相匹配甚至超越的水平。在困难的跑步机数据集上,它产生的平均误差仅为每分钟 3.39 次跳动,这一结果与比它大十倍的系统相当。这证明了通过先清洗图像,系统可以在不牺牲处理现实世界混乱情况的能力的前提下,保持小巧和快速。
为了观察该系统是否真的能在其设计的微型硬件上运行,团队将其安装在一个带风扇冷却的树莓派 5 上。他们连续运行了八个小时,处理了超过 80 万帧视频。结果非常明确:系统保持了 34.60 帧/秒的稳定速度,轻松超过了跟上视频流所需的 30 帧/秒。计算机的温度峰值升至 68.85 摄氏度,但从未因过热而减速或关机。最令人惊讶的发现来自于对时间分配的研究。复杂的心率计算(即大多数人认为最难的部分)仅占每次更新允许时间的约 13%。另外 70% 的时间则花在了寻找面部和调整图像上。
这一发现改变了人们对这些系统限制因素的理解。研究人员发现,心率监测器的速度受限并非因为计算机模型的智能化程度,而是因为在视频中寻找并追踪面部所付出的努力。他们测试了一种策略,即系统每隔几帧才寻找一次面部,并在其间使用更简单的方法来猜测面部的移动位置。这种“检测并追踪”的方法让系统能够加速到接近 47 帧/秒,证明如果优化了“找脸”这一步骤,还有很大的提升空间。
研究得出结论:对于在小型设备上进行基于摄像头的健康监测而言,成功的关键不在于构建一个更大、更聪明的“大脑”,而在于构建一对更好的“眼睛”和一个更清晰的工作流。通过在复杂模型接触数据之前,利用简单、可预测的工具来处理现实世界中杂乱的部分,系统可以保持足够小,从而运行在仅有扑克牌大小的设备上。研究人员谨慎地指出,虽然他们的系统在所测试的特定视频上表现良好,但尚未被证明适用于所有类型的摄像机、光照条件或肤色。他们还指出,他们的系统旨在提供一个通用的心率数值,而不是用于诊断心脏疾病或检测心律不齐。然而,这项工作提供了一条清晰的路径:要使健康监测真正实现便携化和普及化,重点必须从增加模型的复杂性转向提高整个流水线的效率与平衡。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。