Accuracy and Deployability of Deep Neural Networks for Human Action Recognition: A Six-Axis Survey and Controlled Benchmark
本文通过一项六维度的调查与受控基准测试表明,尽管像 R3D-18、R(2+1)D-18 和 MC3-18 这样的深度神经网络在人类动作识别方面取得了高准确率,但实际部署需要平衡识别性能与计算效率、时间鲁棒性以及资源限制,而非仅仅依赖于准确率。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个正在监视繁忙火车站的安全摄像头。它的任务是发现奔跑、跳跃或跌倒的人。多年来,工程师们通过向计算机输入数千小时的视频来教它识别这些动作,让软件学习什么是“跑”以及什么是“走”。目标始终很简单:让计算机尽可能准确。如果机器说“正在跑步”,它应该每次都对。但在现实世界中,准确性只是故事的一半。如果一台计算机可能完美地识别动作,但处理一段视频剪辑需要十秒钟,或者如果它在一小时内就耗尽了电池,那么对于需要即时警报的安全警卫或必须持续一整天的穿戴式设备来说,它是毫无用处的。问题不再仅仅是“它能看见吗?”而是“它能否看得足够快、足够省钱,从而真正投入使用?”
这是来自西达甘加理工学院(Siddagaga Institute of Technology)研究人员解决的一个新课题的核心谜题。他们致力于超越通常用于排名这些视频识别系统的标准评分卡。他们不仅仅是在问哪个模型能获得最高的正确猜测次数,而是在问哪个模型在实际运行中是切实可行的。为了找到答案,他们建立了一个受控的测试场,在那里他们不仅可以测量计算机识别动作的效果如何,还可以测量它消耗了多少能量、思考了多久,以及在视频流断断续续或不完整时表现如何。
研究人员专注于三种特定类型的“计算机大脑”,它们都基于类似的架构,但内部齿轮设计各异。第一种被称为 R3D-18,它将空间和时间作为一个沉重的整体块进行处理。另一种是 R(2+1)D-18,它将这项工作分解,先处理人的视觉形状,然后再单独处理运动。第三种是 MC3-18,它以一种复杂的方式混合了这些方法。团队在两个著名的视频集上测试了所有这三种模型:一个包含 101 种不同的人类动作,另一个包含 51 种。他们在完全相同的条件下运行这些视频,记录下做出决策所需的时间,并测量每一段视频剪辑所消耗的精确电量。
结果揭示了一个挑战常规技术选择方式的明确权衡。在包含 101 种动作的大型数据集上,混合方法模型(MC3-18)是最准确的,其正确识别动作的概率约为 78.5%。然而,这种准确性是以高昂的价格换来的。它处理单个剪辑需要超过 160 毫秒,并消耗了超过 12 焦耳的能量。相比之下,那个将空间和时间结合在一起的模型(R3D-18)虽然准确度略低(约 73.8%),但它极其迅速,仅需 15 毫秒即可完成,且仅使用 1.15 焦耳的能量。第三个模型则处于两者之间,提供了一种平衡。研究表明,“最佳”模型完全取决于具体情况。如果你有一个位于数据中心的强大服务器并且需要最高的准确度,那么这个缓慢且“饥饿”的模型可能是选择;但如果你是在一个小型、电池供电的设备上运行系统,且速度和能量比几个百分点的准确度更重要,那么更快、更精简的模型才是唯一合理的选择。
研究人员随后进一步测试了这些模型如何处理一个常见的现实世界问题:信息缺失。在许多实际场景中,由于网络问题或电力限制,摄像机可能无法发送视频的每一帧。团队测试了在不针对缺失数据进行重新训练的情况下,仅向训练好的模型输入部分视频帧会发生什么。他们使用了一种特定的评分方法来衡量模型在输入稀疏时的稳健性。他们发现,模型对这种减少的处理反应截然不同。其中一个模型 R(2+1)D-18 在获得较少帧数时表现反而更好,其准确度略有上升,同时速度增加了一倍。它似乎是被忽略的额外帧给干扰了。而另一个模型 R3D-18 在移除帧数后,尽管变得更快,但其准确度大幅下降。这证明了不存在减少视频数据的通用规则;节省时间与能量的最佳方式完全取决于你使用的是哪种“计算机大脑”。
为了更进一步,团队还测试了一个可以根据可用功率调整自身行为的系统。他们创建了一个控制器,该控制器可以根据能量预算选择查看完整视频或半个视频。该系统学会了在查看完整剪辑或仅查看一半剪辑之间进行选择,但它从未选择查看四分之一的视频,这表明在测试条件下,该选项并不是一个可行的策略。这表明计算机可以学会调整自己的工作量,但它选择的具体策略取决于模型的类型和正在观看的特定视频。它并没有找到一种适用于所有情况的“完美”节能方法。
该研究得出结论,人类动作识别的未来在于停止对单一“最佳”准确度数字的痴迷。相反,工程师必须将这些系统视为一系列相互竞争的需求的平衡表。一个系统不仅仅是一个分类器;它是一个消耗时间和能量来产生结果的机器。用于监测患者跌倒的医院系统,与用于追踪跑步者步数的智能手表系统,其需求可能完全不同。研究人员认为,我们需要通过同时观察准确度、速度、能量消耗和稳健性来设计和评估这些工具。通过这样做,我们可以从构建仅在实验室里聪明的模型,转向构建在现实世界中真正实用的系统——即使在资源匮乏且视频流不完美的情况下,也能做出智能决策。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。