← 最新论文
🤖 machine learning

Helios 2.0: A Robust, Ultra-Low Power Gesture Recognition System Optimised for Event-Sensor based Wearables

本文介绍了 Helios 2.0,这是一款用于智能眼镜的超低功耗(6–8 mW)事件相机系统,该系统仅使用合成训练数据和自然微手势就实现了最先进的手势识别准确率(F1 分数超过 80%),代表了比现有解决方案降低 25 倍功耗并提升 20% 准确率的突破。

原作者: Prarthana Bhattacharyya, Joshua Mitton, Ryan Page, Owen Morgan, Oliver Powell, Benjamin Menzies, Gabriel Homewood, Kemi Jacobs, Paolo Baesso, Taru Muhonen, Richard Vigars, Louis Berridge

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Prarthana Bhattacharyya, Joshua Mitton, Ryan Page, Owen Morgan, Oliver Powell, Benjamin Menzies, Gabriel Homewood, Kemi Jacobs, Paolo Baesso, Taru Muhonen, Richard Vigars, Louis Berridge

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一副能够理解你的手势,而无需你进行任何触碰的智能眼镜。多年来,通过简单的手势控制数字设备的梦想一直受到一个顽固问题的阻碍:用于识别这些动作的技术过于耗电。传统的摄像头每秒拍摄多次图像,会迅速消耗电池,这使得它们对于需要全天运行的眼镜来说并不实用。为了解决这个问题,科学家们转向了一种不同的“眼睛”,一种模仿人类视网膜的眼睛。这种传感器并不捕捉完整的图像,而是只在像素感知到变化时才发出微小的信号。这种方法极其高效,但要教计算机仅使用这些稀疏的信号来理解手部细微且转瞬即逝的动作,仍然是一个巨大的挑战。

Ultraleap 的研究团队现在构建了一个名为 Helios 2.0 的系统,终于让这一愿景成为了现实。他们创建了一个模型,可以在智能眼镜上识别特定的、自然的 Hand Gestures(手势),且几乎不消耗电量。该系统旨在直接在眼镜上运行,使用专门的处理器来处理繁重的计算任务。研究人员专注于两种简单且直观的动作:拇指摩擦食指,以及拇指与食指捏合。这些不是大幅度、戏剧性的动作,而是符合人体自然生理的微小、快速的手势。通过训练他们的软件来捕捉这些微动作,他们实现了一种既有响应性又具有社交隐蔽性的控制方式,允许用户在无需伸手触摸镜框的情况下与设备进行交互。

到达这一阶段的过程需要克服数据收集和计算机学习方式方面的重大障碍。收集足够多关于人们做出这些手势的真实世界案例是困难、耗时且昂贵的。为了绕过这个问题,团队构建了一个复杂的模拟器。这个虚拟环境允许他们生成数百万个手部动作示例,并包含了光照、手部大小和肤色的各种变化。他们在这种纯数字世界中教会了计算机识别手势,使用了一种将不同动作融合在一起以创建真实序列的方法。这种方法意味着他们不需要花费数月时间去拍摄数百人来建立训练库。一旦模型在模拟中学会了这些模式,他们就在真实的办公室甚至阳光明媚的户外对真实的人进行了测试。

结果令人瞩目。当该系统在标准计算机处理器上运行时,消耗了中等程度的功率;但当研究人员将其优化为在现代智能手机中常见的低功耗数字信号处理器上运行时,能耗急剧下降。该系统的运行功率仅为 6 到 8 毫瓦,这种效率水平使得眼镜能够保持手势识别处于常开状态,而不会耗尽电池。在测试中,该模型在不同用户和环境下正确识别手势的准确率超过了 80%,这比以往的尝试有了显著提升。它反应也非常迅速,决策时间仅为 2.35 毫秒,这足以让用户感觉到是即时响应的。

这项成就之所以特别重要,是因为它解决了速度、准确性和功耗之间的权衡问题。以前的系统要么需要笨重的硬件,要么消耗过多能量导致无法进行全天佩戴,或者难以区分刻意的姿势与人走路时的自然摆动。Helios 2.0 成功实现了体积小巧、高效,同时又足够聪明,能够忽略误报。研究人员证明,通过使用五阶段架构(即将最耗费计算的部分交给低功耗芯片处理),他们可以将能耗与之前的研究相比降低 25 倍,同时提高识别的准确性。这表明,一种“始终在线”、无需接触即可交互的智能眼镜时代不再是一个遥远的可能,而是一项已经准备好投入使用的技术。

团队还非常关注使用者的多样性。他们用 20 名不同手部大小和肤色的个体对模型进行了测试,以确保其公平性。他们发现,即使背景发生变化(例如从昏暗的办公室移动到明亮的户外环境),系统依然保持稳健。这种可靠性对于一款旨在现实世界中使用的设备至关重要,因为现实中的光照和环境永远是不恒定的。通过证明基于模拟数据训练的模型可以如此完美地泛化到真实人类身上,研究人员为可穿戴技术开辟了一条新路径。他们证明了构建智能、响应迅速的交互界面是可能的,而且不需要用户携带额外的硬件或学习复杂的指令,只需像平时那样自然地移动双手即可。

这项工作代表了我们看待人机交互方式的转变。长期以来,人类最直观的交互方式——使用双手——往往是实现起来最困难的一种可穿戴形式。电池寿命和处理能力的限制迫使设计师依赖按钮、触摸板或语音命令,而这些方式有时会显得尴尬或具有侵入性。Helios 2.0 移除了这些障碍,它展示了摄像头既可以敏锐到捕捉微小的动作,也可以高效到能够持续运行。该系统不仅能识别手势,还能理解动作的语境,从而区分出是为了翻页而进行的滑动,还是调整眼镜时的无意识动作。这种在极低功耗下实现的细微差别处理,为未来开启了大门——我们的数字助手将始终在倾听,但仅针对我们选择给出的微妙信号做出反应。

研究人员并未止步于仅仅构建模型;他们还创建了一套全面的工具以确保成功。他们开发了一种展示事件相机(event camera)数据的新方法,将其分解为捕捉运动流而非静态图像的时间基表面(time-based surfaces)。这使得计算机能够将手势视为一个随时间展开的故事,而不仅仅是一个静态快照。通过结合这种方法,并考虑到手部在三维空间中的旋转和移动方式,他们确保了系统能够处理人类动作的自然变异性。其结果是,这项技术感觉不像是在让机器解释指令,而更像是一个预判需求的伙伴。

随着可穿戴计算领域的不断演进,在无需物理接触的情况下与世界进行交互变得越来越有价值。Helios 2.0 的研究为如何在不牺牲电池寿命或用户体验的前提下实现这一目标提供了蓝图。它表明,通过重新思考感知和学习的基本方法,我们可以创造出既强大又高效的系统。未来的方向包括扩大手势的词汇量,并精炼系统以更贴近地适应个体用户,但基础已经奠定。通过一个安静、高效且已准备好应对现实世界的系统,智能眼镜通过我们的自然动作来理解我们的梦想,现在已触手可及。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →