← 最新论文
💻 computer science

Neuromorphic visual attention for Sign-language recognition on SpiNNaker

本文提出了一种用于美国手语手指语识别的节能、低延迟神经形态架构,该架构集成了脉冲视觉注意力机制与部署在 SpiNNaker 平台上的紧凑脉冲神经网络,在实现具有竞争力的准确性的同时,显著降低了功耗与延迟,以满足实时边缘部署的需求。

原作者: Sarka Liskova, Olha Vedmedenko, Mazdak Fatahi, Matej Hoffmann, P. Michael Furlong, Giulia D Angelo

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Sarka Liskova, Olha Vedmedenko, Mazdak Fatahi, Matej Hoffmann, P. Michael Furlong, Giulia D Angelo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在拥挤嘈杂的房间里辨认朋友的手势。如果你试图同时分析房间里的每一个人、每一件家具和每一个电灯开关,你的大脑就会不堪重负,导致你反应太慢而无法应对。相反,你的大脑会自然地“放大”到只关注双手,而忽略其余的混乱。

本文描述了一个计算机系统的构建,旨在实现完全相同的功能,但专门用于手语。其目标是创造一种微小、超快且节能的设备,能够实时理解美国手语(ASL)的手指拼写(字母表),就像智能手表或机器人的眼睛一样。

以下是该系统的运作方式,分解为简单的概念:

1. “超级之眼”(基于事件的感觉)

大多数相机的工作原理就像电影放映机:即使没有任何物体在移动,它们也会每秒拍摄 30 或 60 张完整的画面(帧)。这会产生大量不必要的数据。

本文中的系统使用了一种特殊的相机,称为动态视觉传感器(DVS)。不要将这种相机想象成电影放映机,而要将其想象成房间里布满了无数微小的独立运动探测器。只有当某物发生变化时,它才会“发声”。如果手移动了,相机就会发送一个微小的信号说:“嘿,这里有东西在动!”如果手停止了,相机就会保持静默。

  • 优势:这就像听一场对话,人们只有在有新内容要说时才会开口。它节省了巨大的能量和时间,因为系统不会浪费电力去处理空白的墙壁。

2. “聚光灯”(视觉注意力)

即使使用了运动感应相机,仍可能存在背景噪声。研究人员添加了一种“聚光灯”机制(称为脉冲视觉注意力)。

  • 类比:想象一下剧院里的舞台监督。当一名演员(手)移动时,舞台监督会立即将聚光灯只打在那名演员身上,并调暗舞台其余部分的灯光。
  • 作用:系统查看运动信号流,找到手,并剔除其他所有内容。然后,它将仅包含手的图像缩小到一个小巧、易于处理的尺寸,发送给“大脑”。

3. “微型大脑”(神经形态计算)

一旦系统获得了被聚光灯照亮的图像,它就需要识别这是字母表中的哪个字母(A、B、C 等)。

  • 硬件:他们没有使用标准计算机芯片(如笔记本电脑中的芯片,那就像是一个按顺序处理所有任务的巨型工厂),而是使用了一种特殊的芯片,称为SpiNNaker
  • 隐喻:将标准计算机想象成一位试图一次切一个洋葱、总共切 1000 个洋葱的厨师。而 SpiNNaker 芯片则像是一支由 1000 名小厨师组成的团队,每个人在同一时刻切一个洋葱。这被称为神经形态计算。它模仿了生物神经元的工作方式:它们只在接收到信号时才会“放电”,而且速度极快,耗电极少。

4. 结果:快速、廉价且小巧

研究人员在以下两方面测试了该系统:

  1. 合成数据:他们利用计算机模拟,将旧的手势照片转换为“运动事件”。
  2. 真实数据:他们使用真实相机在办公室录制人们做手势的画面。

性能表现

  • 速度:系统速度极快。识别一个手势仅需3 毫秒。为了便于理解,人类眨眼大约需要 300 毫秒。该系统的速度是眨眼速度的 100 倍,这意味着它感觉上是瞬间完成的。
  • 能耗:它消耗的功率极小(约0.565 毫瓦)。这个数值如此之低,理论上它可以依靠小电池运行很长时间,使其非常适合可穿戴设备。
  • 准确率
    • 在模拟数据上,其准确率约为92%
    • 在真实世界相机数据上,其准确率约为83%
    • 虽然并非完美,但论文指出,考虑到该系统与其他庞大且耗电的系统相比是多么小巧和简单,这是一个非常有力的结果。

为什么这很重要(根据论文观点)

论文认为,当前的手语系统通常过于缓慢或功耗过高,无法用于实时、互动的场景(例如机器人与听障人士交谈)。通过结合“仅运动”相机、“聚光灯”以忽略背景噪声,以及并行处理事物的“微型大脑”,他们创造了一个具有超低延迟(即时)和超低功耗的系统。

作者总结道,这种特定的设置证明了构建紧凑、高效的系统是可能的,该系统可以在“边缘”(即直接在手表或机器人等设备上,而无需将数据发送到大型云服务器)识别手语字母。

简而言之:他们构建了一种超高效、受生物启发的机器,它忽略背景,只专注于手,并利用极少的电池电量几乎瞬间读取手语字母。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →