← 最新论文
🤖 machine learning

End-to-End Keyword Spotting on FPGA Using Graph Neural Networks with a Neuromorphic Auditory Sensor

本文提出了首个将神经形态听觉传感器与图神经网络集成的关键词识别系统的端到端FPGA实现,实现了对原始事件驱动音频流的实时低功耗处理,准确率达87.43%,延迟低于35微秒。

原作者: Wiktor Matykiewicz, Piotr Wzorek, Kamil Jeziorek, Tomás Muñoz, Antonio Rios-Navarro, Angel Jiménez-Fernández, Tomasz Kryjak

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Wiktor Matykiewicz, Piotr Wzorek, Kamil Jeziorek, Tomás Muñoz, Antonio Rios-Navarro, Angel Jiménez-Fernández, Tomasz Kryjak

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个微小的、电池供电的机器人理解当有人说特定单词(如“停”或“走”)时的含义。通常,要做到这一点,机器人必须聆听整个声音,将其录制下来,切割成微小片段,然后分析这些片段。这个过程就像为了找到某一句特定的话而通读整本书——它需要大量的时间、能量和内存。

本文提出了一种全新的、超高效的方法,利用一种特殊的“机器人耳朵”和直接构建在单个计算机芯片(称为 FPGA)上的“大脑”来实现这一目标。

以下是他们如何实现这一点的解释,辅以简单的类比:

1. “机器人耳朵”(神经形态传感器)

大多数麦克风的工作原理就像节拍器:无论是有噪音还是寂静,它们每秒都会对声音进行 44,000 次“快照”。即使在没有发生任何有趣事情时,这也会产生海量数据。

研究人员使用了一种神经形态听觉传感器(NAS)。不要将这种传感器想象成拍照的相机,而要将其想象成一名高度敏感的保安

  • 工作原理:只有当房间内发生变化时,保安才会举手(发送信号)。如果房间寂静无声,保安就静止不动。如果一只鸟鸣叫,保安就举一次手。
  • 结果:传感器发送的不是持续的数据流,而是稀疏的、基于“事件”的流。这就像只在发生重要事情时发送一条短信,而不是发送空房间的实时视频流。这节省了巨大的能量。

2. “智能过滤器”(滤波)

即使有了智能传感器,有时“保安”也会过于兴奋,对同一个声音举手太多次。这会制造出大量不必要的噪声。

研究人员添加了一个滤波阶段。想象这就像一名俱乐部保镖

  • 保镖有一条规则:“如果你最近已经举过手,那么在再次举手之前要等待片刻。”
  • 这名保镖在不丢失重要信号的情况下,切除了大约47% 的额外信号。事实上,通过去除噪声,机器人理解单词的能力反而比以前更好了。

3. “大脑”(图神经网络)

一旦信号被过滤,就需要对其进行理解。通常,计算机是像时间线一样直线地处理声音。但由于这些信号是分散且不规则的,研究人员使用了图神经网络(GNN)

不要把图神经网络想象成一条直线,而要将其想象成一张社交网络地图

  • 每个“事件”(保安举手)都是网络中的一个人。
  • 系统观察谁站在谁旁边,以及他们在时间和空间上是如何连接的。
  • 系统不是将数据强行塞入僵硬的网格中,而是构建一个动态的连接网络,以确定说了什么单词。对于此类数据,这种方法更加灵活且高效。

4. “一体化芯片”(FPGA 实现)

本文最大的成就在于,他们不仅是在强大的计算机上模拟了这一系统,而是将整个系统构建在单个小型芯片(FPGA)上

  • 类比:想象将麦克风、保镖和大脑全部构建在一个微小的乐高积木内部。
  • 优势:由于所有组件都在同一块芯片上,数据无需在计算机的不同部分之间来回传输。它保持本地化。这使得系统速度极快且功耗极低。

结果:速度与效率

团队使用著名的单词列表(Google Speech Commands)对该系统进行了测试。以下是他们的发现:

  • 准确率:即使在简化后运行于小型芯片上,它也能在约**87%**的情况下正确识别单词。
  • 速度:快如闪电。从声音接触传感器到芯片做出决定的时刻,耗时不到35 微秒。为了让你有个概念,人类眨眼大约需要 300,000 微秒。芯片做出决定的时间仅相当于眨眼开始所需的时间。
  • 功耗:它消耗的电力非常少(约1.12 瓦),大约相当于一个小 LED 灯泡的功率。这使其非常适合电池供电的机器人或物联网设备。

为什么这很重要

该论文声称,这是首次有系统成功地将神经形态传感器和图神经网络结合在单个芯片上,以实时处理原始音频。

与需要大量预处理(例如在分析之前将声音转换为复杂图像)的其他系统不同,该系统直接处理原始“事件”。这意味着它跳过了繁重的体力劳动,节省了时间和电池寿命,使其成为移动机器人智能设备的理想选择,这些设备需要在不耗尽电池的情况下即时聆听并做出反应。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →