← 最新论文
⚡ electrical engineering

LiteEvent-AE: Lightweight Autoencoder for Event-Based Vision on Low-Latency Energy-Constrained Edge Devices

本文介绍了 LiteEvent-AE,这是一种用于事件视觉的轻量级自动编码器,它实现了具有竞争力的识别准确率,且参数量减少高达 35.6 倍,能耗降低达 726.3 倍,从而能够在如 Raspberry Pi 4B 和 NVIDIA Jetson Nano 等资源受限的边缘设备上实现实时、可持续的推理。

原作者: Riadul Islam, Joey Mule, Dhandeep Challagundla, Shahmir Rizvi, Sean Carson, Rachit Saini

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Riadul Islam, Joey Mule, Dhandeep Challagundla, Shahmir Rizvi, Sean Carson, Rachit Saini

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在机器视觉的世界里,存在着速度与能量之间的根本权衡。传统的照相机(例如我们智能手机中的照相机)的工作原理是每隔一小段时间捕捉一次场景的完整图像,无论场景是否发生了变化。这产生了一个持续的数据流,其中大部分只是重复的静态背景。为了处理这些数据,计算机必须消耗大量的电量和时间,这对于需要依靠电池运行或进行实时操作的设备(如自动驾驶汽车或小型机器人)来说是一个主要的障碍。为了解决这个问题,工程师们开发了一种不同类型的传感器,称为事件相机(event camera)。这类传感器并不捕捉完整的图像,而是像人类的眼睛一样,仅在单个像素检测到亮度变化时才记录信号。这产生了一种稀疏且异步的数据流,其速度极快且效率极高,但由于缺乏普通照片那种熟悉的网格结构,标准的计算机视觉软件很难理解这种数据。

马里兰大学巴尔的摩分校的研究人员开发了一种新系统,旨在弥补这一差距,使这些超高效传感器能够在不牺牲准确性的情况下应用于小型、低功耗设备。他们创建了一个被称为“自动编码器”(autoencoder)的紧凑型数字工具,它充当了这种独特视觉数据的翻译器和压缩器。该系统通过将事件相机记录的混乱变化流压缩成一种更小、更有序的形式,从而使计算机能够轻松读取。一旦数据被压缩,连接到该系统的简单分类器就能高精度地识别物体,例如人脸或车辆。研究人员在两个不同的数据集上测试了这种方法,一个侧重于人脸,另一个侧重于穿过街道的行人和车辆。他们发现,这种轻量级系统识别这些物体的准确度可以媲美目前现有的最强大、重型模型,但其使用的计算能力仅为后者的一小部分。

这项工作的真正突破在于其在真实硬件上的表现。团队将他们的系统部署在两种常见的资源受限设备上:Raspberry Pi 4B(一种常用于爱好者项目的微型单板计算机)和 NVIDIA Jetson Nano(一种专为边缘计算设计的模块)。在 Raspberry Pi 上,该系统的 50% 自动编码器分类器版本处理数据的效率极高,在评估的推理工作负载中仅消耗了 16.19 焦耳的能量。为了直观理解,运行相同任务的标准化高性能模型在同一设备上消耗的能量将是其 700 多倍。在速度方面,50% 分类器模型在 Jetson Nano 上达到了每秒 44.8 帧的速率,使其能够跟上快速移动的场景。即使研究人员将模型的规模减半以使其变得更小,它仍然保留了学习和识别模式的能力,证明了该系统足够鲁棒,可以在不损失有效性的情况下处理显著的压缩。

这项研究挑战了普遍存在的假设,即高准确度的视觉需要庞大且耗能的计算机。通过展示专门的轻量级架构如何处理事件型数据中复杂且多噪声的特性,作者表明构建既快速又可持续的智能系统是可能的。该系统并不依赖复杂的、耗时的计算或庞大的内存占用,而是使用一种精简的过程来过滤掉不必要的噪声,并只关注定义物体的本质运动。研究结果表明,未来的设备——从自主无人机到可穿戴技术——都可以配备先进的视觉功能,并且能靠单次充电运行数小时,这为新一代环保且高响应性的人工智能开启了大门。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →