← 最新论文
⚡ electrical engineering

Towards smart and adaptive agents for active sensing on edge devices

本文介绍了一种紧凑的、基于主动推理的智能体系统,该系统通过允许设备动态规划并控制摄像机运动以克服传统 TinyML 方法的局限性,使资源受限的边缘设备能够实现实时的、自适应的主动感知。

原作者: Devendra Vyas, Nikola Pižurica, Nikola Milović, Igor Jovančević, Miguel de Prado, Tim Verbelen

发布于 2026-09-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Devendra Vyas, Nikola Pižurica, Nikola Milović, Igor Jovančević, Miguel de Prado, Tim Verbelen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下这样一台摄像机,它不仅仅是在记录世界,而是在主动选择观察的对象,就像人类的眼睛在细节之间跳跃,以构建出一幅完整的画面。这就是主动感知(active sensing)的领域——在这种概念中,机器不再是被动地等待数据,而是通过移动传感器来收集最有用的信息。多年来,人们一直梦想着能将这种智能、自适应的行为赋予小型、电池供电的设备,让它们能够直接部署在发生动作的现场(例如安全摄像机或机器人上),而无需将数据发送到遥远的云端服务器。挑战在于,能够实现这种功能的强大人工智能系统通常需要海量的计算能力和内存,这使得它们无法在这些小型、本地设备上运行。

现在,一组研究人员开发出了一个弥合这一差距的系统,创建了一个能够在仅相当于一块小型计算机板大小的设备上实时进行观察、规划并移动摄像机的智能代理。这项发表在近期研究中的工作证明,将两种不同的人工智能方法相结合是可行的:一种擅长识别图像中的物体,另一种擅长在不确定性下做出决策。其结果是一个“扫视代理”(saccade agent,得名于人类为了聚焦细节而进行的快速、跳跃式眼动),它可以控制摄像机追踪人员或自主探索房间。该系统完全在边缘设备上运行,这意味着它在本地处理所有内容,从而确保了快速反应并保证了数据的私密性。

研究人员面临着一个特定的问题:标准的深度学习模型虽然非常擅长识别视频流中的人或车,但它们是僵化的。一旦训练完成,如果环境发生变化或需要决定下一步看向哪里以寻找新事物,它们就会难以应对。它们依赖大量的数据和计算能力来进行学习,这与小型、低功耗设备的需求背道而驰。为了解决这个问题,团队并没有试图让深度学习模型变得更大或更聪明,而是在其之上添加了第二层智能,其基础是一种被称为“主动推理”(active inference)的原理。这种方法将代理视为一个不断更新其对世界认知观的“科学家”。它会问自己:“我预期会看到什么?”以及“什么会让我感到意外?”如果摄像机没有看到新东西,代理就会决定移动到另一个位置以获取更多信息。如果它看到了有趣的东西(比如一个人),它就会聚焦于此。这种决策过程极其轻量化,所需的内存非常少,因此可以与较重的目标检测软件协同运行。

为了测试这个想法,团队使用了一个 NVIDIA Jetson 设备构建了一个物理原型,这是一款专为边缘侧人工智能任务设计的强大计算机。他们将该设备连接到一个可以平移和倾斜的摄像机上,类似于许多建筑中使用的监控摄像头。系统被赋予了一个简单但强大的任务:观察场景并决定镜头指向何处。系统的第一部分,即感知模块,使用了一种名为 YOLO 的知名目标检测工具来扫描视频流,寻找人员或物体。该工具经过优化,可以在设备的硬件上快速运行。第二部分,即规划模块,接收来自物体的列表,并利用主动推理来决定下一步动作。它会计算摄像机应该转向哪个方向,以继续注视某个人,或者扫描空白区域以查看是否出现了新的事物。

结果显示,这种组合在硬件的严格限制内表现得非常出色。整个系统(包括运行所需的软件)所占用的内存足迹仅为 304 MB,对于人工智能系统来说这非常微小。在一种配置下,摄像机每秒可以处理视频并做出关于下一步看向何处的决策 108 次,这一速度足以让观察者感到瞬时响应。在另一种设置中,系统优先考虑速度而非内存,实现了每秒 45 帧的视频分析,同时每秒进行 250 次决策。研究人员发现,决策所需的时间极短,以至于系统可以轻松跟上视频流,使摄像机能够平滑地跟随移动目标或横扫房间而没有延迟。

这项成就的意义不仅在于摄像机能够移动,更在于它移动的方式。该代理并非遵循预设的路径,而是实时对环境做出反应。如果一个人走进画面,摄像机会锁定目标;如果那个人移动,摄像机会跟随;如果那个人离开了且房间空无一人,代理会决定扫描房间的其他部分,以观察是否发生了其他情况。这种行为模仿了人类自然探索周围环境的方式,即在关注重要事物与保持对全局的感知之间取得平衡。研究人员通过将摄像机安装在一个小型机器人上展示了这一点,表明该系统可以帮助机器高效地探索新环境并收集信息,而无需人工干预。

该研究还仔细测试了在硬件上运行软件的不同方式,以寻找速度与内存使用之间的最佳平衡。他们发现,使用专为设备图形处理器设计的特定工具,可以让系统运行得更快,优于使用标准方法。然而,他们也发现,对于决策部分这个非常小的模块,尝试在强大的图形处理器上运行反而会降低速度,因为管理该任务的开销超过了额外性能带来的收益。这一发现强调了将正确的软件工具匹配给正确的硬件的重要性,这是使这些系统在实际应用中变得切实可行的关键步骤。

这项工作表明,智能设备的未来并不一定需要庞大的云端超级计算机。通过将强大的视觉能力与轻量级的规划能力相结合,可以创造出既聪明又高效的代理。研究人员展示了这些系统可以独立运行,在复杂多变的环境中做出瞬间决策以收集信息。虽然目前的系统专注于控制摄像机,但同样的原理可以应用于其他任务,例如帮助机器人穿梭于拥挤的房间,或帮助无人机搜寻失踪人员。研究结论指出,主动推理为创建能够应对现实世界不可预测性的、具有适应性且资源高效的机器提供了一条充满希望的路径,将智能感知的力量直接带到了边缘侧。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →