← 最新论文
🤖 machine learning

Active Spiking Perception: The Membrane Potential as a Belief State for Anytime 3D Point Cloud Recognition

本文引入了主动脉冲感知(Active Spiking Perception, ASP),这是一个将脉冲神经网络的膜电位重新利用为动态信念状态的新型框架,旨在迭代地选择具有信息量的 3D 点云块并触发提前退出,从而在脉冲和非脉冲架构中均实现具有线性计算成本和竞争性准确度的认证式随时识别(certified anytime recognition)。

原作者: Akarsh Jain, Arya Pawa, Ayush Debnath, Smera Rawal, Sayeed Shafayet Chowdhury

发布于 2026-08-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Akarsh Jain, Arya Pawa, Ayush Debnath, Smera Rawal, Sayeed Shafayet Chowdhury

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在三维视觉的世界里,计算机经常难以像人类那样观察世界。当一个人观察一个复杂的物体(如椅子或汽车)时,他们并不会用同等的注意力去扫描每一个角落。相反,他们的眼睛会快速地从一个重要的细节跳到另一个细节,忽略掉空白空间,只专注于识别物体所必需的关键部分。这种选择下一步看哪里能力的被称为“主动感知”(active perception)。几十年来,人工智能系统一直试图通过同时处理整个三维形状来模仿这种能力,将物体的每一部分都视为同等重要。这种方法虽然有效,但在能源和计算能力方面的开销极其昂贵,尤其是对于那些需要依靠电池运行或使用旨在模仿大脑效率的专用硬件的设备而言。挑战在于,如何教会计算机具备选择性,即决定应该检查三维形状的哪些部分,以及何时它已经观察得足够多以做出自信的判断,且不牺牲准确性。

一个研究团队开发出了一种名为“主动脉冲感知”(Active Spiking Perception)的新方法,教导计算机自主做出这些决策。该方法不再强迫系统按照固定的、机械的顺序扫描三维物体,而是让计算机的内部状态来引导其注意力。该系统使用一种行为类似于生物神经元的类型人工神经元,只有在收集到足够的证据时才会发出微小的电信号。研究人员发现,这种神经元内部的电压水平(随着计算机观察更多物体而累积)就像是一个关于该物体是什么的“持续信念”。通过读取这个内部电压,系统可以决定接下来观察三维形状的哪个未探索部分。如果电压上升到足以表明对答案有强烈信心,系统就会完全停止观察,从而节省时间和能源。

研究人员在包括飞机、椅子和桌子在内的标准三维形状集上测试了这一想法。他们发现,该系统只需观察可用数据的一小部分,就能实现高精度的物体识别。在一次针对物体进行更细致划分的详细实验中,系统学会了跳过近一半的可用数据块,但其表现仍与观察全部数据的系统旗鼓相当。然而,研究人员谨慎地指出,在他们主要基准测试中使用较粗略的划分时,由于数据块过大,无法实现显著的跳过,因此系统处理了几乎整个物体。这种方法不仅仅是关于跳过部分,更是关于跳过“正确”的部分。系统学会了优先观察物体中最具信息量的部分,就像人类在看屋顶之前会先瞥一眼汽车轮子一样。这种根据已观察到的内容来调整观察策略的能力,使得该系统比以往的方法更高效,因为以往的方法无论答案变得多么显而易见,都被迫必须处理整个物体。

为了确保这种效率不会以牺牲可靠性为代价,研究人员在系统中构建了一个数学保证。他们证明了系统决定停止观察的时刻并非随机猜测,而是一个经过统计认证的点,其出错风险是已知且受控的。这意味着,对于系统做出的每一次预测,都有一个可衡量的置信水平与之相连。如果系统不确定,它就会继续观察;如果它确定了,它就会停止。这创造了一个灵活的接口,用户可以根据需求,在牺牲少量准确性以换取大量节能,或反之亦然。

该团队还测试了这一想法是否能应用于更复杂的任务之外。他们将同样的机制应用于更复杂的任务,例如识别三维物体的不同部分或识别杂乱房间中的物体。在这些测试中,该系统再次展示了其有效地集中注意力的能力,取得了与规模更大、更耗能的系统相竞争的结果。有趣的是,他们发现相同的决策逻辑即使应用于标准的图像识别也同样有效,这表明利用内部状态来引导注意力的原则是一种强大的工具,并不局限于某种特定的人工智能类型。

然而,研究人员对其工作的局限性保持了诚实的态度。他们指出,尽管该系统非常高效,但尚未达到完美。在某些特定情况下,例如识别房间内非常细微的结构元素时,系统表现挣扎,因为收集到的微小数据量不足以将物体与周围环境区分开来。他们还发现,系统的节能效果很大程度上取决于其运行的特定硬件;在某些类型的专用芯片上,节能效果非常显著,而在另一些芯片上,收益则较小。此外,研究人员承认,虽然他们的系统提供了一个“随时(anytime)”的认证接口,但其原始准确率在面对更强大的脉冲基准模型(特别是使用更大的骨干网络时)仍稍显落后。研究人员强调,他们的目标不是声称找到了最终解决方案,而是为了证明计算机可以通过倾听自身的内部信号来成为一个更好的观察者。

这项工作的最显著发现是它提供的视角转变。长期以来,神经网络的内部状态仅被视为数据的临时存储空间,即在最终计算完成前持有信息的一种方式。而这项研究表明,这种内部状态可以作为一个控制器,一个引导系统下一步看向哪里的向导。通过将计算机的内部电压视为对世界的“信念”,研究人员创造了一个不仅更快,而且在收集信息方面更加聪明的系统。这是迈向这样一种机器的一步:它们不仅处理数据,而且能主动寻求所需的信息,以理解周围的世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →