← 最新论文
🤖 machine learning

Spiking Neural Networks for Continuous Control: Neuromorphic Reinforcement Learning in Conventional Computing

本文介绍了脉冲演员网络软演员-评论家(SANSAC)框架,并证明了在常规硬件上,脉冲神经网络在连续控制任务中可以实现与传统软演员-评论家算法相当的性能,从而为未来的神经形态强化学习研究建立了一个经过验证的基准。

原作者: Jessica Hunter, Md Maruf Hossain Shuvo, Krishna Roy

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Jessica Hunter, Md Maruf Hossain Shuvo, Krishna Roy

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,存在着一种不断的推动力,旨在制造出能够学习并适应周围环境的机器,就像孩子学习走路或鸟儿学习飞行一样。这一领域被称为强化学习,它通过奖励好的选择并惩罚坏的选择来教导计算机程序做出决策。多年来,这些系统在解决复杂问题方面已变得极其出色,从玩电子游戏到控制机器人。然而,运行这些智能程序的硬件通常体积庞大且消耗大量的电力,就像运行大型视频游戏的强力台式电脑一样。科学家们现在正转向一种受人类大脑启发的不同类型的计算机架构,称为神经形态硬件。这些专门设计的芯片旨在实现更高的能效和更快的处理速度,但它们的工作方式与我们日常使用的计算机有着本质的区别。目前的挑战在于,如何将那些在标准计算机上表现良好的复杂、高性能算法进行转化,使其能够在这些类脑芯片上运行,同时又不损失其学习能力。

一个研究小组致力于解决这个特定的难题,他们在尝试使用专门硬件之前,先在标准计算机上测试了一种新方法。他们专注于一种困难的任务类型,称为连续控制,即机器必须进行平滑、持续的调整以保持平衡或向前移动,类似于一个试图在不摔倒的情况下穿过房间的机器人。研究人员创建了一个名为 SANSAC 的新系统,全称是“脉冲执行器网络软行动批评家”(Spiking Actor Network Soft Actor Critic)。为了理解其特殊之处,了解标准人工智能网络使用不断发射信号的神经元,而新系统则使用“脉冲”神经元会有所帮助。这些脉冲神经元更像是生物细胞;它们在接收到足够的输入并发送单个尖锐的电脉冲(即“脉冲”)之前保持静默,发送脉冲后又会恢复静默。这种方法是开发未来能在高能效神经形态芯片上运行软件的关键。该团队想要观察,将学习机器人的标准大脑替换为这种脉冲版本,是否会损害其性能,或者它是否能学得一样好。

为了找到答案,研究人员在被称为“双足行走者”(Bipedal Walker)的模拟环境中,对传统系统和他们的新型脉冲系统进行了严格测试。在这个模拟中,一个双腿机器人必须学习如何在不摔倒的情况下向前行走。团队训练了两个版本的软件长达 1,200 次尝试(或称为回合),以观察它们学习走路的速度和有效性。他们使用不同大小的内部记忆进行测试,范围从极小到相当大,以确保结果在各种条件下都能成立。结果令人惊喜地鼓舞人心。新的脉冲系统学得和传统系统一样好。在最具挑战性的测试中,两个系统都达到了约 70% 到 80% 的成功率,这意味着它们在大多数情况下都能成功完成行走任务。研究人员发现,这两个系统的表现没有显著的统计学差异,证明了脉冲方法并不会以牺牲智能为代价来换取效率。

然而,在测试过程中观察到了明显的权衡。虽然脉冲系统的表现同样出色,但在标准计算机上的训练时间却明显更长。研究人员注意到,脉%,脉冲版本完成相同数量的训练回合所需的时间大约是传统版本的两倍。这是因为标准计算机是为线性处理信息而构建的,而脉冲系统依赖于难以在如此硬件上模拟的定时和序列。研究人员解释说,这种减速是由于在错误的机器上运行模拟而产生的偏差;在专为此目的设计的实际神经形态芯片上,该系统可能会运行得更快,因为这些芯片会像真实的大脑一样并行处理这些脉冲。研究人员没有测量标准计算机上的能耗,因为数据并不一致,但其目标是在转移到能让其发挥优势的硬件之前,证明该算法本身是有效的。

研究还观察了当系统变小(即内部连接减少)时会发生什么。正如预期的那样,当网络太小以至于无法处理任务的复杂性时,两个系统都遇到了困难,成功率降至仅 10%。但在中间规模范围内,脉冲系统依然保持竞争力,显示出即使在资源有限的情况下也能处理复杂学习的鲁棒性。研究人员得出结论,他们的工作为神经形态人工智能的未来奠定了坚实的基础。他们证明了,设计能够运行在这些新型高能效芯片上的学习算法是可能的,且无需接受性能下降的代价。虽然未来的道路仍需在物理神经形态硬件上进行测试以确认能效优势,但这篇论文证实了软件逻辑本身是健全的。研究结果表明,高效、类脑计算的未来不仅仅是一个理论上的梦想,而是一个可以通过构建实现的现实,只要我们愿意在目前的计算机上多等一会儿完成训练即可。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →