← 最新论文
⚡ electrical engineering

Improving Performance of Spike-based Deep Q-Learning using Ternary Neurons

本文提出了一种深度非对称三值脉冲Q网络(DATSQN),该网络利用一种新型三值脉冲神经元模型来减轻梯度估计偏差,从而克服了现有三值模型的性能退化问题,并在七款Atari游戏中的深度Q学习任务中表现优于二值基准模型。

原作者: Aref Ghoreishee, Abhishek Mishra, John Walsh, Anup Das, Nagarajan Kandasamy

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Aref Ghoreishee, Abhishek Mishra, John Walsh, Anup Das, Nagarajan Kandasamy

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人玩电子游戏。为了做出决策,机器人需要一个大脑,而在人工智能的世界里,我们通常使用“神经网络”来构建这些大脑。这些网络受到人类大脑的启发,人类大脑中微小的单元被称为神经元,它们彼此传递信号。在传统的计算机大脑中,这些信号就像平滑、连续的电波。但在一种被称为“脉冲神经网络”(Spiking Neural Network, SNN)的特殊大脑中,神经元通过微小、尖锐的电脉冲(即“脉冲”)进行通信,这非常类似于真实生物神经元的放电方式。这种方法具有极高的能效,非常适合那些无法携带沉重电池的移动机器人或设备。

然而,这里有一个问题。大多数这种高效的脉冲大脑只有两种状态:它们要么发出脉冲(1),要么保持静默(0)。这就像一个只能开启或关闭的灯开关。这限制了机器人一次能在大脑中存储的信息量。最近,科学家们尝试将这些开关升级为“三值”(ternary)神经元,即具有三种状态:正向放电(+1)、保持静默(0)或负向放电(-1)。你可能会认为,增加一个“负值”开关会让机器人变得更聪明,但令人惊讶的是,当他们尝试将这种技术应用于视频游戏设置时,机器人的表现反而变差了。这篇论文深入探讨了这个谜团,探究为什么拥有更多的选项反而让机器人变得更笨,以及他们是如何修复这个问题,让机器人重新成为游戏冠军的。


变笨机器人的谜团

研究人员——来自德雷塞尔大学的一个团队——旨在测试这些新型“三值”神经元在设计用于玩 Atari 视频游戏(如经典的街机游戏《打砖块》和《太空侵略者》)的深度学习系统中的表现。他们直觉地认为,问题不在于额外的状态本身,而在于神经元是如何“学习”的。

把训练机器人想象成教狗学动作。你给狗一个指令,它尝试执行,然后你给它一个奖励(奖励)或一个“不”(惩罚)。在人工智能领域,这个“奖励”是通过观察机器人的预期与实际发生情况之间的差异来计算的。这个差异被称为“梯度”,它告诉机器人下次如何调整大脑以做得更好。

该团队发现,标准的三值神经元就像一个只关心错误“方向”而不关心错误“大小”的老师。如果机器人犯了错,三值神经元只能说:“你走错方向了!”(+1 或 -1),但它完全忽略了“你到底错得有多离谱?”(活动强度)这个问题。在视频游戏的学习初期,机器人经常在进行随机的猜测,因此错误的“方向”是混乱且随机的。由于标准的三值神经元如此专注于方向,它们在噪声中迷失了方向,并停止了学习。这就像机器人在试图穿过一个充满浓雾的迷宫,而它听到的指南针却在随机旋转;它只能原地踏步。

非对称性的修复方案

为了解决这个问题,作者提出了一种名为**深度非对称三值脉冲 Q 网络(Deep Asymmetric Ternary Spiking Q-Network, DATSQN)**的新设计。他们意识到,大自然早已给出了答案。在人类大脑中,并非所有神经元都是平等的。大约 80% 的神经元是“兴奋性”的(推动大脑行动),而只有大约 20% 是“抑制性”的(告诉大脑停止)。旧的三值模型将这两类神经元视为完美的镜像,这在生物学上是不真实的。

团队的新模型打破了这种对称性。他们创建了一种神经元,其“正向”(兴奋)和“负向”(抑制)的阈值是不同的。你可以这样直观地理解:想象一扇有两个不同锁扣的门。旧模型有两个完全相同的锁;无论你从哪一边推,门开启的难度是一样的。新模型则在“停止”的一侧安装了一个沉重、难以开启的锁,而在“前进”的一侧安装了一个容易开启的锁。这种非对称性意味着,即使机器人在对错误的方向感到困惑时,神经元仍然可以发送关于“活跃程度”的清晰信号。它让“音量旋钮”在“方向箭头”乱转时依然能够正常工作。

结果:从停滞到超级巨星

团队在七种不同的 Atari 游戏中测试了这个新大脑,将其与旧的二值(开/关)机器人以及标准的三值机器人进行对比。他们通过强制机器人更快做出决策(使用 20 步而非 40 步的更短模拟时间窗口)增加了任务难度,这通常会让学习变得更加困难。

结果令人瞩目。标准的三值机器人(DTSQN)表现糟糕,得分远低于基础的二值机器人。它们确实陷入了“学习迷雾”。然而,新的非对称机器人(DATSQN)不仅赶上了,甚至实现了飞跃。在七款游戏中的六款里,新模型击败了二值基准线,平均游戏得分提升了 30%。例如,在《飞行员》(Beam Rider)中,新机器人的得分是 4,000 分,而二值机器人仅为 2,069 分。在《打砖块》(Breakout)中,它得了 252 分,而二值机器人得了 207 分。

研究人员还检查了训练过程的“心跳”。他们发现,新模型的学习信号保持着强劲且稳定的状态,避免了机器人忘记如何学习的“梯度消失”问题。他们还观察到,新模型中的神经元自然演化为以兴奋性为主,正向脉冲的数量至少是负向脉冲的 60% 以上,这与人类大脑的情况一致。

这意味着什么

这篇论文表明,仅仅增加神经元的状态数是不够的;你必须设计这些状态如何进行学习。通过模仿人类大脑中兴奋性与抑制性神经元之间的自然失衡,该团队创建了一个不仅能效更高,而且在学习复杂任务方面更聪明的脉冲网络。虽然这项研究是在视频游戏模拟中进行的,但研究结果表明,这种“非对称”方法可能是构建更好的、更高效的 AI 大脑(用于机器人及其他设备)的关键。作者指出,尽管他们的模型在这些游戏中表现出色,但这仍然是对如何构建更好系统的建议,观察这种方法是否有助于视觉或语言处理等其他领域将会非常有趣。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →