← 最新论文
🤖 AI

Vector Symbolic Policy Gradient

本文介绍了向量符号策略梯度(Vector Symbolic Policy Gradient, VSPG),这是一种将动作表示为超向量的离散动作执行器,旨在通过压缩核记忆实现优势加权学习,并具备可证明的抗比特翻转错误鲁棒性。

原作者: Ryozo Masukawa, Sanggeon Yun, SungHeon Jeong, Hyunwoo Oh, Raheeb Hassan, Pietro Mercati, Nathaniel D. Bastian, Mahdi Imani, Mohsen Imani

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Ryozo Masukawa, Sanggeon Yun, SungHeon Jeong, Hyunwoo Oh, Raheeb Hassan, Pietro Mercati, Nathaniel D. Bastian, Mahdi Imani, Mohsen Imani

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:引导自主机器人的计算机或管理智能建筑的系统,不再是脆弱、精密的机器,而是能够即使在内部存储器出现轻微损坏或不精确时仍能正常运行的鲁棒系统。这就是被称为向量符号架构(Vector Symbolic Architecture)的领域所承诺的前景——这是一种借鉴了人类大脑存储信息方式的、关于人工智能的新型思考方式。这种方法并不依赖于精确且脆弱的数字,而是使用庞大、高维的数据模式,并利用简单的数学运算进行组合与比较。其核心思想在于,这些模式如此之多且各具特色,以至于它们可以相互重叠而不会产生混淆,就像在一个挤满了说着不同语言的人的房间里,你可以专注于某一段对话,而不至于让背景噪音变成一片混乱。这种韧性使得该方法对于“边缘”设备特别具有吸引力——即那些在有限电力下运行,或处于无法保证完美数据存储的恶劣环境中的计算机。

加州大学欧文分校及其合作者研究人员现在已将这一概念直接应用于机器学习决策的方式。在一项新的研究中,他们引入了一种名为“向量符号策略梯度”(Vector-Symbolic Policy Gradient)的方法。要理解他们的工作,首先需要了解他们正在解决的问题。在强化学习中,人工智能代理通过尝试行动并观察结果来学习,从而逐渐构建出一套旨在最大化奖励的策略。传统上,这种策略存储在复杂的神经网络中,这些网络就像错综复杂的连接网络,需要极其精确的微调。如果这些网络内部的数字因微小的电噪声或制造缺陷而遭到破坏,代理的决策过程可能会崩溃。研究人员提出了一个简单的问题:我们能否构建一个天生对这类损伤具有抵抗力的决策系统,一个通过以一种天然具有容错性的方式存储记忆来进行学习的系统?

他们的答案是肯定的。该团队开发了一个系统,其中智能体可以采取的每一种可能的行动都由一个独特的、高维的模式(或称“超向量”)来表示。当智能体观察其周围环境时,它会将该观察结果转化为一个类似的模式。为了决定下一步该做什么,系统只需检查哪个行动模式与当前的观察模式最为相似。他们方法的精妙之处在于系统是如何学习的。系统并非使用复杂的、多步骤的计算来调整其内部权重,而是通过一个单一且直接的步骤来更新其记忆。当智能体采取了一个好的行动并获得奖励时,系统会加强该行动模式与导致该行动的观察结果之间的联系;如果行动是错误的,则削弱这种联系。这一过程在数学上等同于标准的学习方法,但它是通过对这些大型模式进行简单的加法和减法运算,随后进行归一化处理以保持模式稳定来实现的。

这项发现的意义在于随着时间的推移,记忆会发生什么变化。随着智能体的学习,它并不会存储它经历过的每一次经验的清单。相反,它将所有经验压缩进一个固定大小的记忆库中。每个行动的记忆都成为了所有该行动曾带来帮助的时刻的压缩总结,并根据结果的好坏进行了加权。这意味着系统可以高效学习,而无需存储海量的原始数据。此外,研究人员证明了这种方法对错误具有极强的鲁棒性。他们测试了如果记忆中的随机比特发生翻转(模拟了在不可靠硬件中发生的损坏情况)会发生什么。虽然传统的神经网络和简单的线性模型在这些条件下表现出显著的性能下降,但新的基于向量的系统却稳住了阵脚。由于模式本身的规模和结构,误差被平均化了,使得系统即使在记忆不完美的情况下也能继续做出正确的决策。

团队在多种挑战任务中测试了他们的方法,从经典的控制任务(如在移动的小车上平衡一根杆子)到复杂的迷宫导航,以及管理多智能体建筑系统的能源。在这些测试中,新方法学习的速度与标准神经网络方法一样快,甚至往往更快。它在达到目标和最大化奖励方面取得了具有竞争力的结果,证明了它并不会为了鲁棒性而牺牲性能。在迷宫导航任务中(智能体必须记住先捡起钥匙再开门),该系统成功学习了动作序列。在建筑控制模拟中(多个智能体必须协作管理温度和湿度),该方法在不同的气候条件下都表现良好。

或许最重要的一点是,研究表明,系统的泛化能力(即将其学到的知识应用于略微不同的情境的能力)与其初始模式的创建方式直接相关。研究人员发现,将原始观察结果转换为这些高维模式的方法大有讲究。某些转换方法比其他方法能带来更好的学习效果和更稳定的记忆,这表明智能体思考时所使用的“语言”对其成功至关重要。然而,一旦系统训练完成,它就不再需要保留其训练过程的原始数据。它可以丢弃历史记录,仅依靠压缩后的、固定大小的记忆,这使其在实际设备部署中非常高效。

研究人员还探讨了这些模式的大小如何影响性能。他们发现,增加维度(即每个模式中的元素数量)可以提高系统区分不同情境的能力,并减少记忆之间的干扰。然而,他们也注意到这种提升最终会进入平台期,这意味着存在一个收益递减的点,即让模式变得更大并不会带来显著的帮助。这种记忆大小与性能之间的平衡,是需要将这些系统装入小型芯片中的工程师们必须考虑的实际问题。

最后,这项工作弥合了理论上的鲁棒性与实际应用之间的鸿沟。它证明了我们可以创建不仅高效、快速,而且能够抵御现实世界缺陷的学习代理。通过将决策表示为分布式的模式而非精确的数字,该系统避免了困扰许多现代人工智能模型的脆弱性。研究结果为在可靠性至上的环境中部署智能系统指明了方向,例如在不可预测的天气中行驶的自动驾驶汽车,或是运行在资源受限环境下的医疗设备。该方法不需要复杂的硬件或大规模数据中心;它依赖于一种简单、优雅的数学结构,将潜在的易损记忆转化为一种优势。正如研究人员所总结的那样,这种方法为下一代基于边缘侧的鲁棒人工智能提供了极具前景的基础,证明了有时,构建智能机器的最佳方式是让它在那些“大到无法被打破”的模式中进行思考。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →