想象一下你的大脑是一个巨大而繁忙的图书馆,书不仅储存在书架上,而是散落在各处,等待着被一个微小的线索寻获。如果你低声说出故事中的几个词,图书馆应该立刻大声回响起整个故事。这就是联想记忆的魔力:从部分或混乱的提示中检索出完整记忆的能力。正是因为它,你闻到某种特定的饼干味,就能瞬间想起祖母的厨房;或者听到几声旋律,就能回想起整首曲子。科学家们长期以来一直试图构建能够模仿这种大脑奇技淫巧的计算机模型,希望能借此理解我们的思维运作方式,并创造出更聪明的机器。他们一直在苦苦思索的一个大问题是:当决定加强哪些连接时,大脑里的“图书管理员”应该遵循什么样的最佳“规则”?管理员是应该仅仅将同时发生的事情联系起来,还是应该有一种更复杂的方式来组织这些混沌,从而让图书馆永远不会变得不堪重负?
在这篇论文中,一个研究小组决定对七种不同的“图书管理员规则”进行终极测试。他们构建了数字大脑——具体来说,是作为神经元运作的简单单元网络——并要求它们记忆模式,其中一些模式是“完美”原始构思的混乱或扭曲版本。这就像是在教机器人识别猫。你给它看一千张猫的照片,有些戴着墨镜,有些是倒过来的,有些是模糊的。目标是让机器人在看到一张新的、奇怪的照片时,即使从未见过这张照片,也能说出:“那是一只猫!”研究人员使用七种不同的学习策略模拟了这些数字大脑,其范围涵盖了从经典的、简单的“将你看到的联系在一起”的方法,到基于概率和逻辑的更复杂的数学策略。
结果让科学界感到有些震惊。最著名的规则,即以唐纳德·赫布(Donald Hebb)命名的那个规则(通常总结为“一起放电的神经元,就会连在一起”),结果竟然是表现最差的一个。这就像是一个仅仅把每张新便条都粘贴到其他所有便条上的图书管理员;最终,墙上贴满了纸,以至于你什么也找不到了。相比之下,那些使用了概率和逻辑的规则——特别是“贝叶斯-赫布”(Bayesian-Hebbian)规则——成为了冠军。这些规则就像是一个超级聪明的图书管理员,不仅建立联系,还会计算一个连接是否有用的概率,从而过滤掉噪音。这些表现顶尖的规则能存储大约三倍于经典赫布规则的记忆,并且在忽略“噪音”或照片中的扭曲方面表现得出色得多。
研究人员还测试了这些规则在处理具有相关性(例如,一个关于“狗”的书籍里也意外粘着一页关于“猫”的内容)的混乱数据时的表现。在这里,另一种被称为 PRCOV 的规则展现出它在忽略这些令人困惑的重叠方面是一位高手,甚至在某些特定任务中击败了基于概率的规则。然而,对于存储和检索记忆的整体工作而言,基于概率的规则仍然是明显的赢家。这项研究不仅找到了一个赢家,还表明了网络的结构也至关重要。一个“模块化”的大脑,即组织成紧密联系的小组(就像城市中的社区一样),其表现略好于一个巨大的、无差别的网络。
最终,这篇论文表明,如果我们想要构建出像人类一样擅长记忆的类脑系统,我们可能需要停止使用旧有的、简单的“一起放电”规则,转而使用这些更复杂的、基于概率的规则。这提醒我们,大脑的秘诀不仅仅在于建立连接,还在于知道要建立哪些连接以及如何衡量它们。虽然这些发现来自计算机模拟而非对人类大脑的直接扫描,但它们提供了一个强烈的暗示:大脑可能正在使用一种比我们之前所认为的更加聪明、更具数学性的策略。
技术摘要:针对记忆存储与原型提取的局部赫布学习规则基准测试
问题陈述
联想记忆(内容寻址存储器)是计算机科学和认知脑科学中的一项基本功能,构成了模式补全、图底分割及长期记忆等操作的基础。尽管已有多种神经网络架构和学习规则被提出用于模拟这些功能,但仍缺乏在一个统一框架内对不同局部赫布学习规则进行的系统性定量比较。具体而言,本文旨在解决不仅要针对标准模式存储,还要针对研究较少的原型提取能力(即从失真实例中召回生成原型,而无需显式存储该原型本身)来对这些规则进行基准测试的问题。此外,本研究还调查了这些规则如何随网络规模缩放,以及它们对训练数据相关性的敏感度。
方法论
作者通过在单层、递归连接的神经联想记忆(NAM)网络中,对七种不同的局部赫布学习规则进行了广泛的计算机模拟实验。研究采用了两种网络架构:
- 非模块化网络: 由单层 N 个单元组成。
- 模块化网络: 由 H 个超柱(hypercolumns)组成,每个超柱包含 M 个微柱(minicolumns,即单元),遵循“小世界”缩放方案,其中 H=M=N。
网络运行在适度稀疏的二值模式({0,1})上,并采用胜者全拿(WTA)动力学(非模块化网络采用 k-winners-take-all;模块化网络采用局部单胜者机制)。训练以单次、逐样本的方式进行。
对比的七种学习规则:
- WILL: 基于 Willshaw (1969),使用二值权重。
- HEBB: 原始的加性赫布规则。
- HOPF: 适用于二值单元的稀疏 Hopfield 规则。
- COV: 协方差学习 (Tsodyks & Feigelman, 1988),在 Hopfield 基础上增加了一项,以消除独立激活单元之间的权重。
- PRCOV: 突触前协方差学习 (Minai, 1997),旨在提高处理相关模式时的容量。
- BOM: 贝叶斯最优学习 (Knoblauch, 2011),基于概率论推导,不依赖于噪声。
- BCP: 贝叶斯置信传播 (Lansner & Ekeberg, 1989),基于假设输入相互独立的贝叶斯法则推导而来。
评估指标
性能通过四个主要基准进行量化:
- 模式存储容量 (P90): 在 90% 的失真测试模式能够无误差召回的情况下,所能存储的最大模式数量。
- 权重信息容量 (C): 总存储的香农信息(比特)除以可训练权重数,提供了一个与规模无关的度量指标。
- 原型提取: 从新的失真实例中召回生成原型的能力,其中原型本身从未被直接呈现给网络。
- 相关性抵抗力: 存储容量随模式组件间相关性 (fp) 增加而下降的情况。
关键结果
- 模式存储容量: 贝叶斯-赫布规则(BCP 和 BOMs) 在几乎所有条件下都表现出最高的存储容量,显著优于其他规则。HEBB 规则始终显示出最低的容量。HOPF、COV 和 PRCOV 表现处于中间水平。WILL 规则表现较差,尤其是在原型提取任务中。
- 权重信息容量: 观察到的规则最大权重信息容量约为 0.64 比特/权重,出现在召回比例为 50% 时。PRCOV 规则由于其非对称权重矩阵显示出较低的数值,而 HEBB 规则仍然最低。
- 原型提取: 该任务通常比单个模式存储更难。BCP 和 BOMs 规则保持了卓越的性能。值得注意的是,虽然 PRCOV 可以提取原型,但在使用少量原型训练时速度较快,但在使用大量实例训练时,其达到平台期的速度早于贝叶斯规则。WILL 规则由于其二值权重限制,在此任务中完全失败。
- 相关性敏感度: 专门为相关数据设计的 PRCOV 规则表现出最高的抗相关性能力,特别是在原型提取任务中,在高相关性下有时在绝对容量上优于贝叶斯规则。HEBB 和 WILL 规则对相关性最为敏感。
- 架构缩放: 模块化网络通常比非模块化网络存储更多模式,但单位权重的信息量 (C) 保持相当。超柱和微柱的 N 缩放对于模拟的规模是有效的,但也被指出在扩展到完整皮层规模时可能存在局限性。
意义与主张
本文声称其主要贡献在于,在标准化条件下对赫布学习规则进行了严格的定量基准测试,揭示了流行的 HEBB 规则在处理联想记忆任务时,不如 贝叶斯-赫布 方法高效。
- 神经生物学意义: 结果表明,如果大脑利用类似于此类模型的联想记忆机制,它很可能采用了比简单的加性赫布可塑性更复杂的学习规则,例如涉及内在可塑性或贝叶斯推理机制(如 BCP 所见)。
- 工程学意义: 对于人工神经网络系统,研究表明贝叶斯-赫布规则提供了更高的容量和鲁棒性。此外,二值 WILL 规则在原型提取中的失败表明,实值权重(代表更高的信息含量,约 5 比特)对于实现稳健的泛化可能是必要的,这为关于权重精度对类脑硬件设计的影响提供了见解。
- 原型提取: 研究强调了原型提取是 NAMs 一个关键但研究不足的能力,证明了不同的学习规则表现出截然不同的泛化行为(例如,原型形成的速率与对抗伪吸引子的稳定性之间的权衡)。
作者总结道,虽然贝叶斯-赫布规则(BCP 和 BOMs)通常更为优越,但选择“最佳”规则取决于具体的任务需求,例如对高相关性抵抗力的需求(倾向于 PRCOV)与对最大存储容量的需求(倾向于 BCP/BOMs)。本文并非声称这些规则确定地模拟了人类大脑,而是建议它们为理解突触可塑性和设计类脑 AI 提供了一个更合理且高效的框架。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。