想象你的大脑是一位主厨,只需品尝几种食材,就能学会烹饪一道复杂的新菜。现在,想象一个计算机程序试图做同样的事情。通常,计算机需要品尝数百万道菜(在数百万张图像上进行训练)才能学会食谱。它们就像必须在能烹饪一顿饭之前,先背下图书馆里每一本食谱的学生。
这篇论文提出了一个简单的问题:生物大脑如何从如此少的信息中学习如此多的知识?
作者提出,大脑使用了一种称为“高效编码”的策略。将这种策略想象成大脑整理杂乱阁楼的方式。大脑并非试图完美地记住每一件物品,而是首先将事物快速归类到最重要的类别中。它专注于世界上出现频率最高的“宏观”模式,而忽略噪声。
以下是研究人员如何测试这一想法以及他们发现了什么,通过日常类比进行解释:
1. “自学”网络
研究人员构建了一个无需教师指导即可学习的计算机模型。
- 旧方法: 通常,要教会计算机识别猫,你需要给它看数百万张图片,并告诉它“这是猫,这是狗”。这就是监督学习。
- 新方法(高效编码): 研究人员让计算机观察 10,000 张随机的自然照片(树木、天空、岩石),不告诉它任何内容是什么。计算机的唯一任务是找出这些图片中最常见的模式和变化。
- 类比: 想象一个孩子看着一堆乐高积木。孩子没有被告诉“建一座房子”,而是只是按颜色和形状对积木进行分类,注意到哪些部件最常组合在一起。最终,孩子自然而然地理解了如何构建结构,因为他们掌握了积木的“规则”。
2. 构建理解金字塔
该计算机模型被构建为一个拥有 11 层的金字塔。
- 底层: 这些层观察原始数据,学习简单的内容,如边缘、线条和颜色。
- 顶层: 随着信息向金字塔顶部移动,模型将这些简单的线条组合起来,识别出复杂的内容,如纹理、形状,甚至整个物体。
- 结果: 尽管计算机从未被告知什么是“猫”或“树”,但它学会了识别它们。当研究人员要求人类志愿者查看计算机的“想法”(它发现的模式)时,人类可以轻松识别出计算机看到了什么。计算机学会了一种人类自然使用的语言。
3. “混合”主厨:集两者之长
随后,研究人员尝试了一种混合方法。他们先让计算机进行“自学”排序(高效编码),然后给它一些带标签的示例来微调其技能。
- 测试: 他们尝试仅使用1,000 张图片(与通常所需的数百万张相比微不足道)来教会计算机识别特定类别。
- 结果:
- 仅由教师指导的计算机(标准方法)在面对如此少的示例时显得力不从心。
- 先进行“自学”排序,然后获得教师帮助的计算机,在该任务上表现得极其出色。
- 隐喻: 这就像一名学生在开始特定课程之前,花了一年时间自学百科全书(无监督)。当课程开始时,他们比那些一无所知就走进课堂的学生能更快地掌握特定材料。
4. 与大脑的联系
研究人员检查了这个计算机模型是否与人类大脑相似。他们将计算机的“想法”与人们观看相同图像时的实际大脑扫描(fMRI)进行了比较。
- 发现: 这种“混合”计算机模型(自学 + 教师指导)比标准计算机模型更准确地匹配了人类大脑的活动,特别是在可供学习的数据非常少的情况下。
- 结论: 这表明我们的大脑可能正是像这种混合模型一样运作。我们在生命早期被动地吸收世界的统计模式(高效编码),从而建立起坚实的基础。然后,当我们需要学习特定任务(如阅读或识别人脸)时,我们可以快速且高效地在此基础上构建。
总结
该论文认为,生物视觉之所以高效,是因为它不等待教师对一切进行标记。 相反,它首先通过自行观察模式来学习视觉世界的“语法”。这使得它能够用极少量的数据学习新的、特定的任务。
通过模仿这一过程,研究人员创建了一个计算机模型,它学习得更快,需要的示例更少,并且比我们今天通常使用的庞大且渴求数据的模型更像人类大脑。
技术摘要:视觉层级中的高效编码
问题陈述
深度学习模型目前在预测视觉皮层表征和视觉行为方面取得了高性能,但它们未能捕捉到生物视觉的一个决定性特征:从有限数据中学习有用表征的能力。虽然生物系统从有限的经验中学习,但现代深度学习依赖于在数百万至数十亿个训练样本上的监督或自监督更新。这种差异表明,生物视觉可能由根本不同的学习原则所塑造。作者探讨了高效编码(即神经表征捕捉自然输入统计结构的假设)是否可用于从有限数据中构建与人类对齐的视觉特征层级,而无需依赖任务标签或全局反向传播。
方法论
作者开发了一种基于逐层高效编码的深度无监督学习过程,使用散射网络架构。方法论的核心组件包括:
- 架构:一个 11 层的卷积网络,其中每一层包含两个操作:
- 固定空间滤波:使用一组固定的九个 Morlet 小波滤波器进行卷积(八个不同方向的带通滤波器和一个低通滤波器)。这为边缘检测和定向特征提供了强烈的归纳偏置。
- 学习通道混合:一个可学习的 1×1 卷积,用于混合跨通道的信息。
- 网络在小波滤波器(扩展)和通道混合(压缩)之间交替。步长卷积在交替层中减少空间维度。
- 无监督学习协议:
- 模型在无标签、无任务、无反向传播的情况下进行学习。
- 对于每一层,算法计算自然图像(ImageNet 训练集)空间池化激活的协方差矩阵。
- 应用**主成分分析(PCA)**提取前 K 个特征向量,这些特征向量捕捉了自然图像中方差的主导模式。
- 这些特征向量作为 1×1 卷积的权重,将输入压缩到与自然图像统计对齐的 K 维子空间。
- 该过程是顺序且逐层的,意味着每一层都基于其直接输入的局部统计信息进行优化。
- 混合学习:为了测试这种无监督初始化的实用性,作者将高效编码阶段与图像分类任务(ImageNet 和 miniImageNet)上的监督微调相结合。这与以下方法进行了比较:
- 常规监督学习(随机初始化)。
- 纯无监督学习。
- 未训练的网络。
- 评估指标:
- 行为相关性:人类观察者执行相似性判断任务,以确定他们是否能识别由特定网络通道编码的特征。
- 大脑对齐:使用正则化线性回归拟合编码模型,以预测自然场景数据集(NSD)中的 fMRI 响应。
- 下游性能:miniImageNet 上的分类准确率,包括早期层被冻结以测试无监督特征可迁移性的实验。
主要贡献与结果
通过无监督编码涌现复杂特征:
- 仅在无标签的 10,000 张图像上训练的深度高效编码模型,成功学习了一个特征层级,从早期层的简单边缘和颜色,发展到后期层的复杂纹理、形状和物体。
- 行为验证:人类观察者能够可靠地识别网络通道所代表的特征(准确率 M=0.87),显著优于未训练的网络(M=0.68),并接近在百万张图像上训练的完全监督模型的性能(M=0.96)。
- 反应时相关性:识别特征的反应时与通道方差排名显著相关(ρ=0.37),表明方差较高的特征(由高效编码优先处理)在感知上更为显著。
极端数据限制下的大脑对齐:
- 当在高度受限的数据集(1,000 张图像,即 ImageNet 每个类别一张)上训练时,混合模型(高效编码 + 监督微调)在预测人类腹侧视觉皮层响应方面显著优于常规监督学习。
- 仅无监督学习相比未训练的基线提供了实质性的改进。
- 在低数据条件下,混合方法在网络的后期层(第 6 层及以上)产生的编码得分高于常规学习。当数据量增加到 10,000 张图像时,混合学习与常规学习之间的性能差距缩小。
数据高效的类别学习:
- 使用深度高效编码初始化的网络,达到与随机初始化网络相同的分类准确率所需的监督训练样本更少。
- 对层冻结的鲁棒性:在无监督预训练后冻结早期到中间层(最多到第 5 层),混合模型保持了高分类准确率。相比之下,在随机初始化的网络中冻结相同的层会导致性能急剧下降。
- 低数据机制:当类别数量和每个类别的图像数量都有限时,无监督预训练的优势最为明显。
意义与主张
该论文主张,高效编码原则可能塑造了整个视觉层级的表征,而不仅仅是在低级处理中(例如视网膜、V1)。研究结果表明:
- 生物视觉的数据效率可以通过一种学习机制来解释,即神经系统首先通过无监督的局部学习规则(特别是最大化方差/高效编码)适应自然刺激的统计结构。
- 这种无监督阶段创建了一个可重用的、与行为相关的特征基础,促进了快速的下游学习。
- 所提出的框架为当前端到端监督或自监督学习的主导范式提供了一种替代方案。它提出,腹侧视觉流中的表征是由自下而上的高效编码(对自然统计的无监督适应)和自上而下的目标驱动学习(监督微调)共同塑造的。
- 这项工作表明,一种简单的、局部的、无监督算法可以快速构建出与神经对齐且对任务有用的层级表征,这表明“无监督预训练”可能是一个核心的生物学习原则,既不需要标签也不需要奖励。
作者指出,虽然他们的实现使用 PCA 和固定空间滤波器作为计算支架,但核心发现是:优先处理高方差方向的、经过局部训练的层级系统可以发展出可迁移的、类脑特征。他们承认,监督对于强大的分类性能仍然是必要的,这表明高效编码和任务驱动学习是互补的,而非相互排斥的。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。