← 最新论文
🧬 biology

Evaluation Resolution Confounds Learning-Rule Comparisons in Model-Brain RSA of Early Visual Cortex

本文表明,未经训练或经局部训练的网络在匹配早期视觉皮层表示方面表现出优于反向传播训练模型的表象,实际上是分辨率不匹配所导致的伪影,因为当网络在高于其训练数据的数据分辨率下进行评估时,这种性能差距会显著扩大,从而使对生物学习规则的比较产生混淆。

原作者: Nils Leutenegger

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Nils Leutenegger

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,你正试图教一个机器人像人类一样观察世界。神经人工智能(NeuroAI)领域的科学家们正痴迷于这个问题:“什么样的规则集能教计算机识别猫或汽车?”他们有几种不同的“规则书”可供选择。一种是几乎所有现代人工智能都在使用的标准、超高效的方法(称为反向传播)。其他的则是“具有生物学合理性”的规则,它们试图模仿真实大脑的学习方式,比如神经元如何根据时间间隔放电,或者大脑如何预测它将看到什么。

为了看哪本规则书效果最好,研究人员使用了一种聪明的技巧,叫做表征相似性分析(RSA)。把它想象成一场“猜猜联系”的游戏。他们提取机器人对一张图像的内部“想法”(其数字表征),并将这些想法与人类在看同一张图像时大脑中实际的电活动进行比较。如果机器人的“想法”与大脑的活动高度匹配,我们就说这个机器人拥有“类脑”的理解力。人们最大的希望是,通过找到让机器人最像大脑的规则,我们或许终于能破解人类视觉的密码。但问题在于:真实的脑部结构极其复杂,而我们目前能用这些高级生物规则训练出的机器人仍然非常微小且简单。

这篇论文揭开了这些比较过程中一个隐藏陷al阱的面纱。研究人员发现,关于“哪种规则更好”的答案,完全取决于你展示图片的尺寸。事实证明,当科学家将这些微小的、受生物启发而设计的机器人与人类大脑进行比较时,他们经常使用高分辨率、细节丰富的照片(例如 224 像素宽)来进行测试,尽管这些机器人是在极小的、模糊的 32 像素图像上进行训练的。研究发现,这种不匹配创造了一种神奇的错觉。当在大型、详细的图片上进行测试时,那个未经训练的、随机的机器人突然看起来竟然和那些经过训练的智能机器人一样好,甚至在理解视觉系统的早期部分时表现得更出色。作者指出,这并不是因为那个随机机器人拥有秘密的才华,而是因为我们测量它的方式受到了图像尺寸的偏差影响。

分辨率陷阱

这里的核心发现是,“大脑匹配竞赛”的胜出者完全取决于测试图像的分辨率。想象一下你在评判一场烹饪比赛。你有一位在仅 3 英寸的小锅里练习做菜的厨师,还有一位只是把食材随手扔进碗里的普通人。如果你要求他们在巨大的 2 英尺托盘上盛装菜肴,那个普通人可能会因为巨大的托盘掩盖了食物还没熟的事实,从而显得表现得更好。但如果你用他们练习时用的那个同样只有 3 英寸的小锅来盛菜,受过训练的厨师就会脱颖而出,而那个普通人则会显得很糟糕。

在这项研究中,“小锅”是指机器人训练时使用的 32 像素分辨率,而“巨大的托盘”则是经常用于将其与大脑数据进行对比的 224 像素分辨率。当研究人员在机器人学习过的相同 32 像素尺寸上对其进行测试时,受过训练的机器人(使用反向传播)比未经训练的机器人表现得稍好,正如你所预期的那样。但当他们切换到较大的 224 像素图像时,结果发生了逆转。未经训练的随机网络在理解人类大脑早期视觉皮层(V1)方面,突然看起来比受过训练的机器人还要更像大脑。两者之间的差距随着图像变大而稳步增长,从 32 像素时的微小差异 -0.001,增加到了 224 像素时的巨大差异 +0.044。

排除嫌疑对象

作者不仅发现了问题,还扮演了侦探的角色,去查明为什么会发生这种情况。他们有四个主要的嫌疑对象,并逐一排除了他们。

首先,他们怀疑这仅仅是一个“不匹配”问题:也许受过训练的机器人由于展示了它们未曾训练过的图像,所以表现较差。为了测试这一点,他们尝试了那些确实在 224 像素大图上进行过训练的机器人(如 ResNet-50 和 Swin-Tiny Transformer)。如果“不匹配理论”成立,这些在大图上训练过的机器人应该在 224 像素时表现最好。但事实并非如此。它们在低分辨率下表现最好,并随着图像变大而表现变差。因此,这不仅仅是关于是否在错误的尺寸上进行训练的问题。

其次,他们检查了“未经训练”机器人的设置。未经训练的机器人通常将其“归一化”(Normalization)设置(有助于保持数据平衡)设为默认值,而受过训练的机器人则拥有学习到的设置。作者认为也许这个默认设置是其中的秘诀。他们手动调整了未经训练机器人的设置,使其完美匹配训练数据。即便有了这些完美的设置,未经训练的机器人仍然在处理高分辨率图像时击败了受过训练的机器人。因此,这也不是设置上的小故障。

第三,他们检查了机器人是否只是在模仿简单的视觉模式,比如光影斑块(Gabors 滤波器)或原始像素的样子。他们发现,那些看起来最像这些简单模式的机器人,并不一定看起来最像大脑。事实上,其中一个受过训练的机器人看起来非常“类 Gabor”,但仍然无法很好地匹配大脑。所以,简单的模式并不是故事的全貌。

第四,他们考虑了随着图像变大,机器人可能正在对越来越多的像素进行平均,这可能导致它的最终答案仅仅是图像整体亮度的一个简单度量。他们发现,代表图像平均亮度的单个数值,实际上与未经训练的机器人一样,能很好地匹配大脑数据。这是一个巨大的线索:未经训练的机器人其实是在通过猜测亮度来进行大量的“匹配”。然而,即使考虑了亮度因素,分辨率效应并没有完全消失。

真正的罪魁祸首:图像细节

为了找到真正的诱因,作者进行了一次最后的、聪明的实验。他们将大图缩小到极小的 32 像素尺寸(限制了细节),然后又将它们放大回原来的大尺寸。这意味着机器人仍然在看一张大图并对许多像素进行平均,但图像中的“实际信息”却被固定在了低分辨率水平。

结果是戏剧性的。当细节被限制在训练分辨率时,受过训练的机器人不再随着图像变大而表现变差。受过训练与未经训练机器人之间巨大的差距几乎消失了。这证明了该效应不是由机器人观察更多像素(池化/Pooling)引起的,而是因为机器人看到了它尚未学会处理的更多细节。高分辨率图像中的额外细节损害了受过训练的机器人,却帮助了那些随机的机器人,但作者承认他们并不完全理解为什么随机滤波器会从这些额外细节中受益,而受过训练的机器人却会受到其害。

真正重要的东西

论文以一个令人安心的转折结束。虽然视觉系统的早期部分(V1)会被图像尺寸搞混,但更高层级的大脑部分(称为 LOC)却讲述了不同的故事。在这些更高层级,受过训练的机器人始终优于未经训练的机器人,无论图像尺寸如何。这意味着学习确实改变了网络的类脑特性,只是图像分辨率产生的“噪声”淹没了早期阶段的信号。

这项研究的主要启示是对科学家们的一个警告:如果你想知道哪种学习规则更好,你必须非常小心地对待你用来测试图像的尺寸。所谓的“赢家”并不是规则的一个固定属性;它是如何选择测量方式的结果。在科学家们就如何匹配图像分辨率与所研究的大脑区域达成一致之前,在早期视觉皮层进行的比较可能是具有误导性的。本文建议,我们应该在模型训练时的分辨率下进行测试,并清晰地报告该分辨率,以免被分辨率陷阱所蒙蔽。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →