Parametric neural control differentiates top neural network models of primate visual cortex
本研究引入了轴对齐特征强化作为一种因果方法,旨在揭示尽管在预测自然图像响应方面具有相似的准确度,但领先的深度神经网络模型在控制灵长类视觉皮层放电的能力上存在显著差异,且这种性能表现更多地受输入梯度空间频率结构而非对抗鲁棒性的预测。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
人类的大脑是一个用于理解世界的庞大且复杂的机器,而在这台机器的前端,坐落着视觉皮层——一个完全致力于处理我们所见之物的区域。几十年来,科学家们一直试图构建能够模仿这种生物机制的计算机程序。这些被称为深度神经网络的程序,通过对数百万张照片进行训练,学会了识别物体、面孔和场景,其技能足以媲美人类。当研究人员测试这些程序时,经常发现最先进的模型在面对自然图像时,能以惊人的准确度预测猴子大脑中神经元的放电情况。这一成功导致了一个令人宽慰的假设:如果不同的计算机模型都能如此出色地预测大脑活动,那么它们在理解视觉世界时,一定都在使用相同的内部逻辑。这似乎表明,通往理解大脑之路终于被找到了,所有这些成功的模型都已收敛到了同一种正确的观察方式上。
然而,一项新的研究挑战了这一令人宽慰的结论,表明高预测准确度并不一定意味着模型真正掌握了大脑的逻辑。研究人员通过与五只猕猴合作,旨在测试这些计算机模型究竟是在仅仅正确地猜测,还是真正理解了支配神经元反应的具体规则。他们创建了一种新的方法来探测模型,超越了简单的图像识别,转向一种更直接的交互形式。研究人员不再只是向模型展示图像并检查其是否猜中了大脑反应,而是利用模型生成对图像进行特定、受控变化的指令。他们提取每个模型的内部设置,并将其转化为一套如何微调图像以使神经元放电增加或减少的指令。这个过程被研究人员称为“轴向对齐特征强化”(axis-aligned feature accentuation),它允许他们创建数千张独特的测试图像,旨在将神经反应推向特定的方向。
该团队从十个领先的视觉模型中生成了超过 27,500 个此类定制刺激,并在闭环实验中将其呈现给猴子。这种设置允许研究人员针对视觉皮层的特定区域进行测试,从处理简单形状的早期阶段到识别复杂物体的更高层级。结果令人惊讶。尽管这十个模型在预测标准自然照片的反应时表现同样出色,但在被要求利用定制刺激来控制神经元时,它们却失效了。大多数模型未能产生预期的神经放电变化。它们的视觉世界内部图谱虽然足以应对“猜测”,但与大脑细胞的实际调谐存在根本性的偏差。这些模型并未捕捉到神经元如何响应世界的精确细节;它们只是找到了在自然图像中行之有效的统计捷径,但在更严密的审查下便会崩溃。
这里有一个显著的例外。其中两个使用了被称为“对抗训练”(adversarial training)特定技术的模型展现出了持续的优势。这些模型在控制神经元放电方面表现更好,这表明它们的内部参数更接近大脑本身。然而,研究发现,具备抵御这些对抗性技巧的能力并非故事的全貌。控制神经元的能力与模型抵抗人工攻击的能力之间并没有强烈的关联。相反,关键因素是更基础的东西:输入梯度的空间频率结构。简单来说,这指的是影响模型决策的像素特定模式。表现最好的模型,其影响编码轴的像素分布,与大脑实际处理视觉信息的方式相匹配。
这项研究建立了一种更严谨的新方法,用于测试计算机模型与大脑的契合程度。通过从被动预测转向主动控制,科学家们证明了在标准测试中的高准确度可能会掩盖模型在表征视觉世界方面的深层缺陷。研究结果表明,虽然目前的模型令人印象深刻,但大多数尚未收敛到自然图像空间的真实生物参数化。只有通过测试一个模型是否能够通过精确的、强化的特征来因果性地驱动神经活动,我们才能知道它是否真的像灵长类大脑那样理解视觉世界。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。