Toward a mechanistic understanding of inference in visual cortex and diffusion models
本文提出了一种基于具有成对相互作用的稀疏编码的极简且可解释的扩散模型,该模型通过模拟 V1 水平连接实现了高性能的图像去噪,同时为生物感知推理以及黑盒扩散架构的内部运作机制提供了见解。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
大脑的侦探工作与 AI 的梦境机器
想象一下,你正在试图解开一个谜题,但线索零散、模糊,而且有一半都丢失了。每当你观察世界时,发生的情况正是如此。你的眼睛并不仅仅是在拍摄一张完美的照片;它们接收到的是一团混乱的光影。为了理解这些信息,你的大脑必须扮演一名侦探的角色,填补空白并猜测完整的图像是什么样子。这个过程被称为“知觉推理”(perceptual inference)。几十年来,科学家们一直好奇大脑是如何如此轻松地完成这项工作的。他们知道,视觉皮层(大脑中负责视觉的部分)中的神经元是以特定的方式连接在一起的,就像一群通过交谈来就所见之物达成共识的朋友网络。
与此同时,一种被称为“扩散模型”(diffusion model)的新型人工智能因其能够创造出令人惊叹的图像而变得名声大噪。这些 AI 系统通过从纯粹的静态噪声(就像旧电视屏幕上的雪花点)开始,并缓慢地对其进行清理,直到清晰的图像显现出来。它们表现得极其出色,但也是“黑箱”。我们知道它们有效,但并不真正了解其中的数百万个微小的数字神经元是如何决定一只狗或一张脸应该长什么样的。一个重大的问题是:大脑和这些 AI 模型是否正在使用相同的秘密技巧来解决视觉这一谜题?如果我们能弄清楚 AI 遵循的规则,也许我们最终就能理解我们的大脑是如何运作的。
论文的核心思想:一个拥有“大脑袋”的简单模型
这篇论文介绍了一种新的、简化的模型,试图弥合人类大脑如何视觉化与 AI 如何生成图像之间的鸿沟。作者们是一支来自加州大学伯克利分校及其他机构的研究团队,他们构建了一个模拟初级视觉皮层(V1,大脑处理视觉信息的首站)的计算机程序。他们没有使用那种难以解读的、庞大且复杂的深度学习网络,而是创建了一个基于稀疏编码(sparse coding)概念的“极简”模型。
把稀疏编码想象成一个拼图游戏,你只使用一些特定的碎片来构建一幅画。在大脑中,这意味着在任何给定时刻,只有少量的神经元会放电来代表一幅图像。作者采用了这个想法并加入了一个转折:他们让神经元以特定的方式相互交流。在标准模型中,神经元通常被视为独立的个体。但在这种新模型中,作者赋予了神经元一个“社交网络”(交互矩阵),使它们能够相互影响。这使得模型能够学习到,如果图像的一部分有一条上升的线,那么下一部分很可能会延续这条线,即使图像充满了噪声或破碎。
他们的发现:大脑的“社交网络”
当研究人员用自然图像(如风景和物体的照片)训练这个模型时,神奇的事情发生了。模型学到的“社交网络”看起来与人类大脑中发现的物理连接完全一致。具体来说,模型在对相似角度且排列成行的神经元之间建立了强有力的连接。这被称为共线性促进(collinear facilitation)。
在现实世界中,这就是为什么即使蛇的一部分隐藏在茂密的草丛中,你也能轻易看到它在爬行。你的大脑会将这些点连接起来。论文显示,该模型也能做到这一点。当他们向模型展示一张带有断裂、隐藏轮廓的图片(例如一条消失在云层后的线)时,模型并没有进行随机猜测。它利用其学到的连接来“填补”缺失的线条,从而创造出一条平滑且连续的曲线。这种表现几乎与那些庞大、复杂的 AI 模型不相上下,但它有一个巨大的优势:由于我们的模型非常简单,研究人员实际上可以观察内部并了解其运作机制。
秘诀所在:AI 如何“思考”
论文中最令人兴奋的发现之一是该模型如何处理“填补”过程。作者通过数学推导证明,模型不仅仅是在猜测;它像池塘中的涟漪一样扩散活动。当一个神经元检测到线条的一部分时,它会向邻近的神经元发送信号。如果这些邻居也是活跃的且排列对齐,信号就会增强,从而强化“此处存在线条”的概念。如果邻居们不对齐或处于非活跃状态,信号就会被切断。
论文指出,尽管该模型只有一个层级,但它创造了一种“层级结构”。模型中大约 30% 的神经元学会了完全脱离直接的视觉输入。这些“脱离的神经元”充当了第二个隐藏层,帮助模型理解全局图景。它们不看像素,而是帮助执行全局规则,例如确保脸部的两只眼睛相对于彼此处于正确的位置。这解释了为什么该模型可以生成一张全新的、看起来非常真实的脸,即使它从未见过那张确切的脸。它不是在记忆,而是在理解几何结构。
为什么这很重要:从 AI 到生物学
论文表明,现代 AI 扩散模型复杂且神秘的行为,可能实际上是由我们视觉皮层中发现的那些简单的生物学原理驱动的。深度学习的“黑箱”可能只是作者构建的简单循环电路的一个非常复杂版本。
通过证明一个简单、可解释的模型可以达到巨型 AI 系统的性能,作者为研究大脑提供了一种新途径。他们提出,视觉系统利用这些特定的连接来解决歧义,将一个充满噪声、混乱的世界转化为一个清晰、连贯的图像。这不仅仅是一个理论;该模型关于神经元如何对不同类型的噪声做出反应的预测,与近期在真实生物大脑中的实验结果相吻合。
简而言之,这篇论文表明,无论是视觉还是创作艺术,其秘诀可能都是相同的:一套简单的规则,允许局部线索相互连接并形成一个全局的故事。无论是你大脑中的神经元,还是 AI 中的数字权重,目标都是在混沌中寻找模式。而现在,多亏了这个模型,我们拥有了一张更清晰的地图,去描绘这种模式是如何产生的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。