← 最新论文
💻 computer science

Deep Models, Shallow Alignment: Uncovering the Granularity Mismatch in Neural Decoding

该论文引入了“浅层对齐”(Shallow Alignment)框架,通过系统地将大脑信号与预训练视觉模型的中间层而非仅仅是最终嵌入进行对齐,从而改善了神经视觉解码,进而解决了粒度不匹配问题,并实现了随模型容量增加而提升的显著性能增益。

原作者: Yang Du, Siyuan Dai, Yonghao Song, Paul M. Thompson, Haoteng Tang, Liang Zhan

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Yang Du, Siyuan Dai, Yonghao Song, Paul M. Thompson, Haoteng Tang, Liang Zhan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

人类的大脑是一个庞大而复杂的机器,它将撞击眼睛的光线转化为我们所感知的丰富多彩的世界。几十年来,科学家们一直试图理解这一过程究竟是如何发生的,即如何从简单的线条和颜色映射到像“狗”或“汽车”这样复杂的概念。近年来,一个新兴领域试图进行逆向操作:通过读取大脑的电活动来重建一个人正在看到的画面。这就是神经视觉解码(neural visual decoding)领域。通过在人的头皮上贴附传感器来测量脑波,研究人员希望将那些嘈эй、混乱的信号转化回人正在观看的图像。这是一场旨在构建生物大脑与数字世界之间桥梁的探索,有望为未来的技术提供助力,例如帮助人们在不说话的情况下进行交流,或为盲人恢复视力。

长期以来,构建这座桥梁的标准方法依赖于一个特定的假设:即大脑对图像的最终理解是匹配中最关键的部分。研究人员会使用一个经过训练用于识别物体的计算机程序——比如一个已经学会区分猫和狗的高级数字“眼睛”——并将大脑的信号与计算机关于该图像的最终、高层结论进行对比。其理念是,如果计算机说“猫”,那么大脑也应该用它自己的电语言在说“猫”。然而,这种方法经常碰壁。无论计算机程序变得多么强大,从大脑信号中准确重建图像的能力并没有随之提高。事实上,有时最先进的计算机模型表现甚至不如简单的模型,这让科学家们感到困惑:为什么机器的智能提升并不会带来对大脑读取能力的增强。

发表在《机器学习研究汇刊》(Transactions on Machine Learning Research)上的一项新研究挑战了这一长期存在的假设。由匹兹堡大学及其他机构组成的团队领导的研究人员提出,问题不在于计算机的智能,而在于比较的时机。他们认为,大脑不仅仅存储物体的最终标签;它还保留着对视觉体验的详细、多层次的记录,从最初的光影色彩到最终的概念。通过强迫大脑信号仅与计算机的最终、抽象结论相匹配,科学家实际上是在要求大脑忘记图像的所有丰富细节,而只记住物体的名称。这造成了一种错位,就像试图把方榫头塞进圆孔里一样。

为了解决这个问题,该团队开发了一种被称为“浅层对齐”(Shallow Alignment)的方法。他们不再等待计算机程序得出最终结论,而是开始将大脑的电信号与计算机的中间步骤进行对比。想象一下,一个计算机程序正在分析一张鸵鸟的照片。在早期步骤中,它注意到长而细的腿和特定的纹理;在中间步骤中,它识别出了鸟类的形状;只有在最后一步,它才会判定:“这是一只鸵鸟。”研究人员发现,大脑的信号(尤其是通过头皮传感器测量的信号)包含了所有这些细节的混合体。当他们将大脑信号与计算机的中层观察结果(即图像仍具有细节性但又开始产生意义的阶段)进行对齐时,结果有了显著的改善。

该团队利用两个大型大脑记录数据集测试了这一想法,一个测量电活动,另一个测量磁场,实验过程中受试者观看了数千种不同的物体。他们将这种新方法与现有的最佳技术进行了对比。差异是巨大的。在测试计算机如何根据脑波猜测人正在看什么图像时,新方法的准确率大幅提升。对于他们测试的最先进的计算机模型之一,成功率从大约 17% 跃升至接近 83%。这不仅仅是一个微小的改进,而是连接大脑与机器方式的一次根本性转变。

或许最令人惊讶的发现是,当他们使用更大、更强大的计算机模型时发生了什么。在旧方法下,使计算机变得更聪明往往会导致解码效果变差,作者称之为“深度容量悖论”(depth-capacity paradox)。计算机将图像压缩得越简单(即标签化程度越高),大脑信号就越难与之匹配。但在新的“浅层对齐”方法下,情况恰恰相反。随着计算机模型变得更大、功能更强,解码性能持续提升。研究人员表明,通过匹配正确的细节水平,他们终于能够释放这些庞大数字大脑的全部潜力,从而读取人类的思想。

研究还揭示了大脑信号并不只是关于最终的物体名称。当研究人员观察计算机在出错时“看到”了什么时,他们发现旧方法经常检索出类别正确但形状错误的图像。例如,如果一个人正在看一只鸵鸟,旧方法可能会检索出羊或鸽子的图片——它们都是鸟类,但缺乏鸵鸟那标志性的长腿。然而,新方法则能成功检索出鸵鸟以及其他具有特定结构细节的图像,即使这些图像在形状上与完全不同的物体(如桌子或婴儿床)相似。这表明大脑不仅保留了我们所见物体的类别,还保留了其物理形状和纹理。

为了确保这不仅仅是某个特定计算机模型的偶然现象,研究人员在各种数字架构(从旧的、简单的设计到最新的、复杂的系统)中测试了他们的方法。在所有案例中,观察计算机处理过程的中间层比观察末端能获得更好的结果。他们还发现,观察的最佳层级并非固定不变,而是取决于模型的深度和复杂程度。对于某些模型,最佳点位于处理过程约三分之一处;对于另一些模型,则接近三分之二处。这种灵活性表明,关键不在于寻找一个“神奇层”,而在于找到计算机的内部表征与大脑信号的自然“颗粒度”相匹配的具体点。

这项工作对脑机接口的未来具有重要意义。它表明,阅读思想的瓶颈不在于计算能力或数据的匮乏,而在于我们对大脑如何表征世界的理解存在误解。通过与大脑自然的、多层次的视觉方式对齐,而不是将其强行塞入一个单一的、抽象的框框中,研究人员可以构建更加准确且可靠的系统。研究结论指出,未来的道路在于尊重大脑视觉过程的复杂性,利用我们数字工具中丰富的中间细节,去解码我们自身大脑中同样丰富的中间细节。这种方法将一个令人沮丧的死胡同变成了一条清晰的前行之路,表明有时,为了理解全貌,你必须在最终答案写就之前,先观察其中的组成部分。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →