✨ 要点🔬 技术摘要
想象一下,你的大脑是一个超级先进的剧院,每当你看到一张图片时,后排就会有一束特定的聚光灯亮起,照亮舞台上的演员。科学家们长期以来一直试图弄清楚究竟是什么触发了这些聚光灯。多年来,他们认为答案在于“像素”——即颜色、形状和边缘等原始视觉细节。他们构建了像数字眼睛一样的计算机程序,试图模仿我们大脑处理这些视觉线索的方式。但最近,一个奇怪的发现打破了现状:事实证明,如果你仅仅用文字来描述一张图片,这些文字对大脑反应的预测能力几乎可以与图片本身媲美!这表明,图像的“意义”对于我们大脑而言,可能与图像本身一样重要。但这里有一个大问题:你“如何”书写那段描述重要吗?一段短促、破碎的句子是否与一个长篇、流畅的故事一样有效?以及,是由人类编写还是由机器人编写,是否会有所不同?
这篇论文深入探讨了这个谜团。研究人员扮演着侦探的角色,测试了描述图像的不同“配方”,以观察哪些配方能与人类大脑活动匹配得最好。他们选取了大量的自然场景,并要求五种不同的人工智能机器人(称为视觉-语言模型)来编写描述。这些机器人的“性格”各异:有些写的是简短、简单的句子,而另一些则写的是长而详细的段落。他们还测试了由真实人类编写的描述。然后,他们将所有这些描述输入到五种不同的“翻译器”计算机(语言模型)中,将文字转化为数学代码。最后,他们将这些代码与人们观看图片时的实际大脑扫描结果进行了对比。
结果带来了一个情节转折。首先,机器人编写的描述通常比人类编写的描述更能预测大脑活动。事实证明,人类的描述有点太短,而且带有一点“噪声”(就像带有静电的收音机),而机器人的句子写得更流畅、更连贯。其次,“翻译器”计算机的类型起到了巨大的作用。最好的结果来自于一种专门设计用于理解整个句子“意义”,而非仅仅猜测下一个单词的特殊“翻译器”。这些“侧重意义”的翻译器生成的代码,与我们大脑组织视觉信息的方式完美契合。
研究人员还观察了“翻译器”计算机内部的运作情况,看看魔力发生在哪里。他们发现,最匹配大脑的代码并非来自计算机处理过程的最开始或最后,而是来自中间层——也就是计算机完成语法和基本意义理解之后的阶段。有趣的是,识别面部和身体的大脑区域似乎更青睐“中间层”的意义,而识别场所的区域则更喜欢“深层”的意义。
最后,这项研究表明,要理解我们的大脑如何看待世界,我们不应仅仅观察图片;我们还应该观察我们如何描述它。最好的描述不仅仅是物体的清单;它们是流畅、详细的故事,并且当通过真正理解这些故事意义的计算机进行处理时,效果最为出色。这给了科学家们一个强大的新工具:如果他们能写出正确类型的描述,即使在没有看到图片的情况下,也能预测我们的大脑会对周围世界做出怎样的反应。
问题陈述 最近的研究表明,由大型语言模型(LLMs)表示的图像描述(标题)可以预测人类大脑高层视觉区域的神经反应,这挑战了视觉感知仅依赖于严格视觉特征的观点。然而,驱动这种大脑预测性的具体因素仍不明确。目前尚不确定这种性能是由标题的语义内容、文本的流畅度与细节,还是由用于生成嵌入(embeddings)的特定语言模型架构所驱动。此外,以往的工作完全依赖于来自 MS COCO 数据集的真人标注标题,这些标题通常较短且由众包人员提供,这可能限制了语言表示的质量。本研究旨在系统地调查标题内容的变化(通过不同的视觉语言模型生成)以及用于嵌入这些标题的语言模型的变化如何影响大脑预测性和行为一致性。
方法论 作者使用了自然场景数据集(Natural Scenes Dataset, NSD),该数据集包含 8 名参与者在观看 9 组来自 MS COCO 数据集的 906 幅自然图像时的高分辨率 fMRI 响应。在 fMRI 扫描期间,并未向参与者展示任何图像描述。
标题生成: 针对 906 幅图像,作者使用五种开源视觉语言模型(VLMs):LLaVA OneVision、Phi-4、Pixtral、Qwen2.5-VL 和 Molmo,分别为每幅图像生成了多个标题。这些生成的标题与原始的人类标注 MS COCO 标题进行了对比。生成的标题在长度、流畅度(通过困惑度测量)、视觉性(基于 Lancaster Sensorimotor Norms)和词汇密度方面呈现出系统性的差异。
嵌入生成: 每条标题都使用五种不同的开源纯文本语言模型(LMs)进行嵌入,以确保没有视觉信息“污染”语言表示。这些语言模型包括:
一个早期的掩码语言模型(BERT)。
两个自回归模型(GPT-2、Llama3.1)。
两个近期在语义任务上经过微调的文本嵌入模型(Qwen3 Embedding、KaLM Embedding)。 从这些模型的所有层中提取了嵌入。
评估指标:
大脑编码: 使用逐体素正则化线性回归(岭回归)来预测三个功能定位感兴趣区域(ROIs)中的神经激活情况:面部选择区、身体选择区和场景选择区。性能通过预测激活与观测激活之间的皮尔逊相关系数来衡量。
大脑对齐: 使用表征相似性分析(RSA)计算源自标题嵌入的表征差异矩阵(RDMs)与源自神经激活的 RDMs 之间的斯皮尔曼相关系数。
行为对齐: 同样使用 RSA 将标题嵌入与同一组 NSD 参与者收集的人类图像相似性判断进行比较。
内在维度: 作者使用广义比例内在维度估计器(GRIDE)来分析跨模型层的信息压缩情况。
关键结果
机器生成 vs. 人类标注: 机器生成的标题显著预测了神经激活,其表现通常优于以往工作中使用的真人标注 MS COCO 标题。具体而言,由 Qwen2.5-VL、Pixtral 和 Molmo 生成的标题显示出最高的预测性。作者将 MS COCO 标题较低的性能部分归因于其较低的流畅度和简洁性,并指出通过平均多个 MS COCO 标题可以提高性能,使其达到单个机器生成标题的水平。
语言模型的影响: 文本嵌入模型(Qwen3 和 KaLM)在脑预测性和行为对齐方面均一致优于自回归语言模型(GPT-2、Llama3)和 BERT。这表明,专门针对语义表示进行微调的模型比主要针对下一标记预测(next-token prediction)训练的模型能更有效地捕捉到与大脑相关的特征。
层级分析: 大脑预测性和行为对齐都在中间网络深度达到峰值,该阶段紧随高内在维度阶段之后。这种高维阶段被理论认为标志着抽象句法和语义结构的出现。
ROI 中的分离: 在层级对齐中观察到了“双重分离”。与面部和身体选择性 ROI 的对齐在中间层达到峰值并在后期层下降,而与场景选择性 ROI 的对齐在最深层显著增加。这表明,模拟这些不同视觉区域的相似性模式需要不同的语言信息。
行为优越性: 标题嵌入(特别是使用机器生成标题的文本嵌入模型)在与人类图像相似性判断的对齐度上,高于从最先进视觉模型(ResNet-50 和 ViT)中提取的图像特征。
意义与主张 本文声称,图像标题的内容以及用于表示它们的特定语言模型,都是决定大脑建模和行为建模性能的关键因素。作者证明了标题嵌入是一种研究高层视觉感知的有用工具,能够高精度地预测神经活动和人类相似性判断。
至关重要的是,研究表明,语言表示的大脑预测性并非仅仅是视觉信息泄露的副产品,而是由文本的语义属性驱动的。文本嵌入模型优于自回归模型这一发现表明,表示句子级含义的能力对于建模视觉感知至关重要。此外,对内在维度的分析提供了证据,表明抽象语言结构的出现(由内在维度的峰值标示)正是其表示与人类大脑活动最具预测性的阶段。最后,本研究首次对 NSD 相似性判断进行了分析,揭示了语言表示甚至能比视觉特征更好地模拟人类感知的相似性,凸显了语言与视觉感知之间深层的相互作用。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。