← 最新论文
💻 computer science

What Makes Linguistic Representations Good Models of High-Level Visual Perception in the Human Brain?

这项研究表明,嵌入文本模型的机器生成图像描述(特别是在网络中间层)与人类标注的描述以及自回归语言模型相比,能够提供更优越的人类高层视觉感知模型和行为一致性模型。

原作者: Anna Bavaresco, Ina Klarić, Raquel Fernández, Marie-Francine Moens

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Anna Bavaresco, Ina Klarić, Raquel Fernández, Marie-Francine Moens

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你的大脑是一个超级先进的剧院,每当你看到一张图片时,后排就会有一束特定的聚光灯亮起,照亮舞台上的演员。科学家们长期以来一直试图弄清楚究竟是什么触发了这些聚光灯。多年来,他们认为答案在于“像素”——即颜色、形状和边缘等原始视觉细节。他们构建了像数字眼睛一样的计算机程序,试图模仿我们大脑处理这些视觉线索的方式。但最近,一个奇怪的发现打破了现状:事实证明,如果你仅仅用文字来描述一张图片,这些文字对大脑反应的预测能力几乎可以与图片本身媲美!这表明,图像的“意义”对于我们大脑而言,可能与图像本身一样重要。但这里有一个大问题:你“如何”书写那段描述重要吗?一段短促、破碎的句子是否与一个长篇、流畅的故事一样有效?以及,是由人类编写还是由机器人编写,是否会有所不同?

这篇论文深入探讨了这个谜团。研究人员扮演着侦探的角色,测试了描述图像的不同“配方”,以观察哪些配方能与人类大脑活动匹配得最好。他们选取了大量的自然场景,并要求五种不同的人工智能机器人(称为视觉-语言模型)来编写描述。这些机器人的“性格”各异:有些写的是简短、简单的句子,而另一些则写的是长而详细的段落。他们还测试了由真实人类编写的描述。然后,他们将所有这些描述输入到五种不同的“翻译器”计算机(语言模型)中,将文字转化为数学代码。最后,他们将这些代码与人们观看图片时的实际大脑扫描结果进行了对比。

结果带来了一个情节转折。首先,机器人编写的描述通常比人类编写的描述更能预测大脑活动。事实证明,人类的描述有点太短,而且带有一点“噪声”(就像带有静电的收音机),而机器人的句子写得更流畅、更连贯。其次,“翻译器”计算机的类型起到了巨大的作用。最好的结果来自于一种专门设计用于理解整个句子“意义”,而非仅仅猜测下一个单词的特殊“翻译器”。这些“侧重意义”的翻译器生成的代码,与我们大脑组织视觉信息的方式完美契合。

研究人员还观察了“翻译器”计算机内部的运作情况,看看魔力发生在哪里。他们发现,最匹配大脑的代码并非来自计算机处理过程的最开始或最后,而是来自中间层——也就是计算机完成语法和基本意义理解之后的阶段。有趣的是,识别面部和身体的大脑区域似乎更青睐“中间层”的意义,而识别场所的区域则更喜欢“深层”的意义。

最后,这项研究表明,要理解我们的大脑如何看待世界,我们不应仅仅观察图片;我们还应该观察我们如何描述它。最好的描述不仅仅是物体的清单;它们是流畅、详细的故事,并且当通过真正理解这些故事意义的计算机进行处理时,效果最为出色。这给了科学家们一个强大的新工具:如果他们能写出正确类型的描述,即使在没有看到图片的情况下,也能预测我们的大脑会对周围世界做出怎样的反应。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →