← 最新论文
🧠 neuroscience

Language-aligned models and structured scene descriptions reveal sensitivity to compositional scene structure in the high-level visual cortex

本研究利用 7T fMRI 数据和语言对齐模型,证明了高级视觉皮层对自然场景的组合结构而非仅仅是对物体的共现性具有敏感性,这表明语言监督可以帮助人工视觉模型发展出类似的结构化表示。

原作者: Rajaei, K., Afshar, A., Cichy, R. M., Soltanian-Zadeh, H.

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Rajaei, K., Afshar, A., Cichy, R. M., Soltanian-Zadeh, H.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,你的大脑是一个规模宏大、繁忙有序的图书馆。长期以来,科学家们认为这个图书馆的“视觉部门”仅仅是一个存放单个物体的巨大文件柜。如果你看到一只狗、一辆车或一棵树,就会有一个特定的架子亮起来并发出信号:“嘿,这里有一只狗!”但当那只狗正在追逐那辆车,或者那棵树挡住了那辆车时,会发生什么呢?大脑是在勾选一份物品清单,还是实际上在阅读它们如何组合在一起的故事?这个问题处于认知神经科学领域的核心,研究人员正试图解码我们思想与感官的秘密语言。他们使用像 fMRI(功能性磁共振成像)这样强大的工具,它就像一台高科技相机,可以观察当你注视某物时,大脑的哪些部分正在进行“交谈”。最大的谜团在于,我们大脑的视觉中心是否足够聪明,能够理解事物之间的“关系”,还是它仅仅是一个只关心存在哪些物体的清单制作者。

一组研究人员决定通过将大脑视为侦探、将语言视为放大镜来破解这一密码。他们使用了八个人的数据,这些人在观看 10,000 幅不同的自然场景时接受了大脑扫描。为了测试大脑理解“故事”而非仅仅是“清单”的能力,他们设计了一个巧妙的实验。对于每一张图片,他们使用人工智能编写了一个完整的、符合语法的句子,准确描述正在发生的事情(例如,“一个人正在公园里追逐一只狗”)。然后,他们将同一个句子打乱成一堆随机的单词(例如,“公园,狗,人,追逐,在,一个”)。这两个版本拥有完全相同的单词,但只有第一个版本讲述了一个具有清晰结构的连贯故事。

结果呈现了一个引人入胜的发现。当研究人员尝试根据这些描述来预测大脑的行为时,打乱后的“词袋”仍然可以预测大脑活动,但其准确度明显低于完整的、有结构的句子。结构化句子提供了更好的匹配,尤其是在负责识别面孔、地点和身体的高级区域。事实证明,大脑不仅仅是一个清单制作者;它是一个讲故事的人。它非常在意这些碎片是如何组合在一起的。研究人员还用计算机模型进行了测试。他们发现,经过训练以同时理解图像和语言的 AI 模型,在预测大脑活动方面比仅观察图片的模型要出色得多。这表明语言有助于大脑(或许也包括 AI)将视觉世界组织成有意义的联系,而不仅仅是物体的堆砌。

为了确保这不仅仅是因为句子听起来“流畅”或符合语法,团队又尝试了第二个技巧。他们提取了原始故事中的关键词,并要求 AI 仅使用这些词编写一个“新的”语法正确的句子。尽管这个新句子在语法上是完美的,但它对大脑反应的预测效果并不如那个针对特定图像的原始故事那样好。这证明了大脑并不只是满足于听到任何格式良好的句子;它特别渴望存在于实际场景中那种独特的、结构化的关系。这项研究表明,高级视觉皮层对场景的“组合结构”——即主体、动作和空间是如何组织的特定方式——非常敏感。仅仅知道那里有一只狗和一个人是不够的;大脑需要知道谁在追逐谁,才能真正“看清”这个场景。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →