← 最新论文
🧬 biology

The semantic geometry of action: convergence across foundation models, human behaviour and the brain

本研究表明,基础模型将自然主义动作组织在一种语义几何结构中,该结构与人类行为判断及皮层表征相一致,且在预测人类相似性评分和大脑活动方面优于传统的视频编码器。

原作者: Huiguang He, Changde Du, Yi Sun, Yizhuo Lu, Shuang Qiu, Kun Zhao, Yaozhi Wen, Chen Hu

发布于 2026-09-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Huiguang He, Changde Du, Yi Sun, Yizhuo Lu, Shuang Qiu, Kun Zhao, Yaozhi Wen, Chen Hu

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

人类是解读动态世界的专家。当我们观察他人时,我们不仅仅是看到一个身体在空间中移动;我们能瞬间理解他们试图做什么、为什么要这样做,以及他们的下一步动作可能是什么。这种解释动态行为的能力是人类智能的基石,让我们能够应对复杂的社交情境并与他人协作。几十年来,科学家们一直试图构建能够具备同样能力的通用人工智能。虽然现代计算机程序现在已经可以高精度地识别动作——区分一个人是在跑步还是在走路——但研究人员长期以来一直在思考,这些机器是否真的像人类一样理解动作背后的含义。它们是基于我们所使用的逻辑来组织这些动作的内部“思维”,还是仅仅在匹配像素模式而并未领悟其底层的概念?

来自中国自动化研究所的一个研究小组现在向回答这一问题迈出了重要一步。他们致力于绘制人类与先进人工智能如何组织“人类动作”这一概念的隐藏结构。通过比较大型语言模型(能够阅读)、多模态模型(能够看和读)以及人类大脑中关于动作的内部“地理结构”,他们发现了一种令人惊讶的趋同现象。研究表明,当这些人工系统接受海量数据训练时,它们会自发地形成一种关于人类动作的思考方式,这种方式与人类的感知高度一致,甚至镜像了人类大脑处理这些相同运动的方式。

为了探索这一点,研究人员将人工智能模型视为心理学实验的参与者。他们向这些模型展示了数千段短视频剪辑和关于人们从事各种活动(从烹饪、园艺到格斗和舞蹈)的文字描述。模型被要求执行一项简单但具有启发性的任务:在给出三种不同动作的情况下,识别出哪一个是“异类”。例如,如果展示一段滑雪、一段绘画和一段攀岩的视频,模型必须决定哪种动作与其他两者最不相符。通过分析数百万次这类选择,研究人员得以重建模型用于分类这些动作的无形心理地图。他们对一大群人类参与者也进行了同样的操作,建立了一个关于人类如何自然地分组和区分不同行为的基准。

结果显示,仅通过阅读动作描述的纯文本模型,以及观看实际视频的多模态模型,都发展出了与人类地图惊人相似的内部地图。这些地图并非随机生成的;它们将动作组织在低维空间中,使相似的行为靠在一起,而不同的行为则相距较远。至关重要的是,这些人工地图对人类选择的预测能力,优于依赖简单视觉特征的传统视频分析工具。研究发现,这些模型不仅仅是在记忆视频;它们捕捉到了人类用来理解运动的抽象目标和社会语境。例如,模型学会了将“社交”类动作归为一类,并将它们与“独处”类任务区分开来,正如人类的做法一样。

为了证明这些内部地图确实具有意义而非仅仅是统计技巧,研究人员通过两种严谨的方式对其进行了测试。首先,他们利用模型的内部地图来引导视频生成系统。通过调整模型内部表示中的一个数值,他们可以平滑地改变视频的内容。如果他们增加一个“与自然相关”的维度值,室内场景就会转化为室外场景;如果他们提升一个“运动”维度的值,活动就会转向竞技体育。这证明了模型已经学习到了可控且连贯的动作概念,可以通过操纵这些概念来创造新的、连贯的视觉场景。

其次,或许也是最显著的一点,研究人员测试了这些人工地图是否能够预测人类大脑的活动。他们将学习到的固定地图应用于一个大规模数据集,该数据集包含了人们观看数千个不同动作视频时的脑部扫描数据。他们发现,模型的内部组织成功预测了在观看特定动作时,人类大脑哪些部分会被激活。那些纯粹通过语言描述学习动作概念、从未见过视频的文本模型,在预测负责理解复杂社会性和目标导向行为的高级脑区活动方面,表现得尤为出色。这表明,通过语言学习到的动作抽象概念,足以捕捉人类大脑表征运动的核心结构。

研究还强调了不同类型模型之间的有趣差异。虽然观看视频的模型捕捉到了精细的视觉细节,但纯文本模型在将动作组织成宏观且有意义的类别方面却表现得异常出色。在某些脑区,文本模型在预测人类神经反应方面甚至比视频模型更有效。这意味着,对动作的概念性理解——即知道一个人想要实现什么目标——对于实现类人感知可能比具体的运动视觉细节更为重要。

最终,这项研究为理解人工智能与生物智能之间的关系提供了一种强有力的新途径。它表明,当机器暴露在足够多的数据中时,它们可以发展出一种与人类共享的语义几何结构,以一种在功能上与我们自身高度一致的方式来组织动作世界。研究结果暗示,通往真正智能机器的路径可能并不需要我们显式地为其编写人类规则,而是通过让它们在人类经验的丰富性中自行发现这些结构。该研究并不声称机器拥有意识或情感,但它确实证明了机器可以构建起一种与人类行为深度对齐的结构化理解,为未来人机交互奠定了充满希望的基础。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →