← 最新论文
🧠 neuroscience

Deep-layer cortical tracking abruptly collapses in the absence of language comprehension

通过将高分辨率脑磁图与音频大语言模型相结合,本研究表明,尽管声学处理在不同语言理解水平下保持一致,但当缺乏言语理解时,深层皮层追踪会发生骤然崩溃,从而精准定位了从感知到意义的神经转变过程。

原作者: Yang, C., Thwaites, A., Wingfield, C., Zhang, C., Woolgar, A.

发布于 2026-09-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Yang, C., Thwaites, A., Wingfield, C., Zhang, C., Woolgar, A.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

人类的大脑是声音的大师,能够将混乱的振动流转化为连贯的故事、清晰的指令或一个共同的笑话。几十年来,科学家们一直知道这种转化是分阶段进行的。首先,耳朵和大脑的早期部分捕捉声音的原始物理属性:其音高、音量和节奏。随后,大脑的其他部分将这些声音缝合在一起,形成单词、句子和意义。但究竟在哪里划定了“仅仅听到噪音”与“理解其含义”之间的界限,一直是一个谜。在流动的对话中,物理声音与意义交织得如此紧密,以至于几乎无法分辨其中一个在哪里结束,另一个从哪里开始。这个差距至关重要,因为如果不知道理解从何时开始,就很难衡量那些可能因严重受伤而无法说话或移动的人,是否真的理解了周围的世界。

研究团队现在利用一种新方法精确地绘制了这个边界,该方法将大脑视为一台复杂的机器,并将其直接与一个先进的计算机模型进行对比。通过在人们聆听自然语言时监测大脑的电信号,并将这些信号与经过语言训练的人工智能内部运作方式进行匹配,他们发现了一条清晰的分界线。当听者理解语言时,大脑的活动会镜像反映出处理意义的计算机模型中那些深层且复杂的层级。但当听者听到他们不懂的语言时,这种深层的连接会瞬间消失。大脑仍能完美地追踪基础声音,但负责高级理解的大脑部分却停止了对模型的跟随。这一发现精准定位了大脑处理链中“听觉”转变为“理解”的时刻,为判断即使在听者无法表达的情况下,语音是否被理解,提供了一种清晰的非侵入式方法。

为了找到这个边界,研究人员求助于一种强大的工具:一个专门用于处理音频的大型语言模型,具体是一个名为 Qwen2.5-Omni 的系统。该模型的设计结构就像一座多层工厂。第一层作为麦克风,将原始声波分解为频率和响度等基本组成部分。随着数据向更深层移动,穿过随后的数十个层级,它开始识别模式、单词,并最终识别思想之间的复杂关系。研究人员想要观察人类大脑是否也遵循同样的路径。他们记录了母语为英语的人在听英语播客时的脑活动,以及母语为俄语的人在听俄语播客时的脑活动。与此同时,他们将完全相同的音频输入到计算机模型中,并观察其 145,000 个独立人工神经元的活动如何随时间变化。

结果令人震惊。对于母语听者而言,大脑的活动从最初的声音处理层一直到构建意义的最深层,都与计算机模型保持一致。这就像大脑与计算机在层层递进中步调一致,完美同步。研究人员可以看到,随着计算机模型从简单的声音检测转向复杂的语言理解,人类大脑也经历了同样的过程,只是存在轻微的延迟。这证实了大脑是以层次化的方式处理自然语言的,即从物理层面转向抽象层面,并且这一过程可以通过与执行相同任务的机器进行对比来追踪。

为了找到理解与单纯听觉发生分歧的确切点,研究人员引入了一个关键性的转折。他们将俄语音频播放给一群听不懂俄语的英语母语者。这些声波在物理上与母语为俄语的人所听到的完全相同,但对于这组人来说,这些声音仅仅是噪音。他们能听到节奏和音量,但无法领悟其中的意义。当研究人员将这些不理解语言的听者的脑活动与计算机模型进行比较时,发生了戏剧性的变化。大脑仍然完美地匹配计算机的早期层级,以与母语听者相同的精度追踪基础声音。然而,一旦计算机模型进入其开始构建意义的更深层,它与人类大脑的对齐便崩塌了。

这种崩塌是突然且彻底的。在计算机模型的特定层级之后,不理解语言的听者的脑活动停止了对计算机内部状态的追踪。残存的极少数连接不再追踪单词或思想,而仅在追踪声音最基本的物理特征,如响度或单词的时长。这仿佛大脑意识到无法在信息流中找到意义,于是退回到了原始数据的安全区,忽略了意义存在的复杂层级。研究人员以极高的精度识别了这个断裂点,将其定位在模型架构中的一个特定层级。这表明,大脑并非随着语言变得陌生而逐渐失去对意义的掌控;相反,它在接触到一堵“墙”之前一直保持着对声音的完美掌控,一旦撞墙,高级别的追踪就会直接关闭。

这项研究还表明,这个边界并非一个模糊的地带,而是一个明确的阈值。通过逐层分析数据,研究人员发现从高追踪到无追踪的转变如此剧烈,以至于可以精确到模型中的单个层级。这种细节水平之所以成为可能,是因为他们逐一观察了计算机模型的每一个单元,而不是将它们平均化。以往将大脑和计算机模型作为一个整体进行观察的研究往往忽略了这一区别,因为它们将简单的声音处理与复杂的意义处理混为一谈。通过隔离每一个步骤,研究人员展示了大脑追踪深层、抽象表征的能力完全取决于听者对语言的理解能力。

这一发现为我们看待大脑如何构建意义提供了新的视角。它证实了理解不仅仅是听觉的一个“放大版”;它是一个截然不同的计算阶段,需要听者具备必要的语言知识。当缺乏这种知识时,大脑并不会挣扎着去寻找意义,而是直接停止尝试追踪复杂的模式,转而完全专注于声音的物理属性。这一发现对于理解在沟通困难(如无法言语或做出反应的患者)的情况下大脑如何运作具有潜在意义。如果大脑的深层追踪在缺乏理解时会发生崩塌,那么测量这种追踪是否可以作为一种可靠的、非侵入性的测试,用以判断一个人是否理解了语音,即使他们无法通过言语表达出来。研究人员指出,尽管他们的发现是基于特定的语言和模型,但该方法为测试这种边界是否存在于不同语言和不同类型的语音中提供了一条清晰的路径。

这项工作代表了弥合人工智能与神经科学之间鸿沟的重要一步。通过使用一种处理语言的方式具有透明度和可解释性的计算机模型,研究人员能够像阅读地图一样读取大脑的活动。他们不仅看到了大脑处于活跃状态,还看到了大脑在每一时刻究竟在哪个部分活跃以及在做什么。这种方法超越了询问大脑是否理解语音,转而探讨大脑是如何逐层构建这种理解的。其结果呈现了一幅清晰、详尽的从声音到意义的旅程图谱,展示了当我们停止理解一种语言时,正是大脑停止跟随意义之路、回归声音本身安全区的时刻。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →