← 最新论文
🧠 neuroscience

The cortex encodes speech timing as departure from expectation across multiple timescales

这项研究表明,人类皮层在多个时间尺度上主动将语音时序变异性编码为有意义的信息,具体表现为表征音节和音素持续时间对预期的偏离,而非将其视为应被丢弃的噪声。

原作者: Molinaro, N., Perez-Navarro, J.

发布于 2026-09-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Molinaro, N., Perez-Navarro, J.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

当我们聆听一个故事时,我们的大脑不仅仅是在听单词;它们还在追踪声音的节奏。几十年来,科学家们一直认为大脑通过锁定一个稳定的节拍来解决语音时序问题,就像鼓手跟随节拍器保持节奏一样。在这种观点中,我们在拉长元音或在词与词之间停顿方面的自然变化被视为背景噪声,是一种大脑必须过滤掉以寻找潜在规律性的某种“静态”。当时的假设是,如果语音是完美规则的,我们的理解将会更加清晰。但这个想法留下了一个谜题:真实的语音很少是完美规则的,而且当研究人员人为地强迫语音进入一种机器人式的、完美定时节奏时,人们的理解能力反而下降了,尤其是在嘈р的环境中。这表明,这种不规则性本身可能正在发挥重要作用,或许它携带了稳定节拍所无法携带的信息。

巴斯克认知、大脑与语言中心(Basque Center on Cognition, Brain and Language)的一个研究小组决定测试大脑是将这些时序变化视为需要忽略的噪声,还是将其视为需要读取的信号。他们记录了25名西班牙语母语者在聆听20分钟自然、自发式叙事时的脑活动。选择西班牙语是因为它常被描述为一种具有稳定、基于音节节奏的语言,这使其成为测试“大脑偏好规则性”这一观点的最严格案例。研究人员建立了一个计算机模型,用于追踪三个不同层级的时序预期:下一个音节何时应该开始、下一个词内音素何时应该开始,以及基于前文内容某个特定声音应该持续多久。随后,他们将这些预期与语音的实际时序以及听众的大脑电活动进行了对比。

研究结果推翻了大脑试图平滑不规则性的旧观念。相反,研究发现大脑会编码声音偏离预期的确切时刻。研究人员发现,大脑并不只是测量一个声音持续了多少毫秒,而是计算该持续时间的“惊奇度”(surprisingness)。如果说话者持音时间比听者大脑预测的长,或者短,这种差异就会触发听觉皮层的特定反应。这种反应不仅仅是对声音的普遍反应,而是对预期与现实之间差距的精确计算。研究表明,这种机制在不同的语速下都能运作,从音节的缓慢节奏到单个音素那极其短暂的时序。

至关重要的是,大脑也会关注“惊喜”的方向。它能够区分声音是来得太早还是来得太晚。这两类偏差会在不同时间触发不同的脑部反应,这表明大脑不仅在测量误差的大小,还在测量误差的性质。当研究人员比较声音的原始长度与该长度带来的惊奇度时,他们发现一旦大脑考虑了惊奇度,它就会忽略原始长度。换句话说,大脑并不在意一个声音持续了100毫秒;它在意的是,当大脑预期它持续40毫秒时,它却持续了100毫秒。这一发现通过一项行为实验得到了证实:当自然时序被压平为完美的、机器人式的节奏时,听者在理解句子时会感到显著困难。

该研究还阐明了这种时序预测是如何与大脑预测下一个词的能力协同工作的。研究人员发现,大脑处理事件的时序与处理词义是两个独立且并行的过程。大脑预测一个声音何时发生,并不依赖于该声音的含义。这意味着大脑一直在运行着一个时钟,这个时钟每时每刻都在更新,根据即时的过去不断调整预期,并在下一个声音到达时记录偏差。这种偏差并没有被当作错误丢弃;而是作为一种信息被保留了下来。

这些发现表明,自然语言中的不规则性并非大脑必须克服的缺陷,而是大脑利用的一种特征。大脑利用每一时刻对预期的偏离,来构建对语音流丰富且细致的理解。通过将时序视为一种变量信号而非固定节拍,大脑能够适应人类对话中流动且不可预测的本质。这项研究得出结论:聆听的大脑不仅仅是从杂乱的信号中恢复隐藏的规律,它还在解读这种“杂乱”本身,在那些曾被认为是噪声的偏差中寻找意义。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →