← 最新论文
💻 computer science

Spatiotemporal analysis of acoustic parameters for quantifying linguistic rhythm using CNN–BiLSTM

本研究表明,一种混合 CNN–BiLSTM 架构在量化语言节奏方面优于传统的声学特征分析和更简单的深度学习模型,其在区分梵文、印地语吟诵与正常语音方面的准确率超过 95%,同时揭示了由于其音节计时结构,梵文具有更高的节奏规律性。

原作者: Nayarah Shabir khan, Parveen Kumar Lehana

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Nayarah Shabir khan, Parveen Kumar Lehana

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

人类的声音不仅仅是交谈的工具;它是一个由呼吸、声带以及口腔和鼻腔内复杂的腔体所塑造的复杂乐器。当我们说话时,我们的大脑会发送信号来协调这些物理部分以产生声波,这些声波传播到我们的耳朵并被解释为意义。但在言语之下隐藏着一层结构的维度:节奏。正如心跳有稳定的脉搏一样,言语也有一种时间模式,即声音与停顿的定时,这赋予了它独特的特征。某些言语形式,如古老的吟诵实践,旨在实现高度的规律性,以受控的、近乎机械的精确度重复声音。而其他的形式,如日常对话,则是流动的且多变的,通过改变速度和音调来传达情感和细微差别。科学家们长期以来一直对这些不同的说话风格如何影响声音的物理稳定性感兴趣,特别是在一个人疲劳或处于压力之下时。通过测量音高和停顿时长的微小波动,研究人员可以检测出声带工作的细微变化,从而为观察一个人的精神和身体状态提供一个窗口。

来自查谟大学的一个研究小组致力于通过比较两种截然不同的声音使用方式来探索这种隐藏的节奏:正常的口语短语和传统的吟诵。他们专注于印地语和梵语这两种语言,以观察梵语这种古老的、基于音节的结构是否产生了与更具流动性的印地语不同的声学稳定性。研究人员从一百名志愿者那里记录了数百段语音,捕捉了随意的句子和有节奏的吟诵。他们的目标是建立一个能够高精度区分这两种言语类型的计算机系统,不仅是通过倾听词汇,而是通过分析声波本身的底层数学模式。他们想知道吟诵的节奏规律性是否可以被客观地测量,以及它是否创造了一种独特的声学特征,从而将其与普通的交谈区分开来。

为了开始调查,研究小组将录音分解为二十七种不同的可测量特征。其中包括音高的稳定性、音量的连贯性以及词与词之间停顿的时长。他们使用标准的统计工具将这些特征组合在一起,寻找可能自然地将吟诵与短语区分开来的模式。他们发现,虽然这些基本测量可以显示一些差异,但不足以可靠地区分这两种言语风格。数据过于杂乱,模式也过于微妙,简单的统计无法捕捉到全貌。研究人员意识到,声音不仅仅是孤立数字的集合;它是一个连续的流,此时的声音会影响下一刻的声音。为了理解这种流动,他们需要一种更先进的方法,能够将声音作为一个整体在时间维度上进行观察。

他们转向了一种被称为深度学习的人工智能,具体来说是一种结合了两种强大技术的混合系统。该系统的第一部分就像显微镜,通过缩放声波的视觉模式来观察声音纹理的精细细节。第二部分则像记忆,记住声音随时间变化的序列,以理解节奏和流动。通过将录音输入这个组合系统,研究人员让计算机学习吟诵与说话之间独特的“指纹”。结果令人震惊。该系统学会了以超过百分之九十五的准确率来区分两者。在某些测试中,它实现了完全正确的分类,完美地识别了哪些片段是吟诵,哪些是正常的短语。这种成功水平证明了吟诵的节奏结构创造了一个稳定、可预测的模式,这与日常言语的变动本质有着根本的不同。

分析还揭示了两种语言之间的有趣差异。梵语吟诵的录音显示出最一致且紧凑的模式,在数据中形成了紧密、有序的群体。这表明梵语基于音节的特性创造了一种高度规律的节奏,非常容易被计算机识别。印地语吟诵也非常规律,但比梵语略显多样。相比之下,两种语言的正常口语短语都更加分散且不可预测,表现出广泛的声学行为。研究人员观察到,吟诵在时间上保持着稳定、不变的节奏,而口语短语则波动显著,其音高和时机不断变化。这证实了吟诵的行为为声音施加了一种强大的、稳定的秩序,减少了普通交谈中存在的自然变异性。

最终,这项研究表明,言语的节奏不仅是我们听到的感觉,也是一种可以用现代技术捕捉和分析的可测量的物理现实。通过将传统的统计方法与先进的人工智能相结合,研究人员展示了吟诵产生了一种独特的、稳定的声学特征,在普通言语的背景下脱颖而出。研究结果表明,吟诵这种结构化、重复性的性质创造了一种在随意的交谈中难以实现的语音控制水平。这项工作为量化语言的节奏提供了一种新方法,为理解不同形式的发声如何影响人类声音提供了强大的工具。它为未来的研究打开了大门,去探索这些节奏模式如何影响认知状态,或者如何将它们用于监测语音健康,同时也证实了吟诵这一古老实践在声音科学中占据着独特且可衡量的地位。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →