← 最新论文
🤖 AI

Relative Time Intervals Representation for Word-level Timestamping with Masked Training

本文介绍了一种通过利用相对时间间隔、混合微调策略以及掩码训练目标,来增强语音大语言模型细粒度词级时间戳能力的创新方法,旨在提高时间对齐的准确性与鲁棒性。

原作者: Quanwei Tang, Zhiyu Tang, Xu Li, Dong Zhang, Shoushan, Guodong Zhou

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Quanwei Tang, Zhiyu Tang, Xu Li, Dong Zhang, Shoushan, Guodong Zhou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,一种被称为大语言模型的特定类型的计算机程序已变得能够极其出色地理解并生成人类语言。这些系统可以聆听音频,识别所说的单词,并以令人印象深刻的准确度将它们记录下来。然而,长期以来,这些机器一直缺乏一种关键的时间感。虽然它们可以告诉你说了什么,但往往难以告诉你每个单词在对话流中确切是在何时发生的。这种缺失的信息对于许多应用至关重要,从为视频制作准确的字幕到将音频与视觉场景同步。挑战在于,如何教机器在试图理解复杂声音并形成句子的同时,保持一个稳定的内部时钟,这项任务需要平衡两种截然不同的信息。

研究人员最近通过重新思考计算机表示时间的方式解决了这个问题。传统上,当系统试图标记一个单词被说出的时刻时,它使用一个绝对时间戳,类似于一个从零开始并持续累加的秒表。如果一个单词是在录音的最开始说的,系统将其标记为 0.00 秒;如果另一个单词稍后出现,它可能会被标记为 15.42 秒。虽然这看起来很直观,但它为计算机制造了一个显著的障碍。随着录音变长,数字变得越来越大、越来越多,迫使系统去记忆成千上万个独特的时间标记。这种方法还会导致一个常见的错误,即微小的计时误差会不断累积,导致时钟随着音频的进行而逐渐偏离轨道。

为了解决这个问题,一个研究小组提出了另一种思考时间的方式,这种方式依赖于间隔而非时钟上的固定点。他们不再要求计算机记住一个单词开始的确切秒数,而是训练它去测量单词之间的间隙。在这个新系统中,计算机只需要学习前一个单词与当前单词之间的停顿有多长。如果说话者在说下一个词之前停顿了半秒,系统只需记录那半秒的间隙。通过累加这些微小的间隙,计算机可以重建整个演讲的时间线,无论演讲持续多久。这种方法更加高效,因为计算机只需要学习有限的一组时间间隔,而不是无穷无尽的绝对时间列表。这就像是通过计算步数来学习走路,而不是试图记住经过的每一个地标的确切距离。

研究人员通过修改一个强大的语音模型来使用这些相对时间间隔,对这种方法进行了测试。他们设计了一个训练过程,在这个过程中,计算机不仅被允许看到正确答案,还偶尔会被迫根据语音的上下文和它已经生成的单词来猜测时机。这种被称为“掩码训练”的技术防止了计算机仅仅是死记硬背答案,而是教会它理解人类语言的自然节奏。该团队还使用了一种专门的训练策略,仅更新负责处理时间的计算机部分,而保持其核心语言理解能力不受影响。这确保了系统在获得计时新能力的同时,依然保持了强大的听力水平。

这项工作的成果是惊人的。在各种录音(包括长会议和多样化的语音样本)上进行测试时,新系统显著优于现有方法。在一个会议录音数据集上,该模型正确识别单词时机的精度超过了 91%,这是以往系统无法达到的水平。更重要的是,预测时间与实际时间之间的平均偏差减少到了仅 30 毫秒,这只是人类耳朵几乎察觉不到的一小部分时间。该系统在长录音中也表现得更加稳定,避免了困扰旧方法的计时误差。更令人印象深刻的是,该模型仍能保持极高的单词转录准确度,表明增加这种时间感并没有分散它理解语音这一主要任务的注意力。

这一进展代表了在让人工智能更加感知人类交流的时间结构方面迈出了意义深远的一步。通过从僵化的、绝对的时间观转向灵活的、相对的时间观,研究人员使这些系统能够更可靠地处理更长且更复杂的音频。研究结果表明,当我们设计机器来模仿人类感知时,专注于事件之间的关系而非它们的固定位置,可以创造出更稳健且更有效的工具。这项工作不仅仅是改进了一项技术指标;它让我们更接近于创造出能够像人类听众一样自然地跟随对话流的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →