← 最新论文
💬 NLP

Mind the Pause: Disfluency-Aware Objective Tuning for Multilingual Speech Correction with LLMs

本文提出了一种多语言语音修正流程,该流程将词级不流利检测与指令微调及对比学习目标相结合,以有效去除自动语音识别转录文本中的填充词和重复内容,同时保持语法结构和语义连贯性,并在印地语、孟加拉语和马拉地语中展现出优于现有基线的性能。

原作者: Deepak Kumar, Baban Gain, Asif Ekbal

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Deepak Kumar, Baban Gain, Asif Ekbal

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和日常类比对论文《Mind the Pause》的解释。

问题:会“结巴”的机器人

想象一下,你正在和一个机器人助手对话。你说:“嗯,我觉得,呃,会议是在,就像,下午三点。”

机器人的听觉系统(称为 ASR)会原封不动地记录下它听到的内容:“嗯,我觉得,呃,会议是在,就像,下午三点。”

虽然这准确还原了声音,但对机器人的大脑(大型语言模型或 LLM)来说,要理解这些内容却是一团糟。这就像试图阅读一本书,而作者不停地停下来清嗓子、重复词语,或者重新开始句子。这种“噪音”会让机器人感到困惑,导致它给出糟糕的答案、翻译质量差,或者在回复你时听起来不自然。

大多数旧方法试图通过像剪刀一样行事来解决这个问题:它们会找到“嗯”和“呃”,然后直接剪掉。但往往,这会让句子看起来支离破碎,就像缺少了一块拼图。

解决方案:一个两步走的“编辑”团队

作者提出了一种新的、更聪明的团队来修复这些转录文本。把它想象成一个两人编辑小组,正在处理一份杂乱的草稿。

第一步:荧光笔(检测器)

首先,他们使用一种专用工具(称为 MuRIL),它就像一支荧光笔。它会扫描杂乱的句子,并高亮标出哪些词是“垃圾”(填充词、重复词),哪些是“黄金”(真正的含义)。

  • 类比: 想象一位老师正在批改学生的作文。老师不是直接擦掉错误,而是用红笔圈出它们,让学生确切知道需要修正什么。

第二步:重写艺术家(LLM)

接下来,他们将这份带有高亮标记的草稿交给一个强大的 AI 作家(LLM)。AI 会收到这样的指令:“这是杂乱的句子,这里是红圈标记。请将这句话重写为完美、流畅的句子,但保留原意。”

秘密武器:“反重复”规则

这是该论文最大的创新点。通常,当你教 AI 进行重写时,它是通过查看“好”答案并尝试模仿来学习的。但有时,AI 会变得懒惰,意外地仍然复制了那些坏词(“嗯”和“呃”)。

为了阻止这种情况,作者添加了一条特殊规则,称为对比学习

  • 类比: 想象你在教一个孩子烤蛋糕。
    • 标准训练: 你给他们看一个完美的蛋糕,说:“做一个像这样的。”
    • 论文的方法: 你给他们看完美的蛋糕, 你也在他们上次烤焦的饼干上画了一个大大的红"X"。你说:“做一个像这样的蛋糕,但不要把烤焦的饼干放进去。”

这个“反重复”规则会主动惩罚 AI,如果它试图把“嗯”或“呃”放回句子中。它迫使 AI 格外小心,确保将垃圾留在外面。

他们测试了什么

该团队在三种印度语言上测试了这种方法:印地语、孟加拉语和马拉地语。这些语言很棘手,因为它们语法复杂,而且人们结巴或重新开始句子的方式多种多样。

他们将新方法与以下方法进行了比较:

  1. 旧剪刀: 直接剪掉单词。
  2. 智能猜测者: 在没有帮助的情况下尝试猜测修复方案的 AI 模型。
  3. 大型知名模型: 如 GPT-4 和 Gemini,它们非常昂贵且强大。

结果

论文发现,他们的“带有反重复规则的两步团队”是赢家。

  • 优于剪刀: 它在修复句子的同时没有破坏语法。
  • 优于猜测者: 它更好地理解上下文。
  • 击败巨头: 令人惊讶的是,他们的小型专用模型表现得与 GPT-4 等庞大、昂贵的模型一样好,有时甚至更好,特别是在处理现实世界中杂乱的音频录音时。

为什么这很重要

作者表明,如果不清理语音中的“结巴”,机器人的大脑就会感到困惑。

  • 问答: 机器人会给出更愚蠢的答案。
  • 翻译: 翻译质量会变差。
  • 回复说话: 当机器人回复时,听起来会像机器人一样生硬和尴尬。

通过使用这种新方法,机器人可以将杂乱、结巴的人类语音转化为干净、流畅的句子,然后完美地理解它。

一句话总结

这篇论文介绍了一种清理语音转录的智能方法。它不是简单地删除错误,而是使用“荧光笔”来发现它们,并用“重写艺术家”来修复它们,同时有一条特殊规则,确保艺术家永远不会意外地把错误放回去。这使得语音助手和聊天机器人工作得更好,特别是对于印地语、孟加拉语和马拉地语等语言。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →