Streaming Speech-to-Text Translation with a SpeechLLM
本文提出了一种基于语音大语言模型的实时流式语音转文本翻译系统,该系统根据音频输入动态决定何时输出令牌,在将延迟显著降低至 1–2 秒的同时实现了接近基线的翻译质量。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在实时将一场英语对话翻译成韩语。你希望听到一个句子,理解它,并立即说出译文,而无需等待说话者讲完整个故事。
本文介绍了一种全新的“超级翻译”系统,它正是如此运作,但通过一个巧妙的转折,解决了当前技术中最大的问题:时机。
问题所在:“等待-K"机器人
大多数现有系统就像一个带有定时器的僵硬机器人。它们使用一种名为“等待-K"的规则。
- 规则:“我将聆听恰好 5 秒的音频,然后说出 5 秒的译文。接着再聆听 5 秒,再说出 5 秒的译文。”
- 缺陷:现实生活并非机器人。
- 如果说话者停顿思考 10 秒,机器人仍会在 5 秒后开口,因为它认为到了该说话的时候,从而编造胡话(产生幻觉)。
- 如果说话者语速极快,机器人会跟不上,完全漏掉某些词语。
- 如果说话者语速缓慢,机器人会浪费精力去等待一个与对话节奏不匹配的定时器。
解决方案:“智能等待”翻译器
作者构建了一个名为SpeechLLM(语音大语言模型)的新系统,它不使用定时器,而是采用一种学习得到的“等待”策略。
将这一新系统想象成一位非常专注的人类口译员,在聆听的同时做笔记。
- 聆听与决策:随着音频传入,系统并非仅仅计算秒数,而是自问:“我现在是否有足够的信息来说出下一个词?"
- “等待”标记:如果答案是“否”,系统会输出一个特殊的不可见标记,称为**“等待”**。这就像口译员举起手说:“稍等,我需要听更多。”
- “说话”标记:如果答案是“是”,它立即输出翻译后的词语。
这一过程以混合形式发生:等待、等待、说话、等待、说话、说话、等待…… 系统根据实际语音而非时钟,精确学习何时在“等待”和“说话”之间切换。
“提前退出”技巧:节省电量
这里有一个难点。由于系统必须如此频繁地检查“我是否应该等待?”,它在手机等设备上消耗了大量电量(就像即使你不看手机,也每秒检查一次一样)。
为了解决这个问题,他们添加了一个**“提前退出”**功能。
- 想象一位保安站在一间豪华办公室(主 AI)门外。
- 这位保安反应迅速且简单。当新音频传入时,保安会检查:“这是否足以让老板(AI)进来?"
- 如果保安说“不”,老板就无需醒来。系统只需等待更多音频。
- 如果保安说“是”,然后老板才会醒来,进行繁重的思考并开口说话。
- 结果:系统节省了巨大的能量,因为“老板”不必每次都工作,只有在保安认为必要时才工作。
如何训练它(“短语”拼图)
为了教会这个系统何时等待,他们不能仅仅进行逐词匹配(例如"The" = "The")。在英语和韩语等语言中,词语的顺序完全不同。你可能会在英语句子的末尾听到“联合国”,但在韩语中,你需要在句首说出它。
作者创造了一种新方法,使用短语而非单个单词来训练 AI。
- 他们利用一种智能工具,匹配两种语言之间的意义块(短语)。
- 这教会了 AI:“在我听到完整的英语短语‘联合国’之前,我无法说出韩语中对应的‘联合国’一词。"
- 这使得 AI 能够学习何时等待、何时说话的完美节奏。
结果:快速、准确且稳健
该论文将这一系统与旧的“等待-K"机器人进行了测试对比。
- 速度:新系统速度极快,延迟仅为1 到 2 秒。
- 质量:它的翻译质量与那些等待整个句子结束后才开口的系统一样好。
- 现实世界测试:他们在音频中加入了静音和噪音(如带有杂音的电话通话)进行测试。旧的“等待-K"机器人惨败,胡言乱语。而新的“智能等待”系统则忽略了静音,耐心等待,产出了完美的译文。
总结
本文提出了一种像人类一样运作的翻译器:它聆听,判断何时拥有足够信息,然后开口。它不依赖僵硬的定时器。它还拥有一个“智能助手”(提前退出策略),通过仅在绝对必要时才进行繁重工作来节省电量。其结果是一个快速、准确且不会因停顿或噪音而困惑的系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。