← 最新论文
⚡ electrical engineering

Multilingual Long-Form Speech Instruction Following: KIT's Submission to IWSLT 2026

KIT 向 IWSLT 2026 指令遵循赛道提交了一项多语言长文本语音指令系统,该系统利用数据增强流水线生成了超过 100 万个训练实例,并采用结合了基于似然的重排序与最小贝叶斯风险的混合解码策略,以克服长文本推理中的语义退化问题。

原作者: Enes Yavuz Ugan, Maike Züfle, Yuka Ko, Supriti Sinhamahapatra, Fabian Retkowski, Seymanur Akti, Jan Niehues, Alexander Waibel

发布于 2026-06-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Enes Yavuz Ugan, Maike Züfle, Yuka Ko, Supriti Sinhamahapatra, Fabian Retkowski, Seymanur Akti, Jan Niehues, Alexander Waibel

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心理念:教 AI 倾听长篇故事

想象一下,你有一个聪明的助手,它非常擅长理解短句,比如“天气怎么样?”或“翻译这个词”。但如果你让它听一段 15 分钟的讲座或一段长篇播客,它就会变得困惑,忘记开头的内容,或者开始胡言乱语(产生幻觉)。

来自卡尔斯鲁厄理工学院(KIT)的研究人员想要解决这个问题。他们参加了一场名为 IWSWT 2026 的比赛,目标是构建一个能够根据长篇语音(长达 15 分钟)执行指令的 AI,涵盖四种语言:英语、德语、意大利语和中文。他们还必须处理一个事先不知道的“惊喜任务”。

以下是他们实现这一目标的四个主要部分,分为四个维度进行拆解。


1. 数据问题:将短片段转化为马拉松

挑战: 大多数 AI 训练数据就像是一堆只有 15 秒长的语音笔记。但比赛要求 AI 处理 15 分钟长的音频文件。这就像试图用 100 米短跑来训练一名马拉松选手。

解决方案: 他们建立了一个“数据工厂”,将短片段拉伸成长篇故事。

  • 粘合法(The Glue Method): 他们将成千上万个短音频片段首尾相接地粘在一起,从而创建出长片段。
  • 翻译器: 由于大部分数据只有英文,他们使用了一个超级聪明的 AI 翻译器来生成德语、意大利语和中文的版本。
  • 标签生成器: 他们利用 AI 为这些新的长片段编写指令和答案,实际上创造了超过 100 万个新的训练样本

结果: 他们将一个短语音笔记库变成了一个庞大的长篇讲座和对话库,为训练做好了准备。


2. 训练策略:平衡饮食

挑战: AI 需要学习六个不同的任务:

  1. ASR(自动语音识别): 将语音转录为文本。
  2. ST(语音翻译): 将语音翻译成另一种语言的文本。
  3. SQA(语音问答): 回答关于所听内容的问题。
  4. SSUM(语音摘要): 对音频进行总结。
  5. ACHAP(章节划分): 将音频分解为带有标题的章节。
  6. Surprise(惊喜任务): 执行未知的任务。

其中一些任务的数据量远多于其他任务(就像一份以西兰花为主、缺乏胡萝卜的饮食)。如果只是随机喂给 AI 数据,它会对常见任务表现出色,却会忘记那些罕见的任务。

解决方案: 他们尝试了两种混合数据的方法:

  • 固定计划: 手动决定喂给 AI 10% 的 ASR、30% 的问答等。
  • 温度缩放(“平方根”技巧): 他们使用了一个数学公式(温度 = 2),能够自然地平衡饮食。这就像一位聪明的厨师,会给你提供一点每种食材,但不会让最常见的食材淹没了稀有的食材。

发现: “平方根”方法效果最好。它帮助 AI 平等且出色地学习所有任务,而不会感到困惑。


3. “秘密代码”的失败(思维链)

挑战: 团队尝试了一种流行的技巧,叫做“思维链”(Chain-of-Thought)。这就像是告诉 AI:“在回答之前,先思考一下这是什么任务。”他们给了 AI 特殊的“标记”(tokens,类似于秘密代码)来表达:“这是一个翻译任务”或“这是一个摘要任务”。

失败原因: 这适得其反。AI 变懒了。因为“摘要”任务比“转录”任务稍微常见一点,且看起来很相似,AI 开始对几乎所有内容都猜测为“摘要”,即使它本该是在做翻译。它不再听从指令,而是选择了阻力最小的路径。

教训: 如果任务过于相似,你不能仅仅通过一个简单的标签来告诉 AI“该做什么”;它需要通过实践来真正学习其中的区别,而不仅仅是通过一个前缀。


4. 最后的润色:“重排序”过滤器

挑战: 当 AI 生成答案时,它通常会生成 17 个不同的版本。有些很完美,有些则是胡言乱语。团队需要一种方法来挑选出最好的一个,而且是在不知道当前正在执行什么任务的情况下(因为“惊喜任务”是未知的)。

标准方法的失败:

  • 似然度(Likelihood,即“信心”检查): AI 会挑选它最有信心的那个答案。这在转录(ASR)任务中表现极佳,但在摘要(Summarization)任务中表现糟糕。它总是挑选那些被切得很碎、断断续续的答案,尽管从数学上看概率很高,但意思却丢失了。
  • MBR(“共识”检查): 这种方法会挑选与所有其他答案最相似的那个答案。这种方法很稳妥,对语义有好处,但它忽略了最佳的转录候选结果。

获胜策略(似然度 + MBR):
他们将两者结合了起来。把这想象成一个招聘委员会:

  • 似然度 是那位“自信的候选人”,说话又快又清晰。
  • MBR 是那位“稳健的候选人”,表现很一致。
  • 组合拳: 他们让“自信的候选人”获胜,除非“稳健的候选人”强烈反对。这阻止了 AI 在摘要任务中选择破碎、断续的答案,同时保留了最佳的转录结果。

最终结果

团队提交了两个系统:

  1. 主系统(端到端/End-to-End): AI 直接听取音频并给出答案。它非常擅长理解“意义”(回答问题、做摘要)。
  2. 对比系统(级联式/Cascaded): AI 先写下所说的确切内容(转录),然后再阅读该文本来回答问题。这在准确获取文字(转录)和翻译方面表现惊人,但在深度理解方面稍逊一筹。

惊喜: 当“惊喜任务”(质量评估)出现时,那个先写下文本的系统(级联式)碾压了竞争对手,而直接的端到端系统则完全失败了。这表明,有时将复杂问题分解为步骤(听 -> 写 -> 想)比试图一次性完成所有事情效果更好。

总结

这篇论文表明,要让 AI 听懂长篇演讲,你需要:

  1. 拉伸短数据以获得长数据。
  2. 使用“平方根”数学技巧来平衡训练饮食。
  3. 避免使用简单的“任务标签”,以免让 AI 变懒。
  4. 结合信心与一致性来挑选最佳答案。

他们成功构建了一个能够处理长篇多语言音频的系统,证明了只要拥有正确的数据和聪明的答案“投票”系统,AI 终于可以听完整个故事,而不只是听见第一句话。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →