← 最新论文
💬 NLP

A Pocket Offline Model for Simultaneous Speech Translation as CUNI Submission to IWSLT 2026

本文介绍了 CUNI 向 IWSLT 2026 同步语音翻译共享任务提交的方案,该方案通过采用 AlignAtt 策略对 1B 参数的离线 Canary 模型进行适配,以实现捷克语、英语、德语和意大利语之间高质量且低计算需求的同步多语言翻译。

原作者: Aziz Sharipov Ortega, Dominik Macháček

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Aziz Sharipov Ortega, Dominik Macháček

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明、精通多种语言的翻译员,名叫 Canary。这位翻译员才华横溢,能够听完一整段演讲,然后完美地写下翻译内容。然而,这里有一个限制:Canary 习惯于等到说话者说完整个句子后才开始工作。这就像一个服务员,即使你只想点一杯咖啡,他也拒绝在你读完整份菜单之前接受你的订单。

查理大学(CUNI)的团队想要教会 Canary 如何成为一名同步翻译员——也就是像人类口译员那样,能够边听边译,逐词进行。

以下是他们是如何实现的,通过一些简单的类比:

1. “走走停停”策略 (AlignAtt)

为了让 Canary 实现实时工作,团队并没有从头开始重新训练整个翻译器。相反,他们给了 Canary 一套新的规则,叫做 AlignAtt

把 Canary 的大脑想象成戴着一副“注意力眼镜”。当翻译器听到一段新的音频块时,它会观察正在构建的句子。AlignAtt 规则说:“一旦你听到一个声音与你刚刚听到的音频中的特定点相匹配,就停止书写句子的剩余部分。”

这就像是一场“传声筒”游戏,你只传递那些你 100% 确定的词汇。如果翻译器试图根据尚未完全到达的音频来猜测一个词,系统就会切断这个猜测。这防止了翻译器产生“幻觉”(凭空捏造)或重复自身内容。

2. “口袋大小”的动力源

这个项目最酷的地方之一在于这个翻译器的尺寸。大多数高质量的翻译器都像是需要整个数据中心才能运行的庞大超级计算机。然而,Canary 是一个 10 亿参数的模型

作者称之为 “口袋离线模型” (Pocket Offline Model)。想象一下,把一个翻译器的大小缩减到像智能手机应用一样,装进你的口袋里。它足够小,可以在普通的手机上运行,而不需要将数据发送到云端的巨型服务器。这意味着即使在没有互联网连接的情况下,你也可以使用它,而且由于不需要等待信号往返传输,它的速度也会更快。

3. “降噪”耳机

现实世界的音频是很杂乱的。人们会咳嗽,汽车会鸣笛,房间会有回声。为了处理这些问题,团队添加了一个“噪声过滤器”(称为 Silero VAD)。把这想象成为翻译器配备了一副高科技降噪耳机。它会忽略沉默和背景噪音,只在人类真正说话时才保持关注。这能防止翻译器被搞糊涂,或者试图去翻译关门声。

4. 与时间的赛跑 (结果)

团队针对三种语言对(捷克语到英语、英语到德语、英语到意大利语)测试了他们的新系统,与其他的顶尖翻译器(基准模型)进行了一场模拟比赛。

  • 设置: 他们测试了两种场景:一种是“高延迟”比赛(翻译器可以多等一会儿以换取更高的准确度),另一种是“低延迟”比赛(速度就是一切)。
  • 结果:
    • 速度 vs. 质量: 他们的系统在这两个类别中都是冠军。在“高延迟”比赛中,它的表现显著优于组织者现有的最佳系统(提高了 4 到 8 分)。
    • 击败竞争对手: 即使在“低延迟”比赛中(即必须追求极速时),它也表现出色,通常能击败之前的最佳系统。
    • 滑动窗口: 他们还将自己的方法与另一种让离线模型实现实时的技术(称为“滑动窗口”,类似于不断重读一段话来修正错误)进行了对比。他们的“走走停停”(AlignAtt)方法效果更好,能产生更高质量的翻译且延迟更低。

5. 他们学到了什么(以及没学到什么)

团队得出结论,将一个强大的离线翻译器并赋予其“实时规则手册”是一种获胜策略。这种方法简单、有效,且不需要昂贵的训练。

然而,他们确实遇到了一个小障碍。他们尝试给翻译器提供“上下文线索”(例如告诉它:“这是一场政治会议,所以请使用正式用语”),但当他们尝试将这些线索与新的“走走停停”规则结合时,翻译器变得混乱并停止了工作。他们怀疑这是因为翻译器在针对这种特定组合的训练样本不够多。

核心总结

CUNI 团队成功地将一个“等待结束再翻译”的翻译器转变为一个“边听边译”且能装进口袋里的翻译器。他们证明了,你不需要一台巨大的超级计算机来获得高质量的同步翻译;一个拥有正确规则的小巧、聪明的模型,同样可以做得一样好,甚至比大型系统做得更好。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →