FBK's Long-form SpeechLLMs for IWSLT 2026 Instruction Following
本文介绍了 FBK 为 IWSLT 2026 指令遵循共享任务所提出的 SpeechLLMs,证明了固定的 30 秒分段在保持强大的短篇处理能力的同时,能实现最稳健的长篇性能(HIFS 分数为 2.0663),尽管面临着重复性幻觉的挑战。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个才华横溢、精通多种语言的机器人助手,它非常擅长听取短句并执行指令,比如“翻译这句话”或“法国的首都是哪里?”这就是这个机器人的“短篇版”。
FBK 的研究人员想看看他们是否能将这个机器人升级,使其能够处理长篇、复杂的叙述(比如一段 30 分钟的讲座或一档完整的播客),而不会让它感到困惑、遗忘内容或开始胡编乱造。这篇论文是他们针对 IWSL 2026 竞赛所做的成绩单。
以下是他们旅程的简要说明:
1. 机器人的大脑(架构)
把这个机器人想象成由三个主要部分组成:
- 耳朵(语音编码器): 它们倾听原始声波,并将其转化为大脑能理解的语言。他们使用了一个名为 SEAMLESSM4T 的预训练“超级耳朵”。
- 翻译官(模态适配器): 这是一个桥梁。它接收声音数据并对其进行压缩,使其能够整齐地放入机器人的思考空间中。这就像是将一本长篇小说进行章节摘要,以便大脑能更快地阅读。
- 大脑(LLM 解码器): 这是思考部分,基于一个名为 Qwen3 的模型。它已经非常擅长遵循文本指令了。研究人员只是教会了它如何通过听音频而不是仅仅阅读文本来工作。
2. 短跑赛道:“冲刺”
首先,他们在短任务(如 5 秒钟的片段)上测试了机器人。
- 结果: 机器人在冲刺中表现完美。它在翻译、转录和回答问题方面获得了高分(2.07)。它证明了该机器人在短对话中已经是冠军。
3. 长跑赛道:“马拉松”
这是非常棘手的地方。你不能直接告诉机器人“听这段 30 分钟的音频”,因为它会一次性处理所有内容。它的记忆(上下文窗口)会被淹没,并且可能会开始产生幻觉(胡编乱造)。
为了解决这个问题,他们尝试了三种不同的方法来将音频切成易于处理的小块,就像切长条面包一样:
策略 A:固定切片器(30 秒切片)。
想象一台机器,无论音频中正在发生什么,都会将其切成完美的、相等的 30 秒片段。- 结果: 这是获胜者。它最稳定。机器人不会感到困惑,也不会编造出那么多虚假词汇。
策略 B:智能切片器(语音检测)。
这使用了一个工具,试图寻找语音中的自然停顿(例如说话者停止说话时)来进行切割。- 结果: 表现尚可,但有时它会在奇怪的地方切割音频,或者使片段变得太短,导致机器人失去故事的连贯性。
策略 C:混合切片器。
这试图结合两者:它寻找停顿,但如果一个片段过长,也会强制进行切割。- 结果: 它比智能切片器更好,但仍然无法击败简单的、稳定的固定切片器。
4. “幻觉”问题
当机器人尝试听长音频时,它有一个坏习惯:重复插入。
- 类比: 想象一名学生正在进行长篇听写测试。当他们感到疲倦或困惑时,他们会开始一遍又一遍地重复刚刚写的最后一句话,或者发明一个原本并未被说出的完整段落。
- 影响: 这使得机器人的转录(写下所说内容)看起来非常糟糕,因为它充满了重复的废话。研究人员发现,这种“幻觉”是导致机器人处理长音频困难的主要原因。
5. 最终成绩单
他们创建了一个新的评分系统,称为 HIFS(幻觉惩罚得分)。这个分数不仅看机器人理解得有多好,还会扣除分数,如果机器人开始胡编乱造。
- 获胜者: 使用固定 30 秒切片策略的机器人在长跑赛道中以最高分(2.06)胜出。
- 核心结论: 尽管机器人的训练主要基于短片段,但只要你将音频切成稳定、可预测的块,它仍然可以很好地处理长音频。它并没有失去处理短任务的能力,但它确实需要帮助来管理输入长度,以防止它开始胡编乱造。
总结
这篇论文表明,你可以将一个短篇聆听机器人变成一个长篇聆听机器人,但你必须小心喂给它音频的方式。**简单的、稳定的切片(每次 30 秒)**比尝试用自然停顿进行聪明切割的效果更好。最大的敌人不是音频的长度,而是机器人在不堪重负时开始重复自己或发明词汇的倾向。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。