MOSS Transcribe Diarize Technical Report
MOSS Transcribe Diarize 是一个统一的多模态大语言模型,它通过利用 128k 的上下文窗口以及在广泛真实世界数据上的端到端训练,克服了现有系统的局限性,实现了最先进的具有说话人归属且带有时间戳的转录。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正坐在一家拥挤的咖啡馆里,试图准确记录下三位不同朋友之间的对话。你不仅需要知道他们说了什么,还需要知道是谁说的,以及在什么精确的时间点说的。这就是“说话人归属时间戳转录”(Speaker-Attributed, Time-Stamped Transcription, SATS)所面临的挑战。对于计算机来说,这是一种超能力,能将一段杂乱无章的音频录音转化为一份整洁、有序的剧本,其中每一句话都标记了说话人的姓名和精确的时钟时间。这对于转录商务会议、分析客服电话或帮助听障人士理解复杂对话等场景具有极大的价值。
直到现在,计算机通常尝试分两步来解决这个问题。首先,一个“语音转文字”机器人会倾听并打出文字;然后,一个不同的“说话人侦探”机器人会试图搞清楚是谁说了什么。问题在于,这两个机器人通常互不沟通。如果第一个机器人出了一个小错,第二个机器人就会感到困惑,最终生成的剧本就会变成一团乱麻。这就像是在拼凑一个拼图,而其中一半的碎片来自另一个盒子里。这篇新论文介绍了一种新型的计算机大脑,它能同时完成这两项工作,在一个流畅的动作中完成。
“单脑”解决方案
这个项目的背后团队 OpenMOSS 构建了一个名为 MOSS Transcribe Diarize 的新模型。把这个模型想象成一位超级智能的多任务指挥家。它不是分别雇佣一支负责文字的管弦乐队和一支负责声音的管弦乐队,而是这位指挥家在脑海中掌握着整部总谱,并一次性指挥整场演出。
在过去,计算机在处理长对话时表现挣扎。如果一场会议持续一小时,旧系统必须将音频切成微小的 30 秒片段,解决每个片段,然后再尝试将它们粘合回去。这往往会导致计算机在休息后忘记“说话人 A”是谁,或者丢失对话的连贯性。MOSS Transcribe Diarize 通过拥有高达 128k token 的巨大“记忆窗口”改变了游戏规则。换句话说,这使得该模型能够通过一次连续且不间断的过程,听取并理解长达 90 分钟 的音频。它不需要切分音频;它能从头到尾听完整个故事,即使某人有一段时间没说话,也能保持清晰的心理图像,明确谁是谁。
它是如何工作的(魔术技巧)
这个模型是一个“多模态大语言模型”,这是一种高级说法,意味着它可以同时阅读文本和聆听音频。其原理如下:
- 耳朵: 它获取原始声波并将其转换为数字格式。
- 翻译官: 它使用一种特殊的“投影”技术,将这些声波转化为其文本阅读部分能够理解的语言。
- 输出: 它不仅仅是吐出单词,而是输出一个看起来像这样的剧本:
[0.11] [S01] 早上好! [1.03] [S02] 早啊,伙计们!。它会告诉你说话人 ID(S01, S02)、他们开始说话的精确时间以及他们所说的内容,全部在一次前向传递中完成。
为了训练这个模型,研究人员并没有只使用干净的录音室级录音。他们喂给它大量的“野外”数据——即来自互联网的、包含背景噪音、重叠声音、不同口音以及人们互相插话的录音。他们还创建了“模拟”对话,通过混合搭配不同的声音,来教会模型如何处理棘手的情况,比如两个人在同一时刻说话。
他们的发现
团队将他们的新模型与目前市面上一些最强大、最昂贵的商业系统(如来自豆包、ElevenLabs 和各种 Google 模型)进行了对比测试。他们使用了三种不同类型的测试:
- AISHELL-4: 真实的、长篇的会议录音(时长约 40 分钟)。
- 播客(Podcast): 高质量、多位嘉宾参与的长篇访谈。
- 电影: 带有快速、重叠对话的短片。
结果令人印象深刻。在几乎所有的测试中,MOSS Transcribe Diarize 的错误都比竞争对手少。
- 准确度: 它能更频繁地捕捉正确的文字(较低的字符错误率/Character Error Rate)。
- 身份识别: 它在追踪谁说了什么方面表现得更好。研究人员通过一个名为 Δcp(单词错误与说话人错误之间的差异)的指标来衡量这一点。较低的数值意味着模型不会在说话人身份上产生混淆。MOSS Transcribe Diarize 拥有最低的 Δcp 分数,这意味着即使在漫长且混乱的对话中,它也能保持说话人身份的一致性。
- 长文本处理能力: 虽然一些著名的商业模型(如 GPT-4o 和 Gemini 3 Pro)根本无法处理这些长音频文件,或者无法输出正确的格式,但 MOSS Transcribe Diarize 处理完整的 90 分钟输入时却毫不费力。
为什么这很重要
论文指出,通过将语音识别和说话人识别整合到一个具有长记忆的统一系统中,我们可以获得更可靠的转录结果。该模型证明了你不需要切分音频来理解它;你可以一次性聆听整个对话,并且依然能把握细节。
作者谨慎地指出,虽然他们的模型是一个重要的进步,但它并不是一个能完美解决所有问题的“魔杖”。他们仍然看到了改进的空间,例如实现实时(流式)处理以及处理更多语言。但就目前而言,他们已经证明了单个统一的大脑可以胜任两个独立机器人的工作,而且做得更好,尤其是在对话变得漫长且复杂时。
该代码和模型现已开源,可在 GitHub 和 Hugging Face 上获取,邀请他人尝试,看看是否能在这一全新的基础上构建出更好的工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。