FormalASR: End-to-End Spoken Chinese to Formal Text
本文介绍了 FormalASR,这是一对在 newly constructed 大规模数据集上训练的紧凑端到端模型(06B 和 1.7B),可直接将口语中文转录为正式书面文本,显著降低错误率并消除需要延迟的后期处理大语言模型的需求。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在为朋友录制一条语音备忘录。你说话自然,充满了“嗯”、“啊”等填充词,重复的词语,以及那些中途停顿或重新开始的句子。如果你将这段录音输入标准的语音转文字应用,它会生成一份逐字稿:对你口语化絮叨的杂乱无章、一字不差的复制。它准确反映了你说了什么,但如果你想把这段文字粘贴到正式邮件或专业报告中,它的实用性就大打折扣了。
目前,为了修正这种混乱,人们采用“两步走”流程:首先,计算机逐字记录你所说的内容;其次,一个庞大且昂贵的 AI(如同一位超级聪明的编辑)阅读这段杂乱的文字,并将其重写为干净、专业的语言。这一过程缓慢,需要大量计算资源,并且通常需要连接到大型云服务器才能完成。
FormalASR 是一项新发明,它完全跳过了第二步。它是一个单一、紧凑的 AI 模型,能够聆听你杂乱的语音,并即时输出干净、正式的文字,仿佛已经由专业编辑润色过一般。
以下是该论文对这一解决方案的拆解:
1. 问题所在:“杂乱房间”与“整洁办公室”
将口语比作一个杂乱的卧室。地板上有散落的衣服(填充词),有未完成的工程(口误或重述),还有四处散落的物品(非正式语法)。
- 标准 ASR 就像一台相机,拍下杂乱房间的照片。它原封不动地捕捉一切。
- 旧方案 是拍下这张照片,将其发送给一位专业的室内设计师(大型 AI 模型),请他们在数字层面清理房间。这需要时间和金钱。
- FormalASR 则是一种新型相机,它不仅能拍照,还内置了清洁团队。它审视杂乱的音频,直接输出一张整洁有序办公室的照片。
2. 训练:教导 AI“清理”
为了教会这台新相机如何清理,研究人员构建了两个庞大的“清理前”与“清理后”示例库:
- 来源:他们收集了数千小时的真实杂乱语音录音(来自有声书、会议和播客)。
- 转换:他们利用强大的 AI(DeepSeek-V3.2)将这些杂乱的逐字稿重写为完美、正式的中文文本。
- 筛选:他们检查了这些工作,确保“干净”版本与“杂乱”版本含义一致,并剔除了任何不合格的示例。
由此生成了两个新数据集(WenetSpeech-Formal 和 Speechio-Formal),它们如同 AI 的训练手册,精确展示如何将口语絮叨转化为书面散文。
3. 结果:紧凑的一体化工具
研究人员利用新的训练数据,对两个现有的 AI 模型(参数量分别为 6 亿和 17 亿)进行了“微调”。
- 性能:测试表明,这些新模型(FormalASR)在生成正式文本方面远优于标准模型。与旧的“逐字”风格相比,它们将错误率降低了高达37%。同时,它们在保留原意方面的得分也更高。
- 速度:由于 AI 在聆听的同时就移除了填充词和重复内容,最终生成的文本更短。这意味着计算机生成答案所需的工作量更少,因此速度更快。
- 体积:最棒的是,该模型足够小巧,可以在手机或笔记本电脑上运行(端侧运行),而无需依赖庞大的云服务器。
4. “微型”版本(量化)
论文还测试了进一步缩小模型体积的方法(如同将高清照片压缩为更小的文件),以便使其能适配更小的设备。
- 他们发现,即使将模型压缩至 4 位精度(使其体积小于 1GB),它依然表现卓越。
- 这就像将一把高级厨师刀打磨成口袋刀的大小;它依然锋利得足以完美完成切割任务,只是体积更小、更便于携带。
总结
FormalASR 是一项突破,因为它将“聆听”和“编辑”的工作合并为一个小巧、快速的整体。你不再需要先录音、获得杂乱逐字稿,再聘请数字编辑来修正;你只需开口说话,设备便会即时为你生成一份润色完善、专业得体的文档。它支持离线运行,速度快,且准确度令人惊讶。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。