Domain-Adaptive ASR for Telephony AI Agents: Fine-tuning Canary Flash Models for Enterprise Contact Center Applications
本技术报告表明,通过在电信特定数据集上对 NVIDIA 的开源 Canary Flash 模型进行微调,可以显著降低噪声音频和业务关键术语的字符错误率,同时保持企业级语音机器人部署的实时推理速度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下正在通过电话线进行的对话。通过那根导线传输的声音与我们在安静房间里听到的清晰、高保真语音并不相同。它更窄,通常经过压缩,并且经常被繁忙街道的杂音或廉价手持设备的嗡嗡声所干扰。几十年来,计算机一直难以理解这种特定类型的音频。虽然人工智能在转录播客或会议中的清晰语音方面已经变得非常出色,但面对客户服务电话这种混乱的现实时,它往往会出错。这种差距是企业想要使用语音助手来处理数百万个电话的主要障碍,尤其是在那些技术尚未针对当地语言或当地电话网络特有噪声进行训练的地区。
泰国 Botnoi Group 的研究人员致力于解决这一问题,他们试图教一个强大的开源计算机模型像人类在电话通话中那样去倾听。他们专注于泰语,这是一个电话语音公共数据稀缺的地区。他们的工作表明,通过仔细喂给模型真实的通话录音和特定业务词汇,可以将一个通用的语音识别器转化为一个能在嘈ola的呼叫中心可靠工作的专家。其结果是一个不仅能理解语言,还能忽略杂音的系统,使得 AI 代理能够处理复杂的任务,例如阅读姓名和地址,而无需不断的真人干预。
他们工作的核心在于提取一个名为 Canary 的大型现有人工智能模型(该模型已经擅长理解多种语言),并给予它专门的教育。研究人员意识到,仅仅使用原有的模型并不能满足他们的需求。该模型主要是在清洁、高质量的音频上进行训练的,这使得它对电话连接带来的失真缺乏准备。为了解决这个问题,他们构建了一个独特的训练流水线。他们收集了两类数据:来自他们自己的实时语音机器人系统的录音,这些录音捕捉到了真实电话通话中的真实混乱;以及人们在即时通讯应用中对着提示进行语音输入的录音。为了让应用中的录音听起来像电话通话,他们应用了数字滤波器,模拟了电话线路的压缩和噪声。这个过程创建了一个包含 7 7 小时电话级音频的海量库,其中包含一个专门用于处理极其困难的姓名和地址识别任务的 104 小时特定子集。
利用这个定制数据集,团队对 Canary 模型进行了微调。微调是一个计算机从新示例中学习以调整其内部规则的过程,就像学生通过学习特定的教科书来为特定的考试做准备一样。研究人员测试了模型在三种不同场景下识别泰语语音的能力。首先,他们检查了它是否能理解通用语言。其次,他们在嘈杂的电话音频上进行了测试。最后,他们在姓名和地址等特定业务术语上进行了测试。结果显示了显著的进步。在这次训练之前,该模型在处理电话音频时的错误率约为 23%。在学习了电话数据后,该错误率降至仅 9%。这是一个巨大的飞跃,证明了该模型可以适应电话线路特定的声学条件。
姓名和地址的挑战对于计算机来说特别困难,因为这些词通常是独特的,且听起来可能非常相似。在最初的测试中,模型在处理这些术语时表现挣扎,错误率接近 17%。然而,在研究人员给予模型第二轮专门针对姓名和地址数据集的训练后,错误率骤降至不足 4%。这种水平的准确性对于企业级应用至关重要,因为在客户姓名或地址上出错可能会导致交易失败或用户不满。研究还比较了两个版本的模型:一个较小、较快的版本和一个较大、更复杂的版本。虽然较大的模型稍精确一些,但较小的版本几乎同样出色,且运行速度更快,这使其成为需要即时响应的实时系统的更好选择。
在整个实验过程中,研究人员测量了计算机处理音频的速度。他们发现,较小的模型可以以惊人的速度处理工作负载,在标准硬件上处理音频的速度比实时快 600 倍以上。这意味着即使是单个计算机芯片也可以同时处理数千个通话而没有延迟。这项研究证实,通过将强大的预训练模型与精心收集的领域特定数据集相结合,可以为此前服务不足的语言和环境构建鲁棒的语音系统。这项工作并不声称解决了语音识别中的所有问题,也不暗示该系统在所有可能的情况下都是完美的。相反,它为将通用 AI 工具适配到特定的、多噪的、高风险的企业电话世界提供了一条清晰且经过验证的路径,表明只要拥有正确的数据,机器就可以学会像人类在电话中那样倾听。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。