← 最新论文
💬 NLP

Indic DiarBench: A Multilingual Joint Diarization and ASR Benchmark for Indian Languages

本文介绍了 Indic DiarBench,这是一个开放获取的基准数据集,包含涵盖所有 22 种印度计划语言、共计 108 小时的人工标注多发言人音频,旨在评估并推进自动语音识别与说话人日志联合系统的发展。

原作者: Deovrat Mehendale, Aditya Mehndiratta, Dhruv Rathi, Kaushal Bhogale, Mitesh M. Khapra

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Deovrat Mehendale, Aditya Mehndiratta, Dhruv Rathi, Kaushal Bhogale, Mitesh M. Khapra

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正走进一个繁忙、混乱的印度集市。数百人正在大声叫喊、欢笑和交谈,彼此的声音交织在一起。有些人正在兜售香料,有些人正在为价格讨价还价,而附近的一群人正在争论政治。对于人类的耳朵来说,这是一幅丰富的生活画卷;但对于计算机而言,这却是一场噩梦。多年来,计算机已经非常擅长听取“一个人”清晰的说话声,比如新闻主播或老师。但现实生活很少那样安静。它是一种杂乱、重叠的对话,声音相互融合,在句子中切换语言,并在墙壁间回荡。

这就是“说话人日志(speaker diarization)”和“语音识别(speech recognition)”的世界。把说话人日志想象成计算机试图弄清楚“谁在何时说话”。这就像是在一场嘈多嘈杂的游戏中,一名裁判试图在每个球员跑过时都给他们贴上姓名标签。而语音识别则是计算机尝试写下这些球员究竟说了什么的尝试。棘手之处在于,这两项工作是紧密相连的。如果裁判贴错了人的标签,记录员就会写错话。直到现在,大多数计算机测试都像是练习在安静的图书馆里;它们并没有让计算机为那种嘈杂、重叠、多语言混杂的现实世界做好准备,尤其是在印度,那里有22种不同的官方语言和无数的方言在交织流动。

这篇论文介绍了一个全新的、大规模的测试,名为 Indic DiarBench。研究人员不仅仅是构建了一个测试;他们还专门为印度语言构建了一个“混沌模拟器”。他们收集了大约 108 小时的真实、杂乱的音频。这不仅仅是一种类型的噪音;它包括虚拟会议中近距离的录音、在大房间里产生回声的远距离录音,甚至还有 YouTube 视频中人们在野外交谈的片段。他们确保涵盖了印度的所有 22 种法定语言,捕捉了从印地语、泰米尔语到桑塔利语和克什米尔语的一切。

随后,团队将这些数据投入到了严格的人工审核过程中。他们没有让计算机去瞎猜;而是让专家进行聆听,修正转录文本,并仔细标注出谁在何时说话,甚至在两人同时说话的情况下也是如此。他们还处理了印度独特的“语码混合(code-mixing)”现象,即说话者在同一个句子中在母语和英语之间切换。

测试准备就绪后,他们将最优秀的计算机系统投入其中,以观察它们的表现如何。他们测试了大型的商业工具(如 AWS 和 Azure)、专门的印度 AI 系统,甚至是最新型的、能够看也能听的“多模态”AI 模型。结果既有好消息,也有现实的警示。

研究发现,虽然一些系统正在进步,但这项工作依然极其困难。一个名为 Sarvam 的专门针对印度的 AI 系统整体表现最好,但即便如此,它在识别“谁在说话”方面仍有约 16% 的错误率,而在“说对了什么词”方面则有约 39% 的错误率。那些大型通用 AI 模型(如 GPT-4o 和 Gemini)展现出了一种有趣的弱点:有些模型非常擅长记录文字,但在辨别“是谁说的”方面表现糟糕;而另一些模型虽然能较好地识别说话人,但在正确书写文字方面却很吃力,尤其是在面对使用人数较少的语言时。

论文明确指出,当人们互相说话(重叠)的情况越多,计算机的表现就越差。它还强调,那些基于“纯净”音频训练的系统,在面对现实生活中常见的遥远、带有回声或嘈杂的录音时,表现得非常糟糕。研究人员总结道,我们不能再将“谁说了”和“说了什么”视为两个独立的问题;它们必须被共同解决。虽然我们拥有了一个新的、开放的基准测试来帮助研究人员改进,但论文也明确表示,我们还没有达到目标。计算机仍然难以应对印度式对话中那种充满活力、重叠且多语言并存的现实,要让计算机像人类一样听懂拥挤的印度集市,还有很长的路要走。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →