← 最新论文
💬 NLP

Generative vs. Encoder Large Language Models for ASR Evaluation: A Comparative Study

本文通过一项对比研究表明,虽然配置得当的基于编码器的指标(如 BERTScore 和 SemDist)在 ASR 评估中与人类判断表现出强相关性,但生成式大语言模型在成对假设选择以及提高错误分析的可解释性方面提供了互补的优势。

原作者: Thibault Bañeras-Roux, Shashi Kumar, Driss Khalil, Sergio Burdisso, Petr Motlicek, Shiran Liu, Mickael Rouvier, Jane Wottawa, Richard Dufour

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Thibault Bañeras-Roux, Shashi Kumar, Driss Khalil, Sergio Burdisso, Petr Motlicek, Shiran Liu, Mickael Rouvier, Jane Wottawa, Richard Dufour

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

当计算机倾听人类的声音并写下所听到的内容时,这个过程被称为自动语音识别。几十年来,衡量这些系统表现好坏的标准方法一直是简单的错误计数。如果计算机在说话者说“cat”(猫)时写成了“bat”(蝙蝠),这就算作一个错误。如果它多写了一个词或漏掉了一个词,这些也都是错误。这种被称为词错率(word error rate)的方法将每种错误都视为同样糟糕。它并不关心这个错误是否改变了句子的含义,或者是否只是一个人类读者可以轻易忽略的微小拼写差异。因此,一个系统可能在这一旧标准测试中获得完美分数,但生成的文本对人类来说仍然听起来很机械化或令人困惑。

为了解决这个问题,研究人员转向了更关注词汇背后含义而非仅仅是字母本身的新方法。这些方法使用大语言模型,即在海量文本上训练过的、能够理解语言运作方式的庞大计算机程序。其中一些模型旨在阅读和理解文本,而另一些则旨在生成新文本,例如编写故事或回答问题。该领域的一个重大问题一直是:这些强大的新工具能否比旧的计数方法更好地评判语音识别,以及如果可以,哪种类型的模型才是最好的评判者。

来自瑞士 Idiap 研究院的研究团队与来自法国的大学研究人员共同致力于回答这个问题。他们想看看不同类型的大语言模型在被要求评估转录语音质量时表现如何。他们不仅仅是从通用的角度观察这些模型;他们还通过两种截然不同的方式对它们进行了测试。首先,他们将模型视为测量 spoken words(口语词汇)与 written text(书面文本)之间距离的工具,寻找一个与人类观点相匹配的数学得分。其次,他们要求模型扮演类似人类的评判者,阅读两个不同的转录版本,并决定哪一个更好,或者仅仅将单个转录文本标记为好、坏或令人困惑。

研究人员使用名为 HATS 的数据集来测试他们的想法,该数据集包含了针对各种计算机系统产生的法语 ASR(自动语音识别)假设的人类偏好成对数据。至关重要的是,该数据集还包括了人类听众对转录质量进行评分的意见。这使得研究人员能够观察计算机模型是否做出了与人类相同的判断。他们首先测试了作为测量工具的模型。他们利用从模型中提取的嵌入(embeddings)计算了 BERTScore 和 SemDist,以生成一个基于计算机版本与人类版本相似度的得分。他们发现,最好的结果并不单纯取决于使用规模最大或最强大的模型。相反,成功取决于研究人员如何处理模型内部的信息。

对于那些用于阅读和理解文本的模型,研究人员发现,最好的结果来自于观察模型内部结构的特定层,而不是仅仅看最终输出。他们还发现,专门用于创建句子级摘要的模型比通用模型表现得更好。对于生成文本的模型,结果也类似:最佳性能需要仔细选择使用模型内部知识的哪些部分。在这些测试中,旨在生成文本的模型表现得与旨在阅读文本的模型一样好,有时甚至略好。然而,阅读型模型以更少的计算资源实现了这一目标,使其成为这项特定任务中非常高效的选择。

研究人员随后进入研究的第二部分,即要求模型扮演评判者的角色。在第一个场景中,他们给模型一个参考句子和两个不同的计算机生成的句子版本。模型必须选择人类会更偏好的那一个。在这个任务中,最先进的生成式模型(包括一些现有的最大规模模型)表现得异常出色。在最佳情况下,它们与人类的选择一致率高达 94%,超越了旧的计数方法和新的评分方法。这表明,当模型被允许阅读整个句子并思考上下文时,它能够捕捉到简单数学方法所忽略的细微质量差异。

在最后的实验中,研究人员要求模型观察单个转录文本并分配一个标签:完全一致(identical)、有用(useful)、差(bad)或无法理解(incomprehensible)。这种方法提供了另一种形式的见解。研究人员得到的不再是一个单一的数字,而是一种对错误的描述。例如,模型可以识别出尽管有一些拼写错误,但句子仍是可理解的,或者它是完全令人困惑的。虽然模型在执行此任务时并非完美,但它们展现出了按严重程度组织错误的能力。结果表明,这些模型可以提供关于语音系统为何失败的更详细且对人类友好的报告,而不仅仅是说它失败了。

研究得出结论,大语言模型为评估语音识别提供了一种灵活且强大的新方法。阅读型模型提供了能匹配人类感知的快速且准确的评分,而文本生成型模型则擅长比较不同的转录版本并解释错误的性质。研究人员发现,模型的规模并不如其使用方式那样重要;一个配置良好的小型模型往往可以胜任大型模型的任务。最终,这项工作表明,通过结合这些不同的方法,我们可以超越简单的错误计数,从而实现对计算机真正理解人类声音程度的深度理解。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →