← 最新论文
⚡ electrical engineering

Preference-ASR: A Preference-Aware Test Set for Benchmarking ASR in the Era of Speech LLMs

本文介绍了 PreferenceASR,这是一个全新的测试集和评估框架,旨在基准测试自动语音识别(ASR)系统在遵循用户指定的关于规范化、实体、口语词及大小写输出偏好方面的能力,从而解决传统基准测试忽略此类风格变化的问题。

原作者: Nithin Rao Koluguri, Sasha Meister, Nikolay Karpov, Piotr Zelasko, Desh Raj, Jagadeesh Balam, Boris Ginsburg

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Nithin Rao Koluguri, Sasha Meister, Nikolay Karpov, Piotr Zelasko, Desh Raj, Jagadeesh Balam, Boris Ginsburg

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个非常聪明、新型的机器人,它能够倾听人们说话并将他们说的话记录下来。这被称为 ASR(自动语音识别)系统。在过去,这些机器人就像刻板的打字员:它们只是记录单词,如果它们犯了错,我们会给它们一个差评。

但现在,我们有了“语音大语言模型”(Speech LLMs)。这些是超级智能助手,它们不仅能倾听,还能遵循指令。你可以告诉它们:“把这段话写成正式报告的形式,”或者“原样记录,包括所有的‘嗯’和‘啊’。”

问题在于?我们没有一种好的方法来测试它们是否真的听从了那些指令。

问题所在:“一刀切”的尺子

这篇论文的作者指出,旧的语音机器人测试方法已经失效了。这就像试图用一把不断改变自身刻度的尺子去测量一块布料。

  • 规则不一致: 一些测试数据集要求将数字写成文字(“二十二”),而另一些则要求使用数字(“22”)。有些要求保留填充词(“嗯,啊”),而有些则要求将其删除。
  • “橡皮擦”效应: 当我们给这些机器人评分时,我们通常使用一种标准的“归一化器”(normalizer),它就像一个巨大的橡皮擦。它会抹掉所有的格式差异(将“22”变为“二十二”、删除大写字母、删除“嗯”)。
  • 结果: 如果一个机器人正确地遵循了你的指令写下“22”,旧的测试会抹除这一成功,并因为它预期的是“二十二”而判定其错误。我们是在根据它们忽略指令的能力来评分,而不是根据它们遵循指令的能力。

解决方案:“Preference-ASR”

团队创建了一个名为 Preference-ASR 的新测试。你可以把它看作是一个定制化的考试,专门针对语音机器人。

与其使用一个固定的标准答案,这个测试会为每一段音频片段提供一个特定的“偏好指令”。

  • 指令: “将数字写成阿拉伯数字。”
  • 音频: 有人说“twenty-two”。
  • 目标: 机器人必须写成“22”。

他们使用来自七个不同来源(如会议录音、财报电话会议和播客)的 3,210 个音频片段构建了这个测试。他们使用了两步流程:

  1. LLM 分类: 一个聪明的 AI 帮助将片段分类为:归一化(数字/符号)、实体(人名/公司名)、不流利现象(填充词)和大小写(大写字母/标点符号)。
  2. 人工检查: 真人验证了答案,以确保 AI 没有出错。

新的评分工具:“智能尺子”

为了公平地为这些机器人评分,他们发明了一个偏好感知归一化器(Preference-Aware Normalizer)

  • 旧尺子: “我不在乎你被告知了什么;我要把一切都变成小写单词。”
  • 新智能尺子: “如果指令说‘使用数字’,我会根据数字进行评分。如果指令说‘保留‘嗯’’,我会根据保留‘嗯’来进行评分。”

这确保了如果一个机器人遵循了你的特定请求,它就能获得好成绩。

他们的发现

他们使用这个新系统测试了四种不同的语音模型(包括一些旧模型和一些全新的“SpeechLLMs”)。结果令人惊讶:

  1. 排名发生变化: 在旧测试中看起来“最好”的机器人,在新的测试中可能看起来“最差”,反之亦然。旧的测试掩盖了真实的差异。
  2. “幻觉”陷阱: 一个非常聪明的模型(Qwen3-Omni)在遵循格式指令(如大小写或数字风格)方面表现出色。然而,当被要求包含特定的公司名称时,它有时会凭空捏造(幻觉)出这些名字,仅仅因为它们出现在提示词中,即使音频里并没有提到。旧的测试会错过这一点,因为它们会抹除格式差异。
  3. 训练至关重要: 一个模型(Canary-Qwen)拥有强大的大脑(LLM),但它并未经过处理格式指令的训练。它完全忽略了指令,只是进行了标准的转录。这证明了仅仅拥有聪明的大脑是不够的;你必须专门教它如何倾听用户的偏好。

核心结论

这篇论文引入了一种测试语音机器人的新方法。它表明,“最好的”机器人完全取决于用户的需求。如果你需要一份干净的摘要,某个机器人可能表现最好。如果你需要一份包含所有结巴的逐字稿,另一个机器人可能会胜出。

作者向公众发布了这个新的测试集和“智能尺子”工具,以便每个人都能构建出更好的、能够真正听取的需求、而不是仅仅猜测测试者意图的语音机器人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →