← 最新论文
💬 NLP

HATS: An Open data set Integrating Human Perception Applied to the Evaluation of Automatic Speech Recognition Metrics

本文介绍了 HATS,这是一个新颖的法语数据集,包含来自 143 名标注者的人工感知转录错误,旨在研究和评估人类偏好与各种自动语音识别指标之间的相关性。

原作者: Thibault Bañeras Roux, Jane Wottawa, Mickael Rouvier, Teva Merlin, Richard Dufour

发布于 2026-05-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Thibault Bañeras Roux, Jane Wottawa, Mickael Rouvier, Teva Merlin, Richard Dufour

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名烹饪比赛的评委。两位厨师(我们称他们为厨师 A 和厨师 B)根据一份秘密食谱制作了一道菜。你的任务是品尝这两道菜,并判断哪一道更接近原始食谱。

在计算机领域,自动语音识别(ASR) 所做的正是如此。它聆听人类说话,并尝试将听到的内容写成文字,就像厨师试图重现一道菜肴一样。

长期以来,评判这些“计算机厨师”的唯一方法是统计错误数量。如果计算机将"bat"写成了"cat",这就算一个错误;如果它将"b-a-t"写成了"c-a-t",这也算一个错误。这被称为词错误率(WER)。这就像一位只统计缺少了多少种食材、却从不品尝味道的评委。

问题所在:“计数型”评委过于严苛

本文作者认为,这种“计数型”评委并不太能理解人类真正在意的是什么。有时,计算机犯下的错误虽然改变了某个词,但句意依然清晰(例如将“我吃了一个梨”说成“我吃了一个苹果”)。人类听众完全可以理解这句话,但“计数型”评委却将其判定为失败。

研究人员想知道:究竟哪种计算机指标最能反映人类认为的“好”转录?

解决方案:HATS 实验

为了找到答案,研究团队创建了一个名为HATS(人工评估转录并列对比)的新数据集。你可以将其想象成一场大规模、有组织的品测试吃活动。

  1. 设置:他们召集了 143 名人类志愿者。
  2. 任务:播放一段某人说话的声音录音,然后向志愿者展示该录音的两份不同计算机生成的转录文本。这两份转录文本都包含错误。
  3. 选择:志愿者必须从两个书面版本中选出哪一个“更好”或更容易理解。他们不能回答“两者相等”,必须选出一个胜者。

研究人员特意挑选了那些两份计算机转录版本质量非常接近的困难案例,迫使人类志愿者深入思考语言的细微差别。

结果:人类更偏好什么?

研究人员随后将人类的选择与各种计算机评分系统进行了对比,以查看哪种系统与人类的判断最一致。

以下是他们发现的内容,使用了简单的类比:

  • 旧方法(WER/CER):传统的“词错误率”就像一位只统计有多少字母写错的评委。它的表现不佳,经常选出的转录文本比人类实际偏好的更差。
  • 新方法(语义指标):研究人员测试了更智能的指标,这些指标关注词语的含义,而不仅仅是拼写。他们使用了诸如BERTScoreSemDist等工具。
    • 想象BERTScore是一位懂得“大”和“巨大”意思相同、即使词语不同也能理解的评委。
    • 想象SemDist是一位审视整个句子结构、判断“氛围”或含义是否正确的评委。

获胜者:与人类志愿者意见最一致的指标是SemDist(具体使用的是名为 Sentence-BERT 的模型)。它在预测人类会觉得哪个转录文本更容易理解方面表现最佳。

一个惊人的转折:文本的“声音”

一个有趣的发现是关于音素错误率(PhonER)。该指标基于词语的发音(即声音)而非拼写来统计错误。

  • 尽管人类志愿者只是阅读文本(并未聆听音频),但基于“声音”的指标实际上比基于“单词计数”的指标更能预测人类的选择。
  • 类比:这就像人类在阅读文本时,潜意识里在脑海中“听到”了这些词语。他们更偏好那些听起来正确的文本,即使他们只是在查看字母。

结论

该论文得出结论:如果你想了解语音转文本系统是否真正对人类有用,就不应仅仅统计拼写错误。你需要一种能够理解句子含义流畅度的指标。

他们免费发布了他们的“品测试吃”数据(HATS),以便其他科学家利用它构建更好、更人性化的语音识别系统。

重要提示:作者警告称,这项研究完全是在法语环境下进行的。仅仅因为这些规则适用于法语,并不意味着它们自动适用于英语或其他语言。此外,由于他们为测试挑选了非常棘手的例子,这些数据可能无法代表计算机在现实世界中犯下的每一种错误。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →