← 最新论文
⚡ electrical engineering

HALAS: A Human-Annotated Dataset of Hallucinations of Modern ASR Systems

本文介绍了 HALAS,这是首个针对现代 ASR 系统中源自真实收益电话会议的自然发生幻觉的人工标注数据集,该数据集揭示了当前的检测方法表现不佳,并为评估幻觉缓解建立了一个严格的基准。

原作者: Mateusz Barański, Jan Jasiński, Julitta Bartolewska, Marcin Witkowski, Konrad Kowalczyk

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Mateusz Barański, Jan Jasiński, Julitta Bartolewska, Marcin Witkowski, Konrad Kowalczyk

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你雇佣了一位非常聪明、高科技的速记员,名叫“ASR”(自动语音识别)。这位速记员负责倾听人们的谈话并准确地记录下他们所说的话。通常情况下,这位速记员表现得非常出色。但有时,当音频变得有些棘手或者速记员感到疲劳时,它会开始出现幻觉(hallucinate)

在这种语境下,幻觉并不是指看到鬼魂;而是指速记员自信满满地写下了从未被说出口的词句。它可能会在没人说话时加上一个“谢谢”,或者把一句话重复三遍,甚至凭空捏造出一个全新的句子,从而改变了对话的原意。

以下是这篇论文中研究人员工作的简单拆解,使用了日常类比:

1. 问题所在:“沉默”测试

以前,科学家们试图通过在虚假问题上测试速记员来修复这些幻觉。他们会给速记员输入静电噪声或一段沉默,观察它是否会编造词句。

  • 类比: 这就像是通过让厨师去煮一块石头,来测试他们烹饪牛排的能力。如果他们失败了,你只知道他们不会煮石头,但你并不知道他们能否处理一块真正的、很硬的肉。
  • 现实情况: 研究人员意识到,现实世界的语音(比如人们在繁忙的办公室里互相插话)与虚假噪声是不同的。他们需要观察这些速记员在现实世界中是如何表现的。

2. 解决方案:HALAS(“幻觉名人堂”)

团队创建了一个名为 HALAS 的新数据集。你可以把它看作是错误行为的“耻辱柱”或“名人堂”,但专门针对那些速记员凭空捏造的内容。

  • 如何构建: 他们采集了 119 小时的真实录音,内容来自企业财报电话会议(人们讨论金钱和业务的场合)。
  • “棘手”的选择方式: 他们并非随机挑选片段。他们寻找的是七个不同的顶级速记员都给出不同答案的时刻。
    • 类比: 想象一下,你请七个不同的人去描述一张模糊的照片。如果他们说的内容各不相同,那么这张照片很可能非常难以辨认。研究人员挑选了这些“模糊”的时刻,因为那是速记员最容易开始胡编乱造的地方。
  • 人工介入: 他们聘请了 10 名人类专家来听音频和速记员生成的文本。如果速记员写下的词并不在音频中,人类就会将其标记为“幻觉”。

3. 他们的发现:“鬼词”

在分析数据时,他们发现了一些令人惊讶的模式:

  • 人人都会犯错: 他们测试的所有七种最先进的 AI 模型都犯了这些错误。没有一个是完美的。
  • “惯常”的错误: 速记员并不是随机出错,而是反复犯着同样的错误
    • 类比: 这就像一个总是忘记在句子末尾加句号的学生。即使没有人说这些词,他们也会写下“you”、“okay”、“thank you”或“yeah”。大约 55% 的幻觉都是由这些常见的短语组成的。
  • 低错误率,高风险: 有时速记员能写对 95% 的词(这是一个很低的“词错率”/Word Error Rate),但它出错的那 5% 却是彻头彻尾的谎言(幻觉)。这很危险,因为文本看起来大部分都是正确的,所以你可能不会注意到那个谎言。
  • 严重程度: 有些错误是轻微的(比如多加了一个“um”或“uh”),但有些则是严重的(比如改变了句子的意思或与所说内容相矛盾)。

4. 测试:我们能抓到这些“骗子”吗?

研究人员使用 HALAS 来测试现有的方法是否能捕捉到这些幻觉。

  • “代理”测试: 他们尝试使用简单的数学工具(例如检查文本长度或其与原始音频的相似度)。
    • 结果: 这些工具还可以,但并不出色。它们能捕捉到那些明显的、离谱的错误,但会漏掉那些微妙的错误。
  • “AI 对抗 AI”测试: 他们尝试使用其他 AI(如大语言模型)来检查工作。
    • 结果: 令其惊讶的是,“无参考”(reference-free)的方法(即观察速记员内部脑电信号而非与“正确答案”进行对比的方法)比那些面前摆着“正确答案”的方法效果更好。
  • 得分: 他们发现最好的检测方法也只能识别出大约 53% 的幻觉。这意味着,即使使用最好的工具,我们仍然会漏掉近一半的速记员所编造的谎言。

核心结论

这篇论文介绍了 HALAS,这是第一个真实的“幻觉数据集”,其中人类仔细标注了 AI 语音转文本系统在何处撒谎。

他们发现:

  1. 即使是最聪明的 AI 速记员,在真实的对话中也会编造词句。
  2. 它们倾向于反复犯下特定的错误。
  3. 现有的工具并不擅长捕捉这些谎言,尤其是当其余部分的文本看起来很正确时。

论文总结道,HALAS 现在已成为测试我们检测 AI 幻觉能力的“金标准”,让我们从测试虚假噪声转向测试真实的、混乱的人类语音。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →