MMD-Flagger: Leveraging Maximum Mean Discrepancy to Detect Hallucinations
本文介绍了 MMD-Flagger,这是一种用于大型语言模型测试时幻觉检测的方法,它利用最大均值差异(Maximum Mean Discrepancy)来分析输出在不同解码温度下的稳定性,从而能够在无需地面真值标签的情况下实现对事实错误的可靠识别。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在快速演进的人工智能领域,大语言模型已成为强大的工具,能够生成类人文本、回答复杂问题,甚至辅助自主决策。然而,这些系统存在一个持久的缺陷:它们有时会产生听起来流畅且自信,但事实完全错误的陈述。这种被称为“幻觉”的现象构成了显著的安全风险,尤其是在这些模型被部署在法律、医学或自动驾驶等关键领域时,因为一个错误的步骤就可能导致灾难性的后果。研究人员面临的核心挑战在于,如何在没有“金标准”答案库的情况下实时检测这些错误。由于这些模型在实际使用过程中无法进行外部验证,科学家们必须找到一种方法,仅根据模型自身的行为来判断其答案的可靠性。其中的关键在于理解模型对其内部设置微小变化的反应;如果一个模型是真正自信且基于事实的,那么即使其生成的条件发生轻微变化,其答案也应保持一致。然而,如果答案是捏造的,模型的输出在同样的变换下往往会变得不稳定且反复无常。
基于这一原则,来自法国和德国的一个研究小组开发了一种名为 MMD-Flagger 的新方法来捕捉这些幻觉。他们的方法并不依赖于将事实与数据库进行比对,也不依赖于训练一个专门识别错误的新模型。相反,它作为一个稳定性监测器,观察语言模型输出在调整其生成过程中的“温度”时如何发生变化。在这些模型的语境中,“温度”是一个控制模型在选择下一个词时引入多少随机性的设置。低温度使模型非常可预测且具有重复性,而高温度则允许更具创意和多样化的响应。研究人员假设,一个真实的答案在这些不同的设置下会保持相对稳定,而一个幻觉式的答案则会在温度变化时剧烈地摇摆并改变形态。
为了测试这一想法,研究人员创建了一个系统,为同一个问题生成多个版本的答案,每次使用不同的温度设置。然后,他们使用一种称为“最大均差异”(Maximum Mean Discrepancy)的统计工具将原始答案与这些变体进行比较。该工具用于衡量两组数据之间的差异程度。通过在一定范围的温度内绘制这些差异,系统会创建一个视觉路径,即“轨迹”。研究人员发现,当模型在说实话时,这条路径是平滑且可预测的,通常随着随机性的增加而稳步上升。然而,当模型产生幻觉时,路径会呈现出独特的、尖锐的 U 形。曲线中间的这个凹陷是一个明确的信号,表明模型难以维持一致的含义,从而有效地将该响应标记为不可信。
该团队使用包括 Llama-3 和 Gemma-3 系列在内的现代语言模型,在一个旨在测试多语言事实准确性的基准数据集上评估了这种方法。他们将这种新方法与几种依赖于文本相似度或模型内部状态的现有技术进行了对比。结果显示,幻觉检测的有效性高度依赖于特定的模型架构;虽然 MMD-Flagger (Ensemble) 在 Llama-3.1-8B 和 Gemma-3-4B 上取得了最佳性能,但其他估算器在 Llama-3.2-3B 上表现更好。该系统证明了其灵活性,可以处理从模型中提取的各种类型的数据,例如单词的原始含义或神经网络的隐藏层。在一个涉及关于电视节目中一只猫的具体测试案例中,该系统成功识别出了一个被其他方法漏掉的幻觉答案,捕捉到了模型输出随着温度变化而开始偏离逻辑的瞬间。相反,在另一个关于格拉斯哥音乐团体的案例研究中,分析显示 MMD-Flagger 未能检测出一个被另一种方法 (KLE) 正确识别出的幻觉,这凸显出模型的输出轨迹有时即使在内容错误时也能保持极具欺骗性的平滑。
尽管取得了这些令人鼓舞的成果,研究人员也承认该方法存在局限性。由于它需要生成许多个答案的变体来构建可靠的稳定性剖面,因此计算成本可能较高,且比单纯请求模型给出一次答案要慢。这使得它不太适合需要瞬时响应的应用场景,但对于准确性至关重要的安全关键型系统来说,它仍然是一个强大的工具。这项研究表明,通过监测模型输出在不同条件下的稳定性,我们可以为人工智能构建一个更值得信赖的监督层。这种方法提供了一种在无需预先知道正确答案的情况下,审计自主智能体可靠性的途径,为构建更安全、更可靠的 AI 系统迈出了关键一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。