← 最新论文
🤖 machine learning

Low-Cost Black-Box Detection of LLM Hallucinations via Dynamical System Prediction

本文提出了一种低成本的黑盒幻觉检测方法,该方法利用科普曼算子理论将大语言模型响应建模为动态系统,从而在单次推理中无需昂贵采样或外部知识检索即可实现最先进的性能。

原作者: Dan Wilson, Mohamed Akrout

发布于 2026-05-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Dan Wilson, Mohamed Akrout

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你正在听一位讲故事的人。有时,他们讲述的是关于过去的真实故事;而有时,他们编织的故事听起来流畅自信,却完全是虚构的。这正是大语言模型(LLM)所做的:它们会“产生幻觉”,编造出听起来真实却并非事实的内容。

通常,识破这些谎言非常困难。你要么必须向 AI 重复提问一百次,观察它是否会改变说辞(这既缓慢又昂贵),要么必须将答案发送给独立的核查者(这需要互联网接入和额外工具)。

本文提出了一种巧妙且低成本的捷径。作者不检查故事的“内容”,而是倾听故事讲述的“节奏”。

核心理念:“跳舞”的故事

作者将 AI 视为一个动力系统——这是一种更专业的说法,意指一种按照可预测模式运行的机器,就像舞者在舞台上移动。

  1. 舞台(嵌入空间): AI 说的每个词都被转换为一个数学点,位于一个巨大的、不可见的三维(甚至一千维)空间中。当 AI 生成句子时,它从一个点移动到另一个点,形成一条路径或“轨迹”。
  2. 两个舞池: 研究人员发现,当 AI 讲述真相时,其路径遵循一个特定的舞池(即“流形”)。而当它撒谎(产生幻觉)时,则会踏上一个完全不同的舞池。尽管词语看起来可能相似,但词语之间的数学“步伐”却截然不同。
  3. 预测游戏: 他们构建了两个“预测器”(就像两位不同的舞蹈教练):
    • 教练 A 学习了“真相之舞”的步伐。
    • 教练 B 学习了“谎言之舞”的步伐。
  4. 评分: 当新句子出现时,他们让两位教练预测下一步。
    • 如果句子是真实的,教练 A(真相)能完美预测下一步,而教练 B(谎言)则会踉跄。
    • 如果句子是谎言,教练 B 能准确预测,而教练 A 则会踉跄。
    • 他们计算出一个“差分残差分数”:本质上,就是衡量一位教练比另一位做得好多少。如果“谎言教练”胜出,系统就会将其标记为幻觉。

为何这意义重大

  • 单次通过即成: 大多数其他方法需要向 AI 重复提问多次,或在数据库中查找事实。而这种方法只需一次审视答案即可立即做出判断。这就像只需看一次笔触就能识别假画,而无需将其与画廊中的真迹进行比对。
  • 兼容黑盒: 你无需窥探 AI 的内部大脑(大公司对此保密),只需获取其输出的文本即可。它就像一个“黑盒”检测器。
  • 可调节的严格度: 作者添加了一个“校准”功能。想象你是一位法官。有时你希望非常严格,捕捉微小的错误;有时你只关心重大、明显的谎言。该系统只需你提供少量示例即可调整,从而设定完美的“测谎仪”灵敏度。

他们如何测试

他们在三个不同的数据集上测试了这种“节奏检测器”:

  1. WikiBio: 检查传记中的事实错误。
  2. HaluEval: 检查摘要中虚构的细节。
  3. FELM: 检查数学和科学中的推理。

结果:

  • 他们的方法表现与目前最昂贵、资源消耗最大的方法相当,甚至更优。
  • 有趣的是,他们发现句子越长(舞蹈越长),就越容易区分“真相之舞”和“谎言之舞”。
  • 即使他们在一种 AI 模型(如 Llama-3)上训练系统,却在另一种模型(如 Mistral)上进行测试,效果依然出奇地好,这表明“撒谎的节奏”是不同 AI 之间普遍存在的特征。

结论

本文提出了一种通过分析词语的数学流动而非词语本身来识破 AI 谎言的方法。它快速、廉价、无需外部数据库,且只需审视一次文本即可生效。这就像拥有一个测谎仪,它倾听的是言语的“音乐”而非歌词。

文中提到的局限性:
论文指出,虽然这种方法擅长发现谎言,但它无法告诉你真相究竟是什么,也无法修正 AI 的行为。它是一个检测器,而非修正器。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →