← 最新论文
💻 computer science

Forecasting the Onset of Hallucination: Causal, Token-Level, Black-Box Survival Analysis During Generation

本文引入了一种因果性的、标记级(token-level)的生存分析框架,该框架通过检测文本新颖性漂移(text-novelty drift),成功地在大型语言模型产生幻觉之前对其进行预测,实现了 0.777 的 AUROC,并比传统的后验检测器提前约 11 个标记发出预警。

原作者: Igor Itkin

发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Igor Itkin

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在观看一场魔术表演,魔术师(一个巨大的 AI)正在讲故事。通常情况下,当魔术师开始撒谎——编造一些剧本中并不存在的实事时——我们称之为“幻觉”。

长期以来,捕捉魔术师的唯一方法就是等到他们真的说出谎言,然后指着他们说:“嘿,停下!那是假的!”但到那时,观众已经听到了谎言。这就像是在试图抓住一个掉落在地上的花瓶;你可以清理现场,但无法让破碎的花瓶复原。

这篇论文提出了一个大胆的问题:我们能否在魔丝还没开口说谎之前,就预见到谎言的到来?

水晶球 vs. 烟雾报警器

作者们构建了一个“水晶球”(一种预测工具),它在 AI 编写故事的过程中,逐字逐句地进行观察。他们将其与“烟雾报警器”(即那种仅仅等待谎言发生的旧方法)进行了对比。

他们发现了一个神奇的现象:AI 并不是从“真相”直接跳跃到“谎言”的。 相反,它会开始缓慢地偏离真相,就像一艘船在撞上礁石之前,先开始逐渐偏离航线一样。

  • 旧方法(检测器): 这个工具会等待 AI 开始胡编乱造。在他们的测试中,它在谎言开始发生 15 个 token(大约 15 个单词)之后才鸣响警报。它很快,但总是慢了一步。
  • 新方法(预测器): 这个工具观察 AI 的“漂移”。它注意到,在 AI 开始撒谎之前,文本会变得异常新颖且与原始来源脱节。因为它看到了这种“漂移”,它可以在谎言实际发生 11 个 token 之前就发出警报。

这是一个巨大的突破。这意味着该系统可以在文本仍然是真实的时候就发出警告,从而让你有机会在 AI 说出任何虚假内容之前阻止它。

水晶球是如何看到“漂移”的?

你可能会认为,AI 在撒谎之前会表现得紧张或困惑。你可能会预期该工具会观察 AI 的“惊讶”程度(即 AI 对自己所说的话感到多么震惊)。

但论文排除了这种可能性。 作者发现,AI 在撒言之前并不会感到惊讶。相反,警告信号来自于文本的新颖性(Text Novelty)

想象一下一位对歌词了如指掌的歌手。当他们开始唱起一首虚假的歌曲时,他们并不会突然变得紧张,他们只是开始唱出一些与原谱越来越不同的音符。该工具测量的是这些词汇相对于原始故事而言,变得多么“新颖”以及多么“脱离语境”。当词汇开始显得过于新鲜且远离原始故事时,工具就知道谎言即将到来。

该工具“不能”做的事(现实检查)

作者非常谨慎,没有过度吹嘘他们的发明。以下是他们明确指出该工具不是什么:

  • 它不是通用翻译器: 如果你用长篇、详细的文章(如维基百科摘要)来训练这个工具,然后尝试将其用于短促、快速的问题(如益智游戏),它会完全失效。事实上,它的表现甚至比随机猜测还要差!“漂移”的形式取决于文本的类型。该工具只有在针对其观察的特定文本类型进行专门训练时才有效。
  • 它不是停止谎言的万能修复手段: 作者进行了一项模拟实验,即在警报响起时直接告诉 AI“停止说话”。他们发现,旧有的“烟雾报警器”(等待谎言发生)在节省字数方面实际上表现更好。为什么呢?因为新工具有时会停止得太早,仅仅因为某些句子感觉有点“漂移”就切断了原本正确的句子。如果仅仅是单纯地删除整个句子,那么这种领先时间(Lead time)的意义并不大;只有当你拥有某种修复句子的方法(比如重写它)时,这种提前量才有用。
  • 它不是在读取 AI 的思想: 该工具不需要看到 AI 内部的脑电码。它只观察输出的文字,因此它是一个“黑盒”工具,可以适用于任何 AI。

魔法背后的数字

作者在名为 RAGTruth 的大规模数据集上进行了测试。结果如下:

  • 当预测未来 3 个单词内的谎言时,该工具的正确率为 77.7%(分数为 0.777)。
  • 即使只观察一个 AI 正在撒谎的特定文档,该工具也能在 68.7% 的情况下识别出即将到来的谎言,这证明它不仅仅是在随机猜测哪些文档质量较差,而是在真正捕捉谎言即将开始的瞬间。
  • 该工具成功在谎言发生前 11 个 token 发出了预警,而旧的检测器则在谎言发生 15 个 token 之后才反应。

核心结论

这篇论文证明了我们可以预见幻觉的到来,但前提是我们要观察文本中的“漂移”,而不是 AI 的困惑。这就像是在注意到汽车在撞车前轻微偏离车道,而不是等到撞车发生。

然而,这还不是一个已解决的问题。该工具对训练文本的类型具有高度特异性,而且仅仅在收到警告时停止 AI 并不总是最好的解决方法。但我们第一次拥有了一种在故事仍然真实时,就能预见谎言即将到来的方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →