想象你正在听一位讲故事的人。有时,他们讲述的是关于过去的真实故事;而有时,他们编织的故事听起来流畅自信,却完全是虚构的。这正是大语言模型(LLM)所做的:它们会“产生幻觉”,编造出听起来真实却并非事实的内容。
通常,识破这些谎言非常困难。你要么必须向 AI 重复提问一百次,观察它是否会改变说辞(这既缓慢又昂贵),要么必须将答案发送给独立的核查者(这需要互联网接入和额外工具)。
本文提出了一种巧妙且低成本的捷径。作者不检查故事的“内容”,而是倾听故事讲述的“节奏”。
核心理念:“跳舞”的故事
作者将 AI 视为一个动力系统——这是一种更专业的说法,意指一种按照可预测模式运行的机器,就像舞者在舞台上移动。
- 舞台(嵌入空间): AI 说的每个词都被转换为一个数学点,位于一个巨大的、不可见的三维(甚至一千维)空间中。当 AI 生成句子时,它从一个点移动到另一个点,形成一条路径或“轨迹”。
- 两个舞池: 研究人员发现,当 AI 讲述真相时,其路径遵循一个特定的舞池(即“流形”)。而当它撒谎(产生幻觉)时,则会踏上一个完全不同的舞池。尽管词语看起来可能相似,但词语之间的数学“步伐”却截然不同。
- 预测游戏: 他们构建了两个“预测器”(就像两位不同的舞蹈教练):
- 教练 A 学习了“真相之舞”的步伐。
- 教练 B 学习了“谎言之舞”的步伐。
- 评分: 当新句子出现时,他们让两位教练预测下一步。
- 如果句子是真实的,教练 A(真相)能完美预测下一步,而教练 B(谎言)则会踉跄。
- 如果句子是谎言,教练 B 能准确预测,而教练 A 则会踉跄。
- 他们计算出一个“差分残差分数”:本质上,就是衡量一位教练比另一位做得好多少。如果“谎言教练”胜出,系统就会将其标记为幻觉。
为何这意义重大
- 单次通过即成: 大多数其他方法需要向 AI 重复提问多次,或在数据库中查找事实。而这种方法只需一次审视答案即可立即做出判断。这就像只需看一次笔触就能识别假画,而无需将其与画廊中的真迹进行比对。
- 兼容黑盒: 你无需窥探 AI 的内部大脑(大公司对此保密),只需获取其输出的文本即可。它就像一个“黑盒”检测器。
- 可调节的严格度: 作者添加了一个“校准”功能。想象你是一位法官。有时你希望非常严格,捕捉微小的错误;有时你只关心重大、明显的谎言。该系统只需你提供少量示例即可调整,从而设定完美的“测谎仪”灵敏度。
他们如何测试
他们在三个不同的数据集上测试了这种“节奏检测器”:
- WikiBio: 检查传记中的事实错误。
- HaluEval: 检查摘要中虚构的细节。
- FELM: 检查数学和科学中的推理。
结果:
- 他们的方法表现与目前最昂贵、资源消耗最大的方法相当,甚至更优。
- 有趣的是,他们发现句子越长(舞蹈越长),就越容易区分“真相之舞”和“谎言之舞”。
- 即使他们在一种 AI 模型(如 Llama-3)上训练系统,却在另一种模型(如 Mistral)上进行测试,效果依然出奇地好,这表明“撒谎的节奏”是不同 AI 之间普遍存在的特征。
结论
本文提出了一种通过分析词语的数学流动而非词语本身来识破 AI 谎言的方法。它快速、廉价、无需外部数据库,且只需审视一次文本即可生效。这就像拥有一个测谎仪,它倾听的是言语的“音乐”而非歌词。
文中提到的局限性:
论文指出,虽然这种方法擅长发现谎言,但它无法告诉你真相究竟是什么,也无法修正 AI 的行为。它是一个检测器,而非修正器。
技术摘要:基于动力系统预测的低成本黑盒大语言模型幻觉检测
问题陈述
大语言模型(LLM)经常生成流畅但事实错误的内容,这种现象被称为幻觉。这一问题构成了将大语言模型部署于医疗、法律和金融等高利害领域的关键障碍。尽管由于有限训练数据与开放式生成之间的权衡,幻觉在理论上不可避免,但当前的检测方法面临显著局限:
- 白盒/灰盒方法:需要访问内部模型状态(隐藏状态、注意力图)或词元级概率,而这些对于通过 API 访问的商业闭源模型是不可用的。
- 现有黑盒方法:通常依赖计算成本高昂的基于采样的一致性检查(例如 SelfCheckGPT)或外部知识检索。这些方法会产生高昂的 API 成本、延迟和资源开销,使其不适用于实时、单样本应用场景。
因此,迫切需要一种自包含、低成本的检测框架,该框架仅基于生成文本运行,无需外部 grounding 或多轮采样。
方法论
作者提出将大语言模型视为一个黑盒动力系统(DS)。该方法不将词元作为独立单元进行分析,而是将词元嵌入的时间演化建模为模型潜在状态空间动力学的可观测实现。
核心框架
动力系统公式化:
大语言模型输出被建模为离散时间非线性系统:
xk+1=F(xk),yk=H(xk)
其中 xk 代表内部状态,yk 代表可观测的词元嵌入。作者利用Koopman 算子理论将这些可观测量的动力学线性化,从而允许基于过去的观测预测未来状态。
第一阶段:数据驱动的动力系统推断(离线拟合):
- 该方法利用包含事实性和幻觉性响应的小规模标注数据集。
- 使用扩展动态模态分解(Extended DMD)将词元嵌入“提升”到更高维空间。
- 推断出两个不同的线性动力学模型:
- Ac:事实性(正确)响应的转移算子。
- Ah:幻觉性响应的转移算子。
- 其假设是,事实性和幻觉性响应在嵌入空间内的不同流形(Mc 和 Mh)上演化,从而导致不同的 Koopman 算子估计。
第二阶段:基于微分残差分数的分类(推理):
- 对于新的、未见过的 LLM 响应,该方法使用两个模型(Ac 和 Ah)计算词元嵌入轨迹的预测误差(残差)。
- 在响应级别计算微分残差分数(ΔE):
ΔE=∑ϵh,j2−∑ϵc,j2
其中 ϵ 代表预测误差。
- 逻辑:如果响应是幻觉性的,那么拟合幻觉的模型(Ah)应比事实性模型(Ac)更准确地预测轨迹,从而导致负的 ΔE。反之,事实性文本产生正的 ΔE。
- 对 ΔE 应用决策阈值 η,将输出分类为事实性(0)或幻觉性(1)。
偏好感知校准:
为了适应不同的用户需求(例如,对微小错误是严格还是宽容),作者引入了一种校准机制。利用少量用户标注的演示数据,优化阈值 η 以符合特定的敏感性偏好,从而使检测器能够适应个别用例。
主要贡献
- 新颖的动力学视角:本文首次将 LLM 输出视为黑盒动力系统,其中事实性和幻觉性响应在状态空间的不同流形上演化。
- 计算高效的单轮检测:与基于检索或多采样的方法不同,该方法在单样本轮次中识别幻觉,无需词元概率、外部知识库或多轮前向传递。
- 最先进的性能:该方法在三个多样化的基准测试(WikiBio、HaluEval、FELM)中,与资源密集型基线相比,实现了具有竞争力或更优越的性能。
- 以用户为中心的校准:引入了一种机制,可根据用户定义的严格程度调整分类阈值,从而实现个性化检测。
实验结果
该方法在三个数据集上进行了评估:WikiBio(传记)、HaluEval(摘要)和FELM(数学、科学、逻辑推理)。
- 性能:
- 在HaluEval摘要任务上,使用 Llama-3 嵌入模型的方法达到了**99.3%**的准确率,显著优于零样本检测器和其他黑盒基线。
- 在WikiBio上,该方法(使用 Llama-3)在检测非事实性句子方面达到了85.3的 AUC-PR,优于 SelfCheckGPT(81.96)。
- 在FELM上,Llama-3 变体达到了68.4的平衡准确率,与 GPT-4 及其他强基线持平或超越。
- 序列长度:随着词元序列变长,性能有所提升,因为更长的轨迹提供了更丰富的语义信息。较小的嵌入模型从增加的序列长度中受益最多,而较大的模型(如 Llama-3)即使在较短序列上也能保持高性能。
- 跨嵌入泛化:研究观察到了惊人的可迁移性;在一个嵌入空间(例如 Qwen3)上拟合的动力学模型可以部分泛化,用于评估嵌入在另一个空间(例如 Llama-3)中的响应,这表明不同嵌入流形上存在事实性的通用动力学特征。
- 效率:该方法避免了外部检索或多轮采样的延迟和成本,提供了一种低开销解决方案,适用于实时应用。
意义与主张
作者声称,这项工作为现有的幻觉检测方法提供了一种低成本、可扩展的替代方案。通过动力系统的视角重新审视该问题,他们证明了词元嵌入的时间演化固有地编码了事实性内容与幻觉性内容之间的区别。
论文强调,其方法:
- 无需访问模型内部(真正的黑盒)。
- 无需外部知识检索。
- 无需多轮采样。
- 以较低的资源开销实现了最先进的结果。
作者承认了局限性,指出虽然该方法能检测幻觉,但不提供外部事实修正或缓解幻觉的策略(例如通过提示修改)。然而,他们将这项工作定位为迈向自包含、自主检测框架的基础步骤,这对于大语言模型在关键领域的可靠部署是必要的。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。