← 最新论文
💬 NLP

Latent Fact-Checking: Detecting Misinformation through Activation Engineering

本文介绍了 LaFaCt,这是一个可扩展的虚假信息检测框架,它通过将输入的最后一个 token 的激活值投影到通过对比激活工程(contrastive activation engineering)推导出的潜在“虚假信息方向”上,在无需微调或外部证据检索的情况下,在各种模型规模上均实现了具有竞争力的性能。

原作者: Pedro Barcelos, Otávio Parraga, Marcelo M. Mussi, Lucas M. Fraga, Lucas S. Kupssinskü, Rodrigo C. Barros

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Pedro Barcelos, Otávio Parraga, Marcelo M. Mussi, Lucas M. Fraga, Lucas S. Kupssinskü, Rodrigo C. Barros

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

AI 大脑的秘密语言

想象一下,你拥有一个巨大的、超级聪明的机器人,它能写故事、回答问题,还能像人类一样聊天。科学家们称这些为“大语言模型”。长期以来,人们一直认为判断这个机器人是否在说实话的唯一方法,就是听它大声说出来的内容。但问题在于:有时机器人表现得非常自信且流畅,即便它是在胡编乱造。这就像一位魔术师,表演技巧如此高超,以至于让你相信兔子真的能从帽子里钻出来,而实际上那只是一种技巧。

为了判断机器人是否在撒谎,研究人员一直试图构建一些系统,通过将机器人的事实与书籍或互联网进行比对来核实。但计算机科学领域还有另一种想法:如果机器人即使不说出来,它其实也知道自己在撒谎呢?想想人类的大脑。当你撒谎时,即使你的声音保持冷静,你的心跳可能会加速,或者手心可能会出汗。科学家们认为 AI 模型也有类似的“内部信号”。他们认为在机器人的数字大脑内部,存在着隐藏的模式——就像一段秘密代码——能在机器人打出最终答案之前,就显示出某个陈述是真是假。这篇论文的研究重点,就是学习如何读取这些秘密信号,从而在不需要要求机器人解释自己或查阅图书馆的情况下,捕捉到虚假信息。


读取机器人的思想以识破谎言

在这项研究中,来自巴西的一个研究小组决定不再倾听机器人的言语,而是开始观察它的“脑电波”。他们使用了一个巧妙的技巧,叫做激活工程(activation engineering)。把机器人的大脑想象成一个充满了数千个电灯开关的巨大房间。当机器人思考某件事时,特定的灯光模式会被点亮。研究人员发现,在这个灯光房间里,存在着一个指向谎言的特定“方向”,以及另一个指向真相的不同“方向”。这就像是在机器人的内心找到了一个秘密指南针,即使机器人试图假装自己正面向南方,这个指南针也始终指向北方。

该团队不需要教机器人任何新知识,也不需要改变它的大脑(这被称为“微调”)。相反,他们使用了一种叫做**对比激活添加(Contrastive Activation Addition, CAA)**的方法。他们是这样做的:他们选取了一对句子——一个是真实的,一个是虚假的——并要求机器人假装真实的那个是假的,而假的那个是真的。通过比较机器人针对这两种相反情境所产生的“灯光模式”(激活值),他们计算出了两者之间的精确差异。这个差异就成了他们的“谎言指南针”。

一旦拥有了这个指南针,他们就在真实的陈述上对其进行了测试。他们并没有要求机器人回答问题。相反,他们将一个陈述输入机器人,观察机器人创造出的最终“灯光模式”,并将其投影到他们的“谎言指南针”上。如果模式强烈地指向“谎言”方向,他们的系统就会将其标记为虚假信息。他们在 11 种不同的机器人大脑上测试了这种方法,这些大脑规模从只有 2.7 亿个部分的微型模型到拥有 120 亿个部分的巨型模型不等,并使用了三组不同的现实世界事实核查挑战。

他们的发现(以及没能发现的)

结果出人意料地清晰。在三个挑战中的两个(LIAR 和 FACTors)中,研究人员的“谎言指南针”方法比直接让机器人猜测或给它几个例子进行学习的效果都要好。事实上,这种方法在帮助较弱、较小的机器人方面表现得尤为出色。例如,一个在 LIAR 数据集上通常错误率高达 46% 的小型机器人,仅通过使用这种内部信号,准确率就跃升到了 73%。这就像是给一个困惑的小学生一本秘密参考指南,帮助他们在并不完全掌握学科知识的情况下识别出正确答案。

研究人员认为,这是因为机器人的大脑内部确实包含着真相,即使它无法将其表达出来。“谎言指南针”找到了那个隐藏的真相信号。然而,这个故事并非在所有地方都完美。在第三个挑战(AVeriTeC)中,该方法效果并不理想,尤其是在较大的机器人上。团队解释说,这个数据集有所不同:那里的陈述只有在你先去互联网上查找额外信息后,才能被证明是真是假。由于他们的方法只关注陈述本身,而不去搜索外部证据,因此会产生混乱。这就像仅仅通过看题目本身来判断一道数学题是否正确,却不被允许查看答案解析或进行计算一样。

总结

这篇论文表明,我们并不总是需要构建庞大、昂贵的系统来核实事实。有时候,真相就隐藏在机器人自己的大脑之中,等待着被发现。通过简单地读取机器人的内部信号,我们可以比以前更快、更省计算资源地捕捉到谎言。研究人员发现,这种“谎言指南针”适用于许多不同类型和规模的机器人大脑,证明了分辨真伪的能力在这些机器内部是一条结构化的、线性的路径。

不过,他们也谨慎地表示,这并不是解决所有问题的万灵药。如果一个谎言需要通过核查特定的新闻文章或科学论文才能被揭穿,那么仅靠这种方法是无法胜任的。但在许多情况下,特别是当我们需要快速核实事实或使用更小、更廉价的机器人时,这种方法提供了一个强大的新工具。它将机器人自身的隐藏知识转化为对抗虚假信息的手段,证明了有时,捕捉骗子的最佳方式是倾听他们“没说出来”的话。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →