GPE: Evaluating Robust Evidence Aggregation for Fact Verification under Controllable GEO-Style Poisoning
本文介绍了 GPE,这是一个多领域基准测试与评估框架,旨在通过控制证据来源和攻击比例,评估事实核查系统针对生成引擎优化(GEO)投毒的鲁棒性,从而揭示在洁净环境下无法检测到的关键漏洞与权衡。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,互联网就像一座规模宏大、熙熙攘攘的图书馆,其中的书籍正被一群混乱的人群不断地重写。在这座图书馆里,人工智能(AI)扮演着一位超级聪明的图书管理员的角色,它不仅能记住事实,还能外出获取最新的书籍来回答你的问题。这就是现代 AI 的工作方式:它使用“检索增强生成”(retrieval-augmented generation),这意味着它会搜索网络以获取新鲜的信息来支撑其答案。但问题在于:如果有人潜入图书馆,把真书换成了看起来和听起来都与真书一模一样的假书怎么办?这就是“GEO 投毒”(GEO poisoning)的危险所在。正如坏人可能会试图欺骗搜索引擎,让其优先显示假新闻一样,他们也可以用专门设计用来迷惑 AI 图书管理员的、极具说服力的谎言来淹没这座图书馆。科学家们面临的一个重大问题是:如果图书馆里充满了这些巧妙的伪造品,AI 是否仍能辨别真伪,还是会被骗,从而相信那些假书是真的?
这正是名为 GPE(生成式引擎优化投毒评估,Generative Engine Optimization Poisoning Evaluation)的一项新研究所解决的问题。研究人员建立了一个专门用于 AI 事实核查的“训练健身房”,旨在测试这些数字图书管理员在证据被污染的情况下,识别谎言的能力究竟如何。他们不仅仅是在问:“AI 能找到正确答案吗?”而是问道:“当它找到的证据中有 33%、67% 甚至 100% 都被秘密投毒时,AI 还能找到正确答案吗?”他们创建了一个涵盖六个不同领域的大规模数据集:政治、名人八卦、科学、医学、历史和日常生活。对于每一个陈述,他们都收集了真实的证据,然后注入了不同类型的“毒素”——有些是流畅的虚假文章,有些是替换了关键事实的真实新闻文章,甚至还有一些是指令,要求 AI 忽略真相。
结果令人警醒。研究发现,即使是最聪明的 AI 模型,在面对受污染的证据时也会表现得非常吃力。在没有谎言的洁净环境中,表现最好的模型能达到约 52% 到 53% 的正确率。但一旦证据被污染,它们的表现就会大幅下降。例如,当证据被完全替换为虚假内容时,某些模型的准确率骤降至个位数。研究人员发现,没有任何一种方法是“超级英雄”;一个擅长识别一种类型假新闻的模型,在面对另一种类型时往往会表现得一败涂地。他们还发现,试图变得更加谨慎往往会消耗 AI 更多的“脑力”(即计算机 Token),这使得过程变得更慢、更昂贵,却未必能让它更安全。
其中最有趣的发现之一是关于“毒素类型”的问题。研究表明,“自适应篡改攻击”(Adaptive Tampering Attacks, ATA)——即坏人利用一篇看起来真实可信的文章,仅修改其中几个数字或名称——是最危险的。由于它们看起来太像真的一样,因此比明显的、凭空捏造的假新闻更难被 AI 检测出来。研究人员还构建了一个“知识图谱”,这就像一张连接了其数据集中所有人物、地点和文档的巨型地图。这张地图有助于研究人员观察单个被投毒的证据是如何传播并误导 AI 关于多个不同陈述的。
最终,这篇论文表明,我们不能依赖目前的 AI 事实核查方法来抵御这类攻击。研究证明,AI 在证据洁净时可能看起来自信且聪明,但一旦证据被操纵,这种自信就会消失。作者得出结论,我们需要新的评估系统,不仅要评估它们在完美世界中表现如何,还要评估它们在那个真相隐藏在层层精巧谎言背后的、混乱且充满对抗性的世界中,生存能力究竟如何。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。