FilterRAG: Zero-Shot Informed Retrieval-Augmented Generation to Mitigate Hallucinations in VQA
该论文介绍了 FilterRAG,这是一个零样本检索增强生成框架,它将 BLIP-VQA 与维基百科和 DBpedia 等外部知识源相结合,以显著减少视觉问答中的幻觉并提高准确性,特别是在知识驱动和分布外场景中。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在参加一个派对,有人给你看一张配有奇怪配料的热狗照片,并问你:“那些是什么?”如果你从未见过这种特定的配料,你的大脑可能会根据你“认为”它看起来像什么来尝试猜测。你可能会说:“那大概是芥末酱,”即便它实际上是酸黄瓜酱。在人工智能的世界里,这种猜谜游戏被称为幻觉(hallucination)。AI表现得很自信,但其实是错误的。
这篇论文介绍了一个名为 FilterRAG 的新系统,旨在阻止 AI 犯下这些自信的错误,尤其是在它遇到训练数据中未曾见过的东西时。
以下是该系统的运作方式,通过简单的概念进行拆解:
1. 问题所在:“无所不知”却爱瞎猜的人
目前的 AI 模型(例如那些可以观察图片并回答问题的模型)非常擅长描述它们所看到的内容。但如果你问一个需要外部知识的问题——比如“这辆摩托车是用于哪种运动的?”或者“这是哪种特定的调味品?”——它们往往会遇到困难。
由于缺乏检查事实的方法,这些模型依赖于它们训练时的“记忆”。如果训练数据存在偏差或不完整,AI 就会进行猜测。这就像一个学生在考试时遇到了自己没读过的那一章;他们试图用一个听起来很像样但实际上是错误的答案来糊弄过去。
2. 解决方案:“图书管理员”法
作者创建了 FilterRAG。把这个系统想象成一个被允许在考试期间使用图书馆的学生。
- 学生 (BLIP-VQA): 这是 AI 的一部分,负责观察图片并阅读问题。它擅长观察图像,但需要事实方面的帮助。
- 图书馆 (Wikipedia & DBpedia): 系统不再进行猜测,而是暂停并跑向一个数字图书馆。它搜索关于图像和问题的真实世界事实。
- 图书管理员 (GPT-Neo): 这是负责阅读图书馆找到的事实并写出最终答案的部分。
通过强制 AI 在回答之前“查阅图书馆”,它停止了猜测,开始使用事实。
3. 它是如何一步步运作的
论文描述了一个特定的过程,我们可以将其可视化为准备一顿饭:
- 切割食材(网格): 系统将图像切成一个 2x2 的网格(四个方块)。
- 为什么? 如果你把照片切成太多细小的碎片(比如 4x4 的网格),你会失去全局观,导致 AI 感到困惑。如果你保持为一个大块,又会错过微小的细节。2x2 的网格是“金发姑娘原则”(恰到好处的大小)——它既保持了图像的连贯性,又足够详细。
- 观察图片: 系统分析这四个方块以及问题。
- 搜索: 它向“图书馆”(Wikipedia 和 DBpedia)发送查询,以寻找相关的知识。对于摩托车的问题,它可能会找到关于“越野摩托车(motocross)”的事实。对于热狗,它可能会找到关于“酸黄瓜酱(relish)”的事实。
- 组装: 系统将图片、问题以及它刚刚找到的新事实结合在一起。
- 回答: 一个冻结的语言模型 (GPT-Neo) 阅读所有这些组合后的信息并写出答案。因为有了事实,它不再需要猜测。
4. 结果:在“未知领域”表现更好
研究人员在 OK-VQA 数据集上测试了该系统,这个数据集充满了需要外部知识的棘手问题。
- 基准线 (The Baseline): 标准的 AI 模型(没有图书馆辅助)在这些棘手问题上的正确率约为 40%。它们经常出现幻觉。
- FilterRAG: 新系统的准确率为 36.5%。
- 等等,这不是更低了吗? 论文指出,虽然从原始数值上看,它略低于一些使用庞大计算机的超复杂系统,但 FilterRAG 要高效得多。它在性能、速度和成本之间取得了平衡。
- 真正的胜利: 该系统在 分布外 (Out-of-Distribution, OOD) 场景中表现得更好。这意味着当 AI 看到全新的或奇特的东西(比如在它未曾见过的语境下的摩托车)时,它不太容易产生幻觉。它能保持基于事实,而不是凭空捏造。
5. “落地得分”(Grounding Score)
为了证明 AI 不仅仅是在瞎猜,作者使用了一个“落地得分”。你可以把它想象成一个真理计。
- 如果 AI 说“芥末酱”,但图书馆说“酸黄瓜酱”,分数就会下降。
- 如果 AI 因为图书馆说是“酸黄瓜酱”而回答“酸黄瓜酱”,分数就会保持在高位。
即使面对困难的问题,FilterRAG 也能保持高水平的真理计,这证明了它确实在使用找到的事实,而不是在编故事。
总结
FilterRAG 就像是给 AI 在考试期间提供了一份“小抄”(搜索引擎)。与其依赖自己错误的记忆去猜测关于热狗或摩托车的棘手问题的答案,它会去可靠的数据库中查找答案。这阻止了它自信地说错话,使其在遇到从未见过的现实情况时更加安全、更加可靠。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。