← 最新论文
🤖 AI

TIGER: Traceable Inference with Graph-Based Evidence Routing for Mitigating Hallucinations in Multimodal Generation

TIGER 是一个推理时框架,它通过独立构建观察图和主张图,利用冻结的骨干网络来识别并修复高风险的未支持事实,从而在减轻多模态生成中幻觉现象的同时,减少无根据的内容并保持各种跨模态任务的任务质量。

原作者: Kaixiang Zhao, Tianrun Yu, Shawn Huang, Porter Jenkins, Yushun Dong, Amanda Hughes

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Kaixiang Zhao, Tianrun Yu, Shawn Huang, Porter Jenkins, Yushun Dong, Amanda Hughes

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位才华横溢但有点分心的艺术家(AI 模型)。你给他们看一张宁静湖泊和两只鸭子的照片,并请他们写一段描述。艺术家写出了一段优美、流畅的段落,但在中间,他们不小心声称那里有三只鸭子,而且附近还有一艘船,尽管照片中既没有第三只鸭子也没有船。

这被称为“幻觉”(Hallucination)。故事听起来很动人,但事实是错误的。

这篇论文介绍了一种名为 TIGER(基于图证据路由的可追溯推理)的新系统,旨在不解雇艺术家或重新训练他们的情况下修复这些错误。以下是它的工作原理,使用简单的类比:

问题所在:“回声室”效应

以往的方法试图通过让艺术家“评价自己的作品”来修复这些错误。他们会将照片和错误的段落一起展示给艺术家,然后问道:“这看起来对吗?”

论文指出这是一个坏主意。因为艺术家在看照片的同时也在看自己错误的段落,错误的观点(比如“那艘船”)会误导他们的思维。他们可能会想:“噢,我看到水里有一艘船!”即使那只是一个倒影,因为他们自己的文本首先暗示了它的存在。这就像是在阅读你刚刚写的文章时试图进行事实核查;你可能会不自觉地让自己相信那个谎言是真的。

TIGER 的解决方案:“两队协作”策略

TIGER 改变了过程,让艺术家在检查事实时永远不会看到自己的错误。它扮演着一个严格编辑的角色,执行一个两步走的流程:

第一步:独立的核查员
TIGER 不是要求艺术家评价整个故事,而是将照片发给一个团队,将故事发给另一个完全不同的团队。

  • A 队(输入团队): 只看照片,并写出一份硬性事实清单:“两只鸭子”、“水”、“没有船”。他们制作了一张“事实图谱”。
  • B 队(输出团队): 只看故事,并写出一份主张清单:“三只鸭子”、“船”、“水”。他们制作了一张“主张图谱”。

因为 A 队从未见过故事,所以他们不会受到影响。他们是纯粹客观的。

第二步:风险评分
现在,TIGER 将这两张图谱结合在一起。它将故事中的每一项主张与照片中的事实进行对比。

  • “两只鸭子”对比“三只鸭子”?高风险。
  • “水”对比“水”?低风险。
  • “船”对比“没有船”?高风险。

TIGER 给故事中的每一句话都打上一个“风险分”。它不只是说“这不对”;它会说“这句话有 90% 的概率是谎言”。

第三步:针对性手术
与其重写整个故事(这可能会破坏好的部分),TIGER 只会将高风险的句子发回给艺术家。它会说:“你提到有三只鸭子和一艘船。请再看一眼照片。仅修正这两处地方。”

艺术家只修复这些特定的点,而其余优美的故事则保持原样。

为什么这更好

  • 无偏见: 通过将照片检查与故事检查分离,系统阻止了错误自我强化的“回声室”效应。
  • 精准: 它不靠猜测来决定修复哪些部分;它使用数学方法对哪些事实是危险的进行排名。
  • 高效: 它只投入精力去修复损坏的部分,而不是整个故事。

它有效吗?

作者在许多不同的任务上测试了 TIGER:

  • 图像转文本: 描述照片。
  • 音频转文本: 总结音频剪辑。
  • 视频转文本: 描述电影场景。
  • 危机报告: 一个现实世界的测试,他们需要汇总来自 Twitter、Facebook 和照片关于一场飓风的新闻。

在所有这些测试中,TIGER 都成功地移除了虚假事实(如多出来的鸭子或不存在的船),同时保持了故事的流畅性和准确性。即使在输入数据混乱且充满噪声的情况下(如飓风案例研究),它也表现出色。

简而言之: TIGER 就像一位聪明的编辑,它将“证据”与“草稿”分离,为错误评分,并只要求作者修改特定的谎言,从而确保最终的故事既优美又真实。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →