← 最新论文
💬 NLP

ReFACT: A Benchmark for Scientific Confabulation Detection with Positional Error Annotations

该论文提出了基于 Reddit 数据构建的 ReFACT 基准,通过专家标注揭示了大型语言模型在科学事实检测中存在“显著干扰”主导的失败模式及规模扩展无法解决的语义接地缺陷,并指出比较判断反而比独立检测更难,从而挑战了“LLM 作为裁判”范式在科学事实性评估中的可靠性。

原作者: Yindong Wang, Martin Preiß, Margarita Bugueño, Jan Vincent Hoffbauer, Abdullatif Ghajar, Tolga Buz, Gerard de Melo

发布于 2026-04-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Yindong Wang, Martin Preiß, Margarita Bugueño, Jan Vincent Hoffbauer, Abdullatif Ghajar, Tolga Buz, Gerard de Melo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是一份**“科学打假侦探报告”**。

想象一下,你正在看一本非常厚、写得很漂亮的百科全书。里面的文字通顺流畅,用词高大上,读起来让人觉得很专业。但是,如果你仔细推敲,会发现里面藏着一些**“看似有理,实则胡扯”**的科学错误。

这就是大语言模型(LLM)经常犯的错误,作者称之为**“科学胡编乱造”(Scientific Confabulation)**。

这篇论文主要做了三件事:造了一个“陷阱题库”、测试了现在的 AI 侦探、并发现了一个令人震惊的“侦探盲区”。

1. 造了一个“科学陷阱题库” (ReFACT)

以前的测试题,要么是太简单(比如"1+1 等于几”),要么是 AI 自己瞎编的,一眼就能看出是假的。

为了真正测试 AI 能不能发现**“高智商的胡说八道”,作者们从 Reddit 的一个科学问答版块(r/AskScience)里,找来了 1000 多个由真人专家写的真实科学回答。然后,他们像“捉虫游戏”**一样,用两种方法把正确答案偷偷改坏:

  • 偷梁换柱:把"DNA"偷偷换成"RNA"(就像把“苹果”换成“梨”,虽然都是水果,但在做蛋糕时就是错的)。
  • 颠倒黑白:把“有 50% 的概率”改成“绝对没有概率”。

这些被改坏的回答,读起来依然非常通顺、专业,甚至看起来比原来的还像那么回事。这就构成了ReFACT基准测试——一个专门用来抓“科学骗子”的考场。

2. 让 AI 侦探们“捉鬼”

作者找来了 9 个目前最厉害的 AI 模型(包括 GPT-4o 和 Llama 3 等),让它们做三件事:

  1. 判断:这个回答是真是假?
  2. 定位:如果是假的,具体哪几个字是错的?
  3. 修正:把错的地方改回来。

3. 发现了两个惊人的“侦探盲区”

测试结果让人大跌眼镜,就像发现一个名侦探居然连最简单的线索都抓不住:

盲区一:只会被“显眼包”吸引(Salient Distractor)

这是最搞笑也最可怕的地方。
当 AI 试图找出错误时,它往往抓错了重点

  • 比喻:想象你在找一张桌子上的“红色苹果”。桌上有一个红色的苹果(这是真的),旁边还有一个红色的**“假苹果模型”**(这是 AI 胡编的)。
  • AI 的表现:AI 往往不去找那个真正有问题的“假苹果”,反而指着旁边那个看起来很酷、很专业的**“红色”**东西说:“错!这里有个红色的!”
  • 真相:AI 并不是在找“事实错误”,它只是在找**“看起来像科学术语的词”**。哪怕它指的地方和错误完全没关系,只要那个词听起来很“科学”(比如把"DNA"指成"RNA",或者指成“细胞”),它就觉得自己找对了。
  • 结论:不管 AI 的脑子(参数)从 10 亿个变大到 700 亿个,这个毛病都改不掉。这说明光靠把模型做大,并不能让它真正理解科学真理

盲区二:两两对比反而更晕(Comparative Judgment)

通常我们认为,如果给 AI 两个答案,让它选哪个是对的,应该比让它单独判断一个答案更容易。

  • 比喻:就像让你从两个长得像的人里挑出谁是双胞胎里的哥哥。
  • AI 的表现:结果发现,单独看一个答案时,AI 还能猜对;一旦把两个答案放在一起对比,AI 反而更糊涂了。它的准确率反而下降了。
  • 结论:这说明现在的 AI 并不具备真正的“逻辑推理”能力,它更多是靠“感觉”和“概率”在猜。当两个选项都看起来很像真的时候,它就彻底懵了。

4. 这对我们意味着什么?

这篇论文给现在的 AI 界泼了一盆冷水:

  • AI 当裁判不靠谱:现在很多研究让 AI 来给其他 AI 打分(LLM-as-Judge),认为 AI 能客观判断事实。但这篇论文证明,连最聪明的 AI 自己都分不清科学事实的真假,让它去当裁判,结果肯定是一团糟。
  • 光堆参数没用:以前大家觉得“模型越大越聪明”,但这篇论文证明,在科学事实这种需要“深度理解”的领域,单纯堆砌参数(变大)解决不了根本问题。

总结

这就好比我们造了一群**“只会背书的鹦鹉”**。它们能背诵整本百科全书,甚至能模仿专家的口吻写出完美的文章。但如果你问它:“这句话里哪个词是错的?”它可能会指着旁边一个看起来很专业的词说:“是这个!”

ReFACT 这个基准测试,就是专门用来戳破这些“鹦鹉”泡沫的,提醒我们:在科学真理面前,现在的 AI 还只是个容易走神、容易被表面现象迷惑的“差生”,离真正的“专家”还有很长的路要走。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →