← 最新论文
💬 NLP

SciClaimEval: Cross-modal Claim Verification in Scientific Papers

本文提出了名为 SciClaimEval 的新数据集,该数据集通过修改支持性证据(如图表和表格)而非直接篡改主张或依赖大语言模型来生成真实的反驳样本,并包含跨模态证据及专家标注,旨在评估多模态基础模型在科学论文主张验证任务中的能力,结果显示当前模型在处理基于图表的验证时仍面临巨大挑战。

原作者: Xanh Ho, Yun-Ang Wu, Sunisth Kumar, Tian Cheng Xia, Florian Boudin, Andre Greiner-Petter, Akiko Aizawa

发布于 2026-02-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Xanh Ho, Yun-Ang Wu, Sunisth Kumar, Tian Cheng Xia, Florian Boudin, Andre Greiner-Petter, Akiko Aizawa

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 SciClaimEval 的新工具,它的核心任务就像是给科学论文做“真假侦探”。

想象一下,科学界是一个巨大的图书馆,里面堆满了成千上万篇论文。每篇论文里,作者都会说:“看!我的实验证明了 A 导致了 B!”(这就是主张/Claim)。为了证明这话是真的,他们通常会展示一些图表或数据表格(这就是证据/Evidence)。

过去,科学家和审稿人需要人工去核对:“作者说的 A 导致 B,真的能从这张图里看出来吗?”但随着人工智能(AI)的爆发,论文数量爆炸式增长,人工核对忙不过来了。大家希望 AI 能帮忙,但现有的 AI 在“看图说话”和“查表找茬”方面还不够聪明。

为了解决这个问题,作者们造了一个新的“训练场”——SciClaimEval

1. 这个“训练场”有什么特别之处?

以前的训练场(数据集)就像是用乐高积木搭出来的假房子,虽然像那么回事,但细节经不起推敲。SciClaimEval 则完全不同,它有三个“独门秘籍”:

  • 全是“真家伙” (Authentic Claims)
    以前的数据集里,很多“假话”是专家为了测试 AI,故意把真话改得通不通顺(比如把“成功”改成“失败”)。这就像老师为了考学生,故意把数学题里的数字改错,学生只要看到数字变了就知道是错的,这太取巧了。
    SciClaimEval 的做法是:所有的“真话”和“假话”都直接来自真实的已发表论文。
  • “移花接木”造假话 (Evidence Modification)
    这是最精彩的部分。作者们没有去改作者写的文字(比如把“成功”改成“失败”),而是去改证据本身
    • 比喻:想象作者画了一张图说“我的药让老鼠跑得快”。为了测试 AI,我们不是把这句话改成“药让老鼠跑得慢”,而是偷偷把图里的老鼠腿画短了,或者把表格里的数据填错了
    • 这样,AI 必须真的去“看”图、“读”表,发现数据变了,才能判断出原来的话是错的。这就像侦探破案,不是靠猜,而是靠发现证据链里的微小破绽。
  • 多面手证据 (Cross-modal)
    这个数据集不仅包含文字,还包含图片(图表)和表格。而且表格非常贴心,既有图片版(给人看的),也有代码版(LaTeX, JSON,给机器读的),就像给 AI 提供了多种视角的线索。

2. 他们是怎么做的?

整个过程就像是一个严谨的“流水线工厂”:

  1. 搜集原料:从医学、自然语言处理(NLP)和机器学习(ML)三个领域的真实论文中,把那些“文字 + 图表/表格”的配对找出来。
  2. 专家审核:请了一群懂行的研究生和专家当“质检员”。
    • 第一步:确认作者的原话是不是真的被图表支持了。
    • 第二步(关键):如果原话是真的,专家就动手修改图表。比如把柱状图的一根柱子拔高,或者把表格里的数字改小,让原本正确的结论变得“站不住脚”。
  3. 生成考题:最后,他们得到了 1600 多道“考题”。每道题都有两个版本:一个是“原版证据 + 真话”,一个是“被篡改的证据 + 同样的真话(此时变成了假话)”。

3. AI 表现如何?

作者们找了 11 个最厉害的 AI 模型(包括开源的和像 OpenAI o4-mini 这样的闭源大模型)来参加考试。结果很有趣:

  • 看图题(Figure)很难
    即使是世界上最聪明的 AI(o4-mini),在面对被篡改的图片时,也表现得很吃力。AI 经常看不出图片里细微的改动(比如坐标轴变了,或者图例换了)。这就像让 AI 去发现一张照片里被 P 掉的一根头发,目前 AI 还很容易“翻车”。
  • 看表题(Table)稍好,但仍有差距
    在处理表格时,AI 的表现好一些,尤其是闭源模型,已经接近人类专家的水平了。但是,如果用一种更严格的“成对测试”(要求 AI 必须同时认出哪张表是真的,哪张是假的,不能只蒙对一半),AI 还是容易露馅。
  • 开源 vs 闭源
    目前,像 o4-mini 这样的“商业闭源模型”还是比开源模型强不少,就像“专业侦探”比“业余爱好者”更敏锐。

4. 总结与意义

这篇论文就像是在科学界的 AI 训练场上,立起了一块新的“试金石”。

  • 以前:AI 做科学验证,像是在玩“找不同”的简单游戏,只要文字变了就能猜对。
  • 现在:SciClaimEval 把游戏升级成了“刑侦现场”,证据被精心篡改,AI 必须真正理解图表和数据的逻辑才能破案。

虽然现在的 AI 在“看图”方面还像个刚入门的实习生,离人类专家还有距离,但这个数据集为未来的 AI 发展指明了方向:要想让 AI 真正帮科学家审稿,它必须学会像人类一样,不仅读懂文字,更要能识破图表和数据中的“猫腻”。

这不仅是给 AI 出题,更是为了未来让 AI 成为科学家得力的“副驾驶”,帮助人类在浩瀚的科学海洋中,更快地发现真理,剔除虚假。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →