← 最新论文
🤖 AI

SciEGQA: A Dataset for Scientific Evidence-Grounded Question Answering and Reasoning

本文提出了 SciEGQA 数据集,通过引入细粒度语义证据定位(边界框标注),解决了现有科学文档视觉问答基准缺乏可解释性和可靠性的问题,并包含人工标注基准与大规模自动构建训练集以提升视觉语言模型的推理能力。

原作者: Wenhan Yu, Zhaoxi Zhang, Wang Chen, Guanqiang Qi, Weikang Li, Lei Sha, Deguo Xia, Jizhou Huang

发布于 2026-03-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenhan Yu, Zhaoxi Zhang, Wang Chen, Guanqiang Qi, Weikang Li, Lei Sha, Deguo Xia, Jizhou Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 SciEGQA 的新项目,你可以把它想象成是给“人工智能”出了一套高难度的科学文献阅读理解考试,而且这套考试不仅考“答对没有”,还考“你是从哪本书、哪一页、哪一段找到的答案”。

为了让你更容易理解,我们可以用几个生活中的比喻来拆解这篇论文:

1. 核心痛点:以前的考试太“模糊”了

想象一下,你让一个学生(现在的 AI 模型)读一本厚厚的科学书,然后问他一个问题。

  • 以前的做法(Page-level):你只告诉他:“答案在第 5 页。”
    • 问题:第 5 页可能有密密麻麻的图表、公式和好几段文字。学生可能瞎蒙了一个答案,虽然蒙对了,但他根本不知道具体是第 5 页的哪句话告诉他的。这就像老师批改作业时只打勾,不圈出重点,学生学不到真本事。
  • 另一种做法(Token-level):你让他把答案对应的每一个字都圈出来。
    • 问题:有时候答案是一个完整的概念,比如“这个实验的结论”,如果只圈几个字,就把意思割裂了,就像把一块完整的蛋糕切得粉碎,反而看不出全貌。

这篇论文提出的新标准(SciEGQA)
我们要让学生把整块相关的证据圈出来。比如,把“包含结论的那一段话”或者“那张关键的图表”用一个框框住。这就像老师批改作业时,不仅打勾,还要用红笔把整段关键证据圈出来,确保学生真的读懂了逻辑。

2. 这个数据集(SciEGQA)是什么?

它是由两部分组成的“题库”:

  • 第一部分:精英小班(人工标注的基准测试)
    • 这是由人类专家(像大学教授和博士生)精心挑选的 80 篇科学论文,人工圈出了 1600 多道题的答案证据。
    • 比喻:这就像是一个奥林匹克竞赛,题目很难,标准很严,用来真正测试 AI 到底有没有“真才实学”。
  • 第二部分:魔鬼训练营(自动生成的训练集)
    • 为了让 AI 变强,他们写了一套程序,自动从 3600 多篇论文里“榨”出了 3 万多道题。
    • 比喻:这就像是一个AI 特训营,虽然题目是机器生成的,但数量巨大,能让 AI 通过大量的刷题来练肌肉。

3. 这个考试考什么?(三种难度)

这个数据集设计了三种越来越难的“找证据”模式:

  1. 单页单区 (SPSR):答案就在这一页的一个框里。
    • 比喻:在一页纸上,圈出那个写着答案的段落。
  2. 单页多区 (SPMR):答案需要结合这一页上的两个不同地方(比如一段文字 + 一个图表)。
    • 比喻:要把这一页上的“文字说明”和旁边的“数据图”拼起来才能得出答案。
  3. 跨页多区 (MPMR):答案分散在好几页纸上。
    • 比喻:就像侦探破案,线索散落在第 1 页的引言、第 3 页的图表和第 5 页的结论里,AI 必须把这些碎片拼起来。

4. 实验结果:AI 现在的水平如何?

论文测试了很多目前最厉害的 AI 模型(比如 Qwen, GPT 等),结果发现:

  • 现状:即使是顶尖的 AI,在科学文献里“找证据”的能力也很弱。它们经常能猜出答案,但找不到证据在哪里(就像学生蒙对了选择题,但不知道解题思路)。
  • 数据:在“圈出正确证据”这项任务上,最好的模型准确率也不到 40%。这意味着大部分时候,AI 是“瞎蒙”的。
  • 进步:但是,如果把 AI 放到这个“魔鬼训练营”(SciEGQA 训练集)里训练一下,它的表现就会显著提升。这说明只要给 AI 正确的“圈画重点”的方法,它就能学会如何像科学家一样思考。

5. 总结:这篇论文有什么用?

简单来说,这篇论文做了一件大事:
它给 AI 界立了一个新规矩。以前我们只在乎 AI 答没答对,现在我们要看它能不能找到支撑答案的证据

  • 对普通人:这意味着未来的 AI 在回答科学问题时,不仅能告诉你“是什么”,还能像老师一样,把书翻到那一页,把关键句子圈出来给你看,让你知道它不是瞎编的。
  • 对科研:它提供了一个“磨刀石”,帮助科学家把 AI 训练得更聪明、更靠谱,特别是在处理复杂的科学文档时。

一句话总结
SciEGQA 就像给 AI 发了一本带“标准答案圈注”的科学书,强迫它不仅要背下答案,还要学会指认证据,从而让它从“只会猜谜的鹦鹉”进化成“会查资料的科学家”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →