← 最新论文
💬 NLP

DRAGON: A Benchmark for Evidence-Grounded Visual Reasoning over Diagrams

本文介绍了 DRAGON,这是一个基准数据集和评估框架,旨在评估视觉语言模型将答案锚定在图表中特定视觉证据上的能力,以解决高准确率却缺乏可靠推理依据的局限性。

原作者: Anirudh Iyengar Kaniyar Narayana Iyengar, Tampu Ravi Kumar, Gaurav Najpande, Manan Suri, Dinesh Manocha, Puneet Mathur, Vivek Gupta

发布于 2026-04-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Anirudh Iyengar Kaniyar Narayana Iyengar, Tampu Ravi Kumar, Gaurav Najpande, Manan Suri, Dinesh Manocha, Puneet Mathur, Vivek Gupta

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在参加一场考试,需要观察一张复杂的图表——比如地图、电路板或条形图——并回答关于它的问题。

在过去,如果计算机程序(人工智能)给出了正确答案,我们便认为它“理解”了这张图。但这篇名为DRAGON的新论文指出,仅给出正确答案是不够的。人工智能可能在“作弊”。它可能只是根据问题中的词语或数据中的模式来猜测答案,而没有真正查看图中能证明答案正确的具体部分。

这就好比一名学生参加数学考试。

  • 旧方式:如果学生写下"42"作为答案,老师就会打勾。我们不知道他是真的做了计算,还是仅仅猜对了。
  • DRAGON 方式:老师要求查看学生的解题过程。学生必须圈出他们使用的具体数字,画出指向公式的箭头,并高亮显示图表中推导出"42"的部分。如果他们无法指出证据,即使最终数字正确,他们也没有真正解决问题。

什么是 DRAGON?

DRAGON是一项新的“测试”(基准),旨在揪出那些靠猜测的人工智能模型。它提出了一个简单却困难的问题:“请明确指出你在图中的哪个位置找到了答案。”

要通过这项测试,人工智能必须围绕其使用的具体视觉线索画出方框。这些线索可能包括:

  • 图表上的特定条形。
  • 地图上的标签。
  • 电路图中的导线。
  • 图例或标题。

他们如何构建这项测试

研究人员并没有仅仅让人工智能去猜测;他们建立了一个包含 11,000 多个问题的庞大库,这些问题源自六种不同类型的图表(图表、地图、电路图等)。

对于每一个问题,人类充当了“真相讲述者”的角色。他们查看图表和正确答案,然后围绕证明该答案所需的视觉证据画出精确的方框。

  • 类比:想象一名侦探在侦破案件。人类标注者就是那些指出“线索不仅仅是整个房间;线索是地板上这个特定的泥泞脚印"的人。然后,人工智能必须找到那个相同的脚印。

他们询问人工智能的三种方式

研究人员尝试了三种不同的“提示”(即要求人工智能执行任务的方式),以观察它是否能学会展示解题过程:

  1. EDGE(直接法):“这是图片和答案。只需围绕证据画出方框。”(就像要求学生只写答案)。
  2. SAGE(分步法):“首先,告诉我你需要查看什么(例如,‘红色条形’和'2020 年’)。然后,围绕它们画出方框。”(就像要求学生在解题前列出步骤)。
  3. VERGE(自我修正法):“画出你的方框。现在,再次查看你的绘图。你是否漏掉了什么?你的方框是否太大了?修正它。”(就像要求学生复查作业)。

他们的发现(结果)

结果让人工智能界受到了一次警醒:

  • 人工智能擅长猜测,拙于证明:许多人工智能模型给出了正确答案,但当被要求画出方框时,它们惨败。它们经常指向图像的错误部分,或遗漏关键细节。
  • “黑盒”问题:即使是最聪明的人工智能模型(如 Claude Opus 或 Gemini)也难以展示其解题过程。它们可以说“答案是 50",但却无法可靠地在图表上指出那个"50"。
  • 某些模型优于其他模型:“闭源”模型(来自 Anthropic 和 Google 等公司的昂贵大型模型)在寻找证据方面比开源模型做得更好,但没有一个是完美的
  • 礼貌询问略有帮助:使用分步法(SAGE)或自我修正法(VERGE)能让人工智能更频繁地找到正确位置,但这并未解决根本问题。人工智能仍然经常遗漏部分证据。

为什么这很重要

该论文得出结论,我们不能仅因为人工智能给出了正确答案就信任其对图表的推理能力。如果人工智能被用于分析医疗图表、金融图表或安全图表,我们需要知道它为何做出该决定。

DRAGON是一项迫使人工智能停止猜测、开始“展示解题过程”的工具。它是一项新标准,旨在确保当人工智能声称它理解一张图时,它实际上能够指出证明。

局限性

作者承认他们的测试并不完美。他们使用简单的矩形框来标记证据。这对于标记粗大的条形或区块很有效,但很难用方框来标记电路图中细长的蜿蜒导线或地图上的弯曲箭头。此外,有时不同的人类可能会就图片中哪部分是“最重要”的线索产生分歧,这为测试增加了一点主观性。

简而言之:DRAGON是一套新规则,它要求:“不要只给我答案;向我展示图片中的证据。”而目前,大多数人工智能学生在这项测试中不及格。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →