← 最新论文
💬 NLP

DIAGRAMS: A Review Framework for Reasoning-Level Attribution in Diagram QA

本文介绍了 DIAGRAMS,这是一个轻量级、基于模式的审查框架,它将界面逻辑与数据集格式解耦,以自动化并简化图表问答中推理级归因的创建,在实现高精确度和召回率的同时显著减少了人工标注工作量。

原作者: Anirudh Iyengar Kaniyar Narayana Iyengar, Tampu Ravi Kumar, Manan Suri, Raviteja Bommireddy, Dinesh Manocha, Puneet Mathur, Vivek Gupta

发布于 2026-05-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Anirudh Iyengar Kaniyar Narayana Iyengar, Tampu Ravi Kumar, Manan Suri, Raviteja Bommireddy, Dinesh Manocha, Puneet Mathur, Vivek Gupta

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何阅读复杂的地图、电路图或科学图表。如果你问机器人:“哪个州与加利福尼亚州接壤?”它回答“内华达州”,你可能会觉得它很聪明。但它如何知道的?它是真的查看了地图,还是仅仅根据“加利福尼亚”这个词猜出来的?

这正是论文DIAGRAMS试图解决的问题。

问题:“魔法盒子”与“完整旅程”

目前,当人类教计算机回答关于图表的问题时,通常只会在最终答案周围画一个框。

  • 旧方法: 如果答案是“内华达州”,人类只会在内华达州周围画一个框。
  • 缺陷: 计算机学会了找到答案,却没有学会到达答案所经历的旅程。它可能忽略了相邻的州或地图图例,导致出现“幻觉”,即出于错误的原因猜对了答案。

该论文认为,我们需要推理级归因。这意味着我们需要在计算机解决谜题所需的每一个步骤周围画框。要回答“谁与加利福尼亚州接壤?”,计算机需要看到:

  1. 加利福尼亚州的轮廓。
  2. 内华达州的轮廓。
  3. 它们接触的边界线。
  4. 解释颜色含义的图例。

挑战:杂乱的厨房

手动创建这些“旅程地图”是一场噩梦。

  • 混乱: 每个数据集(图表、地图、电路)的格式都不同。这就像试图做一顿饭,其中一份食谱用“杯”计量,另一份用“克”,第三份用“一把”。
  • 成本: 标注人员(人类)必须为每个问题从头开始花费数小时画框。这既缓慢、昂贵,又枯燥。

解决方案:"DIAGRAMS"框架

作者开发了一个名为DIAGRAMS的工具。把它想象成一个智能副厨,在人类主厨踏入厨房之前就已经完成了繁重的准备工作。

以下是它的工作原理,使用一个简单的类比:

1. 通用翻译器(元模式)

想象你有用五种不同语言写成的食谱。与其学习所有五种语言,不如拥有一个翻译器,能瞬间将所有内容转换为一种标准格式。

  • 在论文中: DIAGRAMS 从各种数据集中提取杂乱、不同的数据格式,并将它们转换为一种干净的内部“语言”(元模式)。这意味着该工具可以在图表、地图和电路上运行,而无需为每一种重新构建。

2. 智能副厨(AI 提案)

系统不再要求人类从头开始画每一个框,而是使用多模态 AI(一个既能看又能读的机器人)来提出:“嘿,我认为这些是你回答问题所需查看的部分。”

  • 神奇之处: AI 高亮显示相关区域(如两个州之间的边界),并向人类提出建议。
  • 人类的角色: 人类不画框;他们审查。他们查看 AI 的建议,然后说“是的,没错”、“不,删除那个”或“加上这个我漏掉的”。

3. “先审查”工作流程

这是核心创新。

  • 旧方法: 人类画 100 个框。(艰苦的工作)。
  • DIAGRAMS 方法: AI 建议 90 个框。人类检查它们,修正 5 个,并添加 5 个。(轻松得多的工作)。

结果:它奏效了吗?

团队在六种不同类型的图表(图表、地图、电路等)上测试了这一点。

  • 得分: AI 的建议准确率(Precision)为 85%,并捕捉到了75% 的必要部分(Recall)
  • 要点: AI 不仅仅是随机猜测。它正确识别了解决问题所需的大部分视觉线索。
  • 效率: 由于 AI 完成了大部分“绘图”工作,人类只需修正或添加一小部分框。在某些数据集(如 AI2D)中,AI 几乎完美(99% 的准确率)。在更棘手的数据集(如复杂图表)中,它仍然非常有用,尽管人类需要多做一点工作。

为什么这很重要

该论文声称,通过转向这种“先审查”的方法:

  1. 我们获得了更好的数据: 我们现在拥有了显示完整推理路径的训练数据,而不仅仅是最终答案。这有助于训练更聪明的 AI,使其不再仅仅依靠猜测。
  2. 我们节省了时间: 人类花更少的时间画框,花更多的时间验证逻辑。
  3. 我们可以重用工具: 由于该系统转换了不同的数据格式,研究人员无需为遇到的每种新类型图表都构建一个新工具。

简而言之

DIAGRAMS 是一个工具,它阻止人类成为“画框者”,并将他们转变为“质量控制检查员”。它利用 AI 来承担寻找图表相关部分的繁重工作,使人类能够快速验证和完善工作。这为教计算机真正理解视觉推理创建了一份质量高得多的“操作手册”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →