← 最新论文
💬 NLP

InterChart: Benchmarking Visual Reasoning Across Decomposed and Distributed Chart Information

本文介绍了 InterChart,这是一个旨在评估视觉语言模型在多个相关图表间进行推理能力的诊断基准,该基准揭示出尽管当前最先进模型在分解后的视觉任务上表现有所提升,但在跨图表整合和复杂多步推理方面仍存在显著困难。

原作者: Anirudh Iyengar Kaniyar Narayana Iyengar, Srija Mukhopadhyay, Adnan Qidwai, Shubhankar Singh, Dan Roth, Vivek Gupta

发布于 2026-05-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Anirudh Iyengar Kaniyar Narayana Iyengar, Srija Mukhopadhyay, Adnan Qidwai, Shubhankar Singh, Dan Roth, Vivek Gupta

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名侦探,试图解开一个谜团,但你不能只查看一条线索,而必须同时审视三张不同的地图、一份天气报告和一份股票行情,才能找出答案。这正是INTERCHART为人工智能设定的挑战。

以下是用日常类比对该论文内容的简要拆解。

核心问题:人工智能擅长单项任务,拙于多项任务

当前的人工智能模型(称为视觉 - 语言模型)就像那些擅长阅读单页教科书并回答相关问题的学生。如果你给他们看一张图表(例如销售柱状图),他们通常能告诉你最高的数值是多少。

但在现实世界中,数据很少仅由一张图表构成。科学家、银行家和记者经常使用多张图表结合的方式来讲述一个故事。一张图表可能显示温度,另一张显示冰淇淋销量,第三张显示降雨量。要理解全貌,你必须将它们之间的关联点连接起来。

该论文指出,当前的人工智能模型在“连接关联点”这项任务上表现极差。当它们必须同时查看两张或三张不同的图表并推断它们之间的关系时,就会陷入混乱。

解决方案:为人工智能打造的新“健身房”(INTERCHART)

研究人员建立了一个名为INTERCHART的新测试平台。你可以将其想象为一个拥有三个不同难度等级的健身房,旨在测试人工智能处理复杂视觉谜题的能力。

等级 1:“分解式”热身(DECAF)

  • 类比:想象一个堆满玩具的杂乱房间。在这一等级中,研究人员将这个杂乱的房间整理成整齐、独立的盒子。
  • 测试内容:他们将复杂的图表拆解为简单的、单变量的部分。他们向人工智能提出简单的问题,例如:“这条特定线上的数字是多少?”
  • 结果:人工智能在这里表现相当不错。当信息清晰且分离时,人工智能能够找到事实。

等级 2:“合成式”中间地带(SPECTRA)

  • 类比:现在,想象同一城市的两张不同地图,一张用蓝色绘制,另一张用红色绘制。它们展示的是相关的事物(如交通和天气),但外观不同。
  • 测试内容:人工智能必须查看两张相关的图表(例如,“降雨如何影响交通?”),但它们以不同的风格绘制。它必须意识到第一张图表上的“降雨”与第二张图表上的“降水”是匹配的。
  • 结果:人工智能开始踉跄。它难以意识到这两张外观不同的图表实际上是在谈论同一件事。

等级 3:“现实世界”Boss 战(STORM)

  • 类比:这是最难的等级。想象你正在阅读一篇报纸文章,其中包含三张来自不同年份、由不同人绘制、具有不同颜色和标签的图表。你必须找出贯穿所有这些图表的趋势。
  • 测试内容:这使用了来自互联网的真实图表(如经济报告)。图表杂乱无章,标签可能无法完美匹配,人工智能必须进行“时间旅行”式的推理(例如:"2015 年,A 国高于 B 国,但到了 2020 年,它们互换了位置。这期间发生了什么?”)。
  • 结果:人工智能的性能崩溃。即使是最聪明的模型也会感到困惑。它们无法应对这种混乱,也无法在不同视觉风格之间建立联系。

来自“健身房”的关键发现

  1. 简化有帮助:论文发现,如果在询问人工智能之前,将杂乱的图表转换为简单的文本表格(如电子表格),人工智能会变得更聪明。这就像给侦探提供一份书面线索清单,而不是一堆杂乱的照片。人工智能喜欢表格;它讨厌杂乱的图像。
  2. 步骤越多 = 越困惑:人工智能需要执行的步骤越多(例如,“查看图表 A,然后查看图表 B,然后比较它们,最后推测未来”),它失败的可能性就越大。
  3. 真实与虚假:人工智能在由计算机生成的“虚假”图表(整齐且完美)上进行推理时表现尚可,但在来自新闻的“真实”图表(杂乱且不完美)上则表现糟糕。这意味着人工智能并没有真正学会推理;它只是记住了来自干净数据的模式。
  4. “裁判”问题:研究人员还意识到,简单地检查人工智能的答案是否与正确答案逐字匹配是不公平的。如果答案是"25%",而人工智能说是“大约四分之一”,计算机可能会判定为“错误”,但人类会判定为“正确”。因此,他们使用其他人工智能作为“裁判”,来检查含义是否正确,而不仅仅是拼写。

结论

该论文得出结论:虽然人工智能在查看图片方面有所进步,但在综合来自多个杂乱来源的信息方面仍然非常糟糕。这就像一个学生能完美地阅读单个句子,但当被要求写一篇文章连接三本不同的书时,却会失败。

INTERCHART基准是一个工具,用于向研究人员确切展示这些人工智能模型在哪里以及为什么失败,以便他们能构建出更好的模型,以应对现实世界中杂乱、多图表的复杂情况。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →