← 最新论文
💻 computer science

Chartography: A Benchmark for Professional Chart Understanding

该论文介绍了 Chartography,这是一个包含 100 个在特定领域图表格式下经过专业策划的任务的新基准,它揭示了当前前沿模型在执行复杂视觉推理和遵循领域惯例方面的显著局限性,其顶尖配置的准确率仅为 45%,而现有基准的准确率则达到了 80-90% 的饱和水平。

原作者: Suhaas Garre, Chris Mutty, Sushant Mehta, Edwin Chen

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Suhaas Garre, Chris Mutty, Sushant Mehta, Edwin Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名正在试图破解谜团的侦探,但你的线索并非来自犯罪现场,而是隐藏在一幅画中。这就是**人工智能视觉(AI vision)**的世界——计算机科学的一个分支,在这里,机器学习如何像人类一样“看”并理解图像。长期以来,科学家们一直用简单的图片谜题来测试这些 AI 侦探:“篮子里有几个红苹果?”或者“这是猫还是狗?”这些测试就像是“辅助轮”;它们帮助 AI 学习基础知识。但在现实世界中,专业人士——比如检查病人心跳的医生、设计桥梁的工程师或观察股市的交易员——观察的并不是简单的图片。他们观察的是复杂的、凌乱的图表,这些图表需要深厚的专业知识才能解读。一个大问题是:我们最聪明的 AI 侦探真的能解决这些现实世界的谜题吗?还是它们仅仅擅长玩这些“辅助轮”游戏?

这篇题为**《Chartography》**的论文决定通过构建一个专门针对专业图表的新型、超难测试来寻找答案。作者团队来自 Surge AI,他们意识到旧的测试过于简单且已经“饱和”,这意味着最顶尖的 AI 模型得分已经达到 90% 或更高,导致无法分辨谁才是真正的最强者。因此,他们创建了一个新的挑战:包含 100 项任务,涵盖了医学、金融和工程等领域专家使用的真实图表。他们不仅仅是让 AI 进行猜测;他们邀请了真正的领域专家来编写问题并验证答案,以确保测试既公平又严苛。

结果令人震惊。即使是最先进的 AI 模型,在应对这些容易的测试时通常表现出色,但在面对这个新测试时却表现得非常糟糕。表现最好的模型也仅答对了 45.0% 的题目,而其他模型的得分则在 9.0%39.5% 之间。事实证明,虽然这些 AI “超级大脑”擅长推理和逻辑,但在实际“观察”图表细节方面却表现得异常糟糕。它们可能会漏掉一条细线,误读一个棘手坐标轴上的数字,或者无法理解专业人士用来解读数据的隐藏规则。

可以这样理解:你可能有一个数学天才朋友,能在脑海中解出复杂的方程。但如果你递给他一张带有模糊蜿蜒路径的地图,并让他寻找一个特定的地点,他可能会迷路,因为他看不清纸上的线条。这就是这里发生的情况。AI 可以完美地进行数学计算,但它总是在视觉细节上栽跟头。

研究人员发现,让 AI “思考得更努力”或花更多时间进行推理并不总是有效。事实上,有时 AI 会卡在一个错误的视觉细节上,然后利用其强大的推理能力,自信满满地解释为什么那个错误的细节是正确的。这就像一个侦探在现场看到了一只红色的鞋子,感到困惑后,竟然写出了一份精彩的 10 页报告,证明那只红色的鞋子属于嫌疑人,尽管那只鞋其实是蓝色的。

论文得出结论,虽然 AI 在理解图表方面正在进步,但要达到能够被医生或工程师信任并用于做出现实决策的程度,还有很长的路要走。“Chartography”基准测试现在已向所有人开放,作为一个严苛的新障碍,它将帮助开发者构建出不仅会“猜”,而且能真正“看”并理解复杂专业数据的 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →