想象一下你是一名正在试图破解谜团的侦探,但你的线索并非来自犯罪现场,而是隐藏在一幅画中。这就是**人工智能视觉(AI vision)**的世界——计算机科学的一个分支,在这里,机器学习如何像人类一样“看”并理解图像。长期以来,科学家们一直用简单的图片谜题来测试这些 AI 侦探:“篮子里有几个红苹果?”或者“这是猫还是狗?”这些测试就像是“辅助轮”;它们帮助 AI 学习基础知识。但在现实世界中,专业人士——比如检查病人心跳的医生、设计桥梁的工程师或观察股市的交易员——观察的并不是简单的图片。他们观察的是复杂的、凌乱的图表,这些图表需要深厚的专业知识才能解读。一个大问题是:我们最聪明的 AI 侦探真的能解决这些现实世界的谜题吗?还是它们仅仅擅长玩这些“辅助轮”游戏?
这篇题为**《Chartography》**的论文决定通过构建一个专门针对专业图表的新型、超难测试来寻找答案。作者团队来自 Surge AI,他们意识到旧的测试过于简单且已经“饱和”,这意味着最顶尖的 AI 模型得分已经达到 90% 或更高,导致无法分辨谁才是真正的最强者。因此,他们创建了一个新的挑战:包含 100 项任务,涵盖了医学、金融和工程等领域专家使用的真实图表。他们不仅仅是让 AI 进行猜测;他们邀请了真正的领域专家来编写问题并验证答案,以确保测试既公平又严苛。
结果令人震惊。即使是最先进的 AI 模型,在应对这些容易的测试时通常表现出色,但在面对这个新测试时却表现得非常糟糕。表现最好的模型也仅答对了 45.0% 的题目,而其他模型的得分则在 9.0% 到 39.5% 之间。事实证明,虽然这些 AI “超级大脑”擅长推理和逻辑,但在实际“观察”图表细节方面却表现得异常糟糕。它们可能会漏掉一条细线,误读一个棘手坐标轴上的数字,或者无法理解专业人士用来解读数据的隐藏规则。
研究人员发现,让 AI “思考得更努力”或花更多时间进行推理并不总是有效。事实上,有时 AI 会卡在一个错误的视觉细节上,然后利用其强大的推理能力,自信满满地解释为什么那个错误的细节是正确的。这就像一个侦探在现场看到了一只红色的鞋子,感到困惑后,竟然写出了一份精彩的 10 页报告,证明那只红色的鞋子属于嫌疑人,尽管那只鞋其实是蓝色的。
论文得出结论,虽然 AI 在理解图表方面正在进步,但要达到能够被医生或工程师信任并用于做出现实决策的程度,还有很长的路要走。“Chartography”基准测试现在已向所有人开放,作为一个严苛的新障碍,它将帮助开发者构建出不仅会“猜”,而且能真正“看”并理解复杂专业数据的 AI。