Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models
该论文介绍了“Blind-Spots-Bench”,这是一个由 235 个对人类简单但对 AI 具有挑战性的任务组成的新型基准测试,它揭示了闭源模型与开源权重模型之间显著的性能差距,同时凸显了现有基准测试未能检测到的当前多模态系统所存在的持续弱点。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在玩一款电子游戏,AI 最终 Boss 刚刚击败了你曾经通关过的每一个关卡。它打破了高分纪录,解开了比计算器还快的数学谜题,甚至写出了能让你落泪的诗篇。你会想:“好吧,这个 AI 简直是个超级天才。”但紧接着,你问它一个简单的问题:“你能画一只恰好有五条腿的狗吗?”或者“写一个正好是 31 个字符长度的句子。”
突然间,这个超级天才 AI 就把自己绊了个跟头。它画了一只六条腿的狗,或者写了一个 32 个字符长的句子。这就像一位世界级的国际象棋冠军,却突然忘了怎么系鞋带。
这正是 EPFL 的研究人员通过他们的新测试——blind-spots-bench(盲点基准测试)所发现的情况。他们不仅仅关注这些 AI 模型在大家常谈论的那些宏大、华丽的考试中表现如何,而是创建了一个由 235 个微小且棘手的任务组成的“压力测试”。这些任务对人类来说极其简单,但似乎会让最先进的 AI 也栽跟头。
“盲点”的发现
研究团队从一门研究生级别的 AI 课程的学生那里收集了这些刁钻的问题。学生们被要求找出那些在 2025 年末最聪明的 AI 聊天机器人无法做对的具体事项。他们对问题进行了清理,并建立了一套自动评分系统。
当他们进行测试时,发现了几个令人惊讶的现象:
1. “富家子弟”的优势
论文指出,那些昂贵的、“闭源”的模型(即你无法下载并自行运行的模型)在处理这些盲点方面,明显优于“开源权重”的模型(即任何人都可以使用的模型)。即使两类模型在常规基准测试中的得分看起来差不多,闭源模型在这一特定压力测试中的表现仍比开源模型高出约 10%。这就像两个在跑道上看起来一样快的跑步者,但当你要求他们在玩杂耍的同时穿过迷宫时,那个装备更昂贵的选手赢了。
2. 规模并不总是意味着更好
你可能会认为,通过增加 AI 模型的规模(增加“脑力”)就能解决这些愚蠢的错误。但论文测量了这一点,并发现规模化并不总是有帮助的。在某些情况下,较小的模型版本实际上比它的巨型兄弟表现得更好。例如,在 Qwen3.5 系列中,350 亿参数的模型在某些逻辑谜题上的表现有时甚至超过了 3970 亿参数的庞然大物。这就像一只巨大的象可能难以通过一扇小门,而一只猫却能轻松溜过去。
3. 工具并不能解决所有问题
有些人想:“如果 AI 不会数数,那我们就给它一个计算器!”研究人员通过让模型使用代码执行工具来测试这一点。结果喜忧参半。对于某些模型来说,使用工具有助于得出正确答案并节省时间;但对于其他模型(如 GPT-5.4)来说,使用工具反而让它们表现得更差了。这就像给一位厨师一把精美的崭新菜刀;有时他们切得更快了,但有时他们却切到了自己的手指,毁掉了整顿饭。
4. “计数”危机
论文测量的最大盲点之一是计数。无论是数图片中的物体,还是生成一张包含特定数量物品的图像,这些模型都表现得很吃力。即使是最优秀的模型,也只能在这些计数任务中取得约 60% 的正确率。这是一个持续存在的弱点,就像一位能演奏复杂交响乐的音乐家,却连简单的 4/4 拍节奏都跟不上。
这项测试“没说”什么
作者们非常谨慎,没有过度夸大他们的研究结果。他们明确表示,这并不是一个证明“AI 彻底坏掉”的“最终 Boss”测试。他们承认数据集相对较小(仅 235 个问题),且是由学生创建的,这意味着它可能偏向于当时所测试的 AI 模型的特定弱点。他们还指出,他们没有包含人类基准来进行直接的分数对比,因此我们不知道人类到底“好”多少,只知道人类觉得这些任务是轻而易举的。
总结
论文表明,虽然 AI 在通用任务方面变得极其出色,但在非常具体、具象的技能(如计数、空间推理和遵循严格的字符限制)上仍然存在“盲点”。闭源模型目前在修复这些盲点方面保持着微弱的领先地位,但还没有任何一个模型能完全掌握它们。
不要把 blind-spots-bench 看作是一份宣告“AI 失败了”的成绩单,而要把它看作是一个诊断工具。它就像一名技工在对一辆在高速公路上行驶完美、但在经过停车标志时会熄火的汽车进行专项检测。它帮助我们看清引擎在哪里熄火,从而让我们能够修复它,而不是仅仅因为车速很快就假设它完美无缺。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。