How Well Does GPT-4o Understand Vision? Evaluating Multimodal Foundation Models on Standard Computer Vision Tasks
本文利用一种新颖的提示链框架,在标准计算机视觉任务上对 GPT-4o 等领先的多模态基础模型进行了基准测试,结果表明:尽管这些模型凭借强大的语义理解能力成为值得尊敬的通才,但在几何任务中仍落后于专用模型,并表现出特定的失效模式。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一群极其聪明、博览群书的图书管理员(即多模态基础模型或 MFMs,如 GPT-4o、Gemini 和 Claude)。这些图书管理员几乎读遍了互联网上的每一本书,并能用优美、诗意的细节描述图片。它们因回答诸如“这张照片里发生了什么?”或“为这只狗写一个故事”之类的问题而闻名。
但 EPFL 的研究人员提出了一个不同的问题:“这些图书管理员真的能胜任专业摄影师或 3D 建筑师的工作吗?”
为了找到答案,他们并没有仅仅让图书管理员进行闲聊,而是让它们接受了一系列通常专为专用计算机视觉机器人准备的严格技术考试。以下是他们的方法以及发现,以通俗易懂的方式解释。
挑战:“仅文本”问题
主要问题在于,这些 AI 模型被训练用于“交谈”,而非“绘制”或“测量”。如果你要求一台标准的视觉机器人“找到猫”,它会画一个框将其框住。如果你要求基于文本的 AI,它可能会说:“我看到一只猫。”
为了公平地测试它们,研究人员发明了一种名为“提示链(Prompt Chaining)”的翻译游戏。
- 类比:想象你被蒙住了眼睛,需要在巨大的图书馆里找到一本特定的书。你看不到,但你可以向向导提问。
- 方法:研究人员没有要求 AI“在猫周围画一个框”(因为它无法原生做到这一点),而是将任务分解为微小的、基于文本的步骤。他们问 AI:“左上角有猫吗?”“没有。”“中间有猫吗?”“有。”然后,“它在中间的上半部分吗?”“有。”
- 通过将这些微小的“是/否”问题串联起来,AI 最终构建出物体位置的地图,从而仅通过文本有效地“绘制”出框或掩膜。这使得研究人员能够在完全相同的任务上,将“交谈者”(通用模型)与“执行者”(专用模型)进行对比。
考试:他们测试了什么?
研究人员向模型提出了六种不同类型的测试,难度从易到难:
- 分类:“这是什么?”(例如识别斑马)。
- 目标检测:“斑马在哪里?”(在周围画一个框)。
- 分割:“哪些像素属于斑马?”(完美地给斑马上色)。
- 分组:“如果我点击斑马的耳朵,哪些其他像素属于同一只斑马?”
- 深度预测:“图像的哪一部分离相机更近?”(创建 3D 距离图)。
- 表面法线:“表面朝向哪个方向?”(这面墙是朝左、朝右、朝上还是朝下?)。
结果:“通才”与“专才”
1. 它们是出色的“通才”,但不是“专才”。
作为通才,AI 模型的表现令人惊讶地好。它们识别物体和理解整体场景的能力优于随机猜测。然而,它们仍然显著落后于专门为这些工作构建的专用机器人。
- 类比:AI 就像一位博学的全科医生,对万事万物略知一二。而专用模型则像神经外科医生。全科医生可以诊断头痛,但在进行脑部手术方面,他们无法像外科医生那样出色。
2. “语义”与“几何”之间的差距
模型在语义任务(理解事物是什么)方面远优于几何任务(理解事物在 3D 空间中的位置)。
- 它们可以轻松告诉你“那是一匹斑马”。
- 但它们很难告诉你“那匹斑马距离 5 米,且背部略微朝左”。
- 类比:它们擅长描述电影的剧情,但极不擅长绘制布景设计或计算爆炸的物理效果。
3. “视力模糊”问题
当研究人员尝试让 AI 绘制精确的轮廓时,模型往往难以处理细微的细节。就好像它们患有“视力模糊”症。
- 为了解决这个问题,研究人员不得不给 AI 提供图像的“放大”裁剪(就像通过放大镜看),以帮助它看清边缘。如果没有这种帮助,AI 的轮廓就会杂乱无章。
4. “推理”模型正在改变游戏规则
该论文测试了一种名为“推理模型”的新型 AI(如 o1、o3 和 o4-mini)。这些模型在回答之前会花额外的时间“思考”。
- 结果:与标准模型相比,这些思考模型在困难的 3D 几何任务(深度和表面法线)上表现要好得多。它们似乎利用逻辑来推断空间关系,而标准模型则仅仅是基于模式进行猜测。
5. “幻觉”问题
当研究人员测试最新的 GPT-4o(它实际上可以生成图像,即画画,而不仅仅是说话)时,发现它容易产生幻觉。
- 类比:如果你让它“画一匹斑马”,它可能会画出一匹斑马,但也可能会不小心加上一只独角兽的角,或者把斑马的腿画在错误的位置。图像生成很有前景,但目前对于精确任务来说还不可靠。
结论
该论文得出结论,虽然这些庞大的 AI 模型是令人印象深刻的“通才”,能够理解图像的含义,但它们尚未准备好取代工程师和科学家用于精确测量和 3D 重建的专用工具。
然而,“推理”模型正显示出弥合这一差距的最初迹象,这表明随着 AI 学会更深入地“思考”,其理解物理 3D 世界的能力正开始赶上其理解语言的能力。
重要提示:研究人员强调,他们的“提示链”方法是一种测试工具,而非在现实生活中使用这些模型的实用方式。这就像用尺子测量模型的身高;这是一种获取数值的方法,但你不会用尺子来建造房子。目标仅仅是看看这些模型到底有多好,而答案是:“非常擅长谈论图片,但仍在努力学习如何测量它们。”
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。