What We are Missing in Multimodal LLM Evaluation?
本文认为,当前多模态大语言模型(MLLM)的评估基准是不充分的,因为它们侧重于孤立的任务,而非评估诸如时空连贯性、物理世界理解、多模态一致性和选择性注意力等关键能力,并提出了一种修订后的分类法,以填补这些空白并更好地衡量真正的多模态智能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,多模态大语言模型(MLLM)就像是才华横溢的大厨,他们能读懂食谱(文本)、观察食材的照片(图像)、聆听滋滋作响的声音(音频),并观看烹饪视频。他们的目标是品尝最终的成品并完美地描述它。
根据这篇论文,虽然这些大厨在遵循单个步骤方面变得越来越快、越来越熟练,但我们却未能测试他们是否真的能将整顿饭一起做出来。
以下是关于我们缺失了什么的简单拆解:
1. “香蕉问题”:依赖旧习惯
目前,我们的测试就像是在问一位大厨:“香蕉是什么颜色的?”
- 陷阱: 因为这位大厨读过数百万本说“香蕉是黄色的”书,所以他们能瞬间回答出“黄色”。他们并没有真正观察面前那根特定的香蕉。
- 现实: 如果你给他们看一根紫色的香蕉,他们可能仍会说“黄色”,因为他们只是在背诵记忆中的内容,而不是在真正观察图像。
- 论文观点: 现有的测试无法捕捉到这一点。它们让模型通过基于文本习惯进行猜测,而不是结合所见、所听和所读来进行判断,从而实现了“作弊”。
2. “静态照片” vs. “动态电影”
我们目前的大多数测试,就像是给大厨看一张厨房的单张静止照片,然后问他:“桌子上是否有刀?”
- 差距: 现实生活不是一张静止的照片。它是带有声音的电影。
- 我们错过了什么: 我们没有测试大厨是否理解:
- 时间: 刀是在盘子碎裂之前还是之后掉落的?
- 空间: 如果摄像机移动了,大厨是否知道刀还在盘子后面?
- 物理学: 如果一个玻璃杯掉落,它会破碎吗?(论文称之为“物理世界建模”)。
- 注意力: 如果发生了一次巨大的响声,大厨是会去寻找声音的来源,还是会被一只走过的猫分散注意力?
3. “随堂测验” vs. “真实工作”
论文认为,我们将这些 AI 大厨视为正在参加多项选择题随堂测验的学生,而不是正在从事真实工作的员工。
- 测验缺陷: 在随堂测验中,总有一个正确答案。但在现实世界中(比如开车或诊断病人),情况是混乱的。有时证据是模糊的或相互矛盾的。
- “强迫选择”偏差: 现有的测试强迫 AI 即使在感到困惑时也要选出一个答案。这让 AI 看起来很聪明,而实际上它只是在瞎猜。
- 排行榜陷阱: 我们有一个“计分板”,模型通过它来竞争最高分。但论文指出,这就像是一个学生在背诵答案解析,而不是在学习学科知识。分数在上升,但处理现实世界混乱的实际能力并没有提高。
4. 缺失的配料
为了真正测试这些模型,论文建议我们在评估配方中加入四种新的“配料”:
- 时间与空间: 模型能否在一段长视频中理清故事脉络,并理解物体在三维空间中的位置?
- 物理学: 模型是否理解现实世界是如何运作的(重力、碰撞、因果关系)?
- 一致性: 如果模型听到了破碎声,但看到玻璃杯依然静止不动,它会感到困惑吗?一个优秀的模型应该能发现这种不匹配。
- 注意力: 模型能否忽略噪音并专注于重要的信号?
核心结论
论文总结道,我们正陷入一个循环:我们构建了更好的模型,但却用过时的、过于简单或“可作弊”的考试来测试它们。这造成了一个差距:模型在纸面上看起来非常出色(高分),但当你要求它们处理复杂的现实世界任务时,它们可能会表现得一塌糊涂。
要解决这个问题,我们需要停止给它们出多项选择题,而是开始给它们提供动态的、混乱的、真实的挑战,让它们证明自己能够真正地理解这个世界,而不只是死记硬背。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。