VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs
本文介绍了 VKnowU,这是一个用于评估多模态大语言模型视觉知识理解能力的全面基准测试,并提出了 VideoKnow+,一种基于强化学习的模型,该模型通过显式地结合结构化视觉知识,显著提升了在该基准测试及其他视频理解任务上的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个非常聪明的机器人朋友,它能够观看视频并回答关于视频的问题。长期以来,这个机器人在识别事物方面表现出色。如果你给它看一段狗在追球的视频,它能告诉你:“那是一只狗”,“那是一个球”,“狗正在跑”。
但问题在于:这个机器人并不像人类那样真正理解这个世界。它并不直观地知道如果你丢下一个球,它会掉下去(重力);或者一个玻璃杯很脆弱,如果掉下去可能会碎;或者一个人皱眉可能表示不开心。它看到了像素,但错过了这些像素背后的“常识”。
这篇论文介绍了一种新的方法,用来测试并教导机器人这种缺失的“常识”,作者称之为视觉知识(Visual Knowledge)。
问题所在:机器人对常识是“盲目”的
作者创建了一个巨大的测试,叫做 VKnowU(视觉知识理解)。你可以把它想象成一场针对机器人的期末考试,但题目不是数学或历史,而是关于世界如何运作以及人类如何思考。
该测试分为两个主要科目:
- 以世界为中心(物理课): 机器人是否知道沉重的箱子比羽毛更难抬起?它是否知道硬币会掉到地上?
- 以人为中心(心理学课): 机器人是否理解一个看着凌乱房间的男孩可能正计划制造更大的混乱?它是否知道如果大人走进来,他们可能会感到震惊?
结果: 当他们把这个测试交给目前最智能的机器人(例如来自 Google、OpenAI 和开源团队的机器人)时,机器人的得分很低。它们在“物理课”方面表现得尤为糟糕。它们可以完美地描述场景,但在预测接下来会发生什么或理解物体的材质方面却失败了。它们是在“看”,但并没有在“理解”。
解决方案:教机器人“观察、思考、回答”
为了解决这个问题,作者构建了一种新的训练方法,称为 VideoKnow+。他们意识到机器人是在尝试根据它们的语言训练来猜测答案(就像不看图片就试图猜出谜语的答案一样)。
他们为机器人引入了一条新规则:“观察、思考、回答(See, Think, Answer)”。
- 观察(See): 在回答之前,机器人必须首先精确地描述它在视频中看到了什么,重点关注视觉线索。
- 思考(Think): 然后,它利用这些视觉线索进行推理。
- 回答(Answer): 最后,它给出答案。
他们还创建了一个特殊的“奖励系统”。想象一下一位正在给机器人评分的老师。如果机器人试图仅凭文字来猜测答案,老师会给它低分。但如果机器人写出了一段证明它看到了视觉证据的描述(例如“这个箱子是木头的,所以很重”),老师就会给它高分。这迫使机器人真正去关注视频,而不是仅仅依赖其内部的事实数据库。
结果
在使用这种新方法和大规模的新视频数据集(称为 VKnowQA)进行训练后,机器人的表现有了显著提升。
- 它在“视觉知识”测试上的得分大幅提高。
- 它在其他通用视频测试中的表现也变得更好,证明了学习理解世界有助于它在许多领域取得进步。
大局观
论文认为,要让机器人变得真正智能,它们需要停止仅仅做“模式匹配者”(识别物体),而开始成为“世界理解者”。就像人类的孩子通过观察世界来学习火是热的、玻璃是易碎的一样,机器人也需要学习这些“视觉真理”,以弥合仅仅看到图像与真正理解图像中所发生的事情之间的鸿沟。
简而言之: 这篇论文建立了一个测试来展示机器人缺乏常识,然后构建了一种新的训练方法,迫使它们在猜测之前先观察证据,从而使它们变得更聪明、更可靠。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。