CLBench-V: Evaluating Multimodal Context Learning from Grounding to Knowledge Acquisition
本文介绍了 CLBench-V,这是一个旨在从定位(grounding)、新信息应用和知识获取这三个关键维度评估多模态上下文学习的综合基准测试,并揭示了尽管多模态能力有所进步,但目前的尖端模型在处理这些任务时仍然存在显著困难。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个超级聪明的机器人如何破解谜题。在过去,你只会给机器人喂食一整座庞大的图书馆,并希望它能记住其中的每一个事实。但在现实世界中,问题并不会自带预包装好的答案。相反,你会递给机器人一个新鲜、凌乱的文件夹,里面包含一张地图、一份财务报告、一张科学图表和几张照片,然后对它说:“仅利用这里面的信息来解决这个问题。”这就是**上下文学习(Context Learning)**的挑战:即学习新规则或从当前提供的信息中寻找特定线索的能力,而不是依赖于机器人在训练阶段已经掌握的知识。
长期以来,科学家们一直通过纯文本来测试这项技能,比如给机器人讲一个长篇故事。但现实生活很少仅仅由文本组成。它是文字、图表、地图和图像的混合体。研究人员提出的核心问题是:我们最先进的多模态 AI 模型是否真的能够“阅读”一个多模态文件夹(文本 + 图像)并从中学习,还是它们只是在利用旧习惯进行猜测,从而假装理解?这是人工智能与人类世界的复杂视觉现实相遇的科学前沿。
于是,CLBench-V 应运而生——这是一个由研究人员设计的全新“压力测试”,旨在观察这些 AI 模型在处理这一特定挑战时的表现。你可以将 CLBench-V 视为不仅仅是一场考试,而是一个分为三个等级的障碍赛。
第一级:侦探之眼(上下文定位/Context Grounding)
首先,模型必须能够单纯地“找到”线索。如果你向它展示一张地铁图并问:“A 站和 B 站之间是哪个站?”它需要真正去观察地图,而不是根据它认为地铁通常长什么样来进行猜测。这一等级测试 AI 是否能够定位并将正确的视觉证据与问题进行绑定。
第二级:计算器(新信息应用/New Information Application)
接下来,模型必须使用找到的线索。想象一下,地图上写着“今天的票价是 5 美元”,而问题是“两张票多少钱?”模型需要从图像中提取这个特定的、新的数字并进行数学运算,同时忽略它记忆中“票价通常是 3 美元”的旧知识。这测试了 AI 是否能在不被先验知识干扰的情况下应用新鲜事实。
第三级:科学家(新知识学习/New Knowledge Learning)
最后,是最难的一级。模型必须从上下文中学习一条“新规则”。例如,一篇科学论文可能会展示一张图表并得出结论:“在本次特定实验中,蓝光使植物生长得更快。”模型必须阅读该内容,理解这条规则,并将其应用于关于另一株植物的新问题。这不仅仅是寻找一个数字,而是为了这次测试而学习一套新的宇宙法则。
研究人员通过混合现有的公开数据集和他们专门创建的新任务来构建这项测试,特别关注了像财务报告(计算净资产收益率)、科学论文(从医学图表中推断结论)和体育场景等棘手领域。他们针对六个目前最顶尖的多模态模型进行了 3,443 次此类测试。
结果如何?机器人仍在挣扎。即使是表现最好的模型 InternVL3.5-30B-A3B,其综合得分也仅为 0.2847。这是一个非常低的得分,表明多模态上下文学习远未被“解决”。研究指出,虽然 InternVL3.5-30B-A3B 在寻找线索(第一级 / 上下文定位)和学习新规则(第三级 / 新知识学习)方面表现出色,但它在第二级(新信息应用)——即模型必须应用文档中特定新事实的任务中——表现得非常吃力。相比之下,Qwen3.5-Plus 模型在第二级任务上的表现最为出色。
有趣的是,研究发现文档的长度或图像的数量并不总是以一种简单的方式让情况变得更糟。有时,更多的图像反而有助于某个模型,却会让另一个模型感到困惑。最大的问题不仅在于文档很长,而在于模型经常无法区分“文档中的内容”与它们从训练中获得的“已知知识”。它们会在看到图表中的新事实后,用旧有的猜测来覆盖它。
论文总结道,我们仍处于早期阶段。仅仅因为一个模型能“看到”图像并“读到”文本,并不意味着它能真正将两者结合起来进行学习。作者希望这一新的基准测试 CLBench-V 能帮助开发者停止猜测,转而开始修复这些具体的盲点,从而让我们的 AI 最终能够成为解决复杂现实问题的真正伙伴,这些问题需要去仔细研读地图、图表或报告中的细则。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。