FewMMBench: A Benchmark for Multimodal Few-Shot Learning
本文提出了 FewMMBench 基准,旨在评估多模态大语言模型在少样本学习(特别是上下文学习和思维链提示)下的能力,研究发现指令微调模型在零样本表现优异,但增加示例或推理步骤往往无法带来显著提升甚至导致性能下降。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文介绍了一个名为 FEWMMBENCH 的新“考试”,专门用来测试一种叫做多模态大语言模型(MLLMs)的 AI 的“举一反三”能力。
为了让你更容易理解,我们可以把这篇论文的内容想象成一场超级 AI 的“入学考试”。
1. 背景:AI 变聪明了,但还会“死记硬背”吗?
现在的 AI(比如能看图说话的机器人)非常厉害,它们不仅能看懂图片,还能像人一样聊天。以前,这些 AI 只能“零样本”学习(Zero-shot),也就是老师直接给题目,它直接作答,全靠平时的死记硬背。
但现在,AI 进化了,它们学会了少样本学习(Few-shot Learning)。这就好比老师在做题前,先给 AI 看几个例题(Demonstrations),告诉它:“看,这类题我是这么解的,你照着做。”
这篇论文的核心问题就是: 当给这些 AI 看几个例题,或者让它们在解题前先“写个草稿”(思维链,CoT)时,它们真的会变得更聪明吗?还是说,它们其实根本学不会,甚至会因为看了例题而“画蛇添足”?
2. 这个“考试”考了什么?(FEWMMBENCH)
作者设计了一套包含 9 种不同题型的试卷,难度从“看颜色”到“推理时间顺序”都有:
- 基础题: 比如“墙是什么颜色的?”(属性识别)、“图里有几个人?”(数数)。
- 进阶题: 比如“桥在房子的前面还是后面?”(空间关系)、“这个人是在跑步还是在走路?”(动作识别)。
- 高难题: 比如“如果门没关,猫还会在外面吗?”(反事实推理)、“视频最后那个静止的物体是什么形状?”(时间推理)。
3. 考试的“作弊”方式(测试方法)
为了测试 AI 的“举一反三”能力,作者用了三种不同的“辅导”方式:
- 随机辅导: 随便找几个例题给 AI 看。
- 精准辅导: 找跟当前题目长得特别像的例题给 AI 看(比如都是关于“数鸭子”的题)。
- 思维链辅导: 不仅给例题,还告诉 AI 解题的每一步思考过程(比如:“首先我看到有 3 只鸭子,然后……")。
4. 令人惊讶的“考试成绩”
作者测试了 26 种不同的 AI 模型,结果发现了一些非常反直觉的现象:
现象一:教得越多,反而越笨(针对“优等生”)
那些平时成绩很好、经过严格训练(指令微调)的 AI,在零样本(直接做题)时表现很棒。但是,一旦给了它们几个例题(少样本),它们的成绩并没有提升,甚至有时候下降了!- 比喻: 就像一个已经精通数学的学霸,老师非要在他做题前给他看几个简单的例题,结果他反而被例题带偏了,或者因为要模仿例题的格式而分心,导致做错了原本会做的题。
现象二:找“相似”的例题也没用
人们以为,给 AI 看跟题目最相似的例题,它应该学得最好。但实验发现,给 AI 看“相似例题”和给“随机例题”,效果几乎一样。- 比喻: 就像你教孩子做应用题,特意挑了跟题目背景一模一样的例子,结果孩子还是没学会,说明它们并没有真正理解题目之间的逻辑联系,只是在机械地匹配。
现象三:让 AI“写草稿”反而更差
在纯文本领域,让 AI“一步步思考”(思维链 CoT)通常能提高准确率。但在看图说话的任务里,让 AI 先写一大段推理过程,成绩反而变差了!- 比喻: 就像让一个擅长看图识物的画家,在画画前必须先写一万字的“作画思路”。结果画家被文字绕晕了,或者开始胡编乱造(幻觉),最后画出来的东西反而不如直接画的好。
现象四:题目越多,效果越差
给 4 个例题和给 8 个例题,AI 的成绩并没有变好,甚至更差了。- 比喻: 就像给 AI 喂了太多信息,它“消化不良”了,被过多的例子干扰,忘了重点。
5. 结论:我们还需要努力
这篇论文告诉我们,虽然现在的 AI 看起来很强大,但在多模态(看图 + 说话)的少样本学习方面,它们其实还很脆弱。
- 目前的 AI 并不擅长像人类一样,通过看几个例子就真正“悟”出规律。
- 现有的“思维链”方法(让 AI 一步步思考)在处理图片时,往往会引入错误,而不是帮助推理。
- 未来的 AI 需要更聪明的训练方法,让它们真正学会如何从例子中学习,而不是死记硬背或画蛇添足。
总结一句话:
这篇论文给现在的 AI 多模态模型泼了一盆冷水:别以为给它们看几个例子、让它们多思考几步,它们就能变聪明;在目前的阶段,这些方法往往不仅没用,甚至可能帮倒忙。 这是一个非常重要的发现,提醒研究人员需要重新思考如何训练这些 AI。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。