Vision-Language Models Align with Human Neural Representations in Concept Processing
这项研究表明,视觉-语言模型通常比仅有语言的模型能更好地与人类对概念的神经表征相一致,尽管这种一致性的程度取决于具体的架构,以及它究竟源于真正的概念学习还是对推理时上下文的敏感性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你的大脑是一个巨大且繁忙的图书馆,你所了解的每一个概念——比如“鸟”、“舞蹈”或“疯狂”——都有属于它们自己的独特书架。当你看到一张鸟的照片或读到关于鸟的句子时,你的大脑会以特定的模式亮起,就像黑暗中形成的独特星群。
长期以来,科学家们一直试图构建能够像人类一样“思考”的计算机模型。最近,我们构建了视觉-语言模型(VLMs)。可以将这些模型想象成超级聪明的学生,他们同时学习过书籍(文本)和图画书(图像),而以前的模型只能阅读书籍。
这篇论文提出了一个简单的问题:这些拥有多感官的新型“学生”,对概念的理解方式是否与我们的大脑相同?
以下是他们的研究结果,使用了日常类比进行说明:
1. 实验设计:“猜猜模式”游戏
研究人员不仅仅是让模型描述一张图片。相反,他们玩了一个匹配游戏。
- 人类侧: 他们观察了人们在看到单词(如“鸟”)出现在句子中(如“那只鸟在笼子周围飞翔”)或出现在鸟的图片旁边时的脑部扫描(fMRI)图像。他们绘制出了每个单词对应的脑部活动“星群”。
- 模型侧: 他们将完全相同的单词和图片输入到各种 AI 模型中,并观察模型的内部“思维模式”(数学表示)。
- 匹配: 他们将人类大脑的星群与 AI 的星群进行对比。两者越接近,说明 AI 的理解就越具有“类人性”。
2. 主要发现:两个头(和眼睛)总比一个好
研究发现,视觉-语言模型通常比纯文本模型能更好地匹配人类的脑部模式。
- 类比: 想象一下你正在尝试猜测什么是“狗”。
- 纯文本模型就像是一个只读过“狗”的字典定义的人。他们知道这个词,但从未见过狗。
- 视觉-语言模型则像是读过定义并且还看过上千张狗的照片的人。
- 当研究人员问:“哪一个对‘狗’的思考方式更接近人类大脑时?”答案通常是那个看过照片的模型。那些能够将“看”和“读”结合在一起的模型,创造出的概念图谱看起来更像我们自己的神经图谱。
3. 转折点:并非所有“聪明”的模型都一样出色
有趣的地方在于,研究人员测试了不同类型的这些多感官模型,它们的表现并不相同。
- “编码器”(细心的学生): 像 LXMERT 和 VisualBERT 这样的模型表现最好,最能匹配人类大脑。这些模型旨在通过逐层分析单词与图像之间的关系来进行设计。它们似乎已经学会了以一种非常符合人类逻辑的方式来构建概念。
- “生成器”(创意作家): 更现代、更强大的模型如 LLaVA 和 IDEFICS2 以能够编写故事或生成图像而闻名。你可能会认为它们会更聪明,但实际上,它们与人类大脑模式的匹配程度不如“编码器”。
- 类比: 可以把“编码器”想象成一位博物馆馆长,他深刻理解每一件文物的历史和意义。而把“生成器”想象成一位才华横溢的即兴表演喜剧演员,他可以当场编出一个关于文物的有趣故事。喜剧演员令人印象深刻且非常有用,但他们的内部“理解”并不完全符合馆长(或人类大脑)那种深层的、结构性的知识。
4. 上下文陷阱:它们是在学习还是仅仅在模仿?
研究人员想知道:这些模型是在训练过程中真正学习了类人的概念,还是仅仅擅长利用当前展示给它们的图片?
他们对模型进行了“手术”(称为消融研究):
- 测试: 他们拿走了通常需要图片的模型,迫使它们在没有图片的情况下仅凭单词进行工作。
- 结果:
- 一些模型(如 CLIP 和 VisualBERT)表现崩溃了。当图片消失时,它们那种“类人”的理解也随之消失了。这表明它们在很大程度上依赖于即时的视觉输入,几乎就像是一只只在看到说话者时才会模仿声音的鹦鹉。
- 其他模型(如 LXMERT 和 IDEFICS2)依然保持强劲。即使没有图片,它们的内部概念图谱看起来仍然非常符合人类特征。这表明它们在训练期间确实学习到了深层的、类人的概念理解,而不仅仅是一种利用图片的技巧。
5. 核心结论
论文得出结论:多模态(结合视觉与文本)有助于 AI 模型与人类大脑对齐,但这并不是万能灵药。
- 仅仅在文本模型中加入图片并不会自动让它变得“像人”。
- 架构(内部设计)最为重要。某些设计(即“编码器”)天生就能构建出类人的概念图谱。
- 擅长生成文本或图像(即“生成器”)并不一定意味着该模型理解概念的方式与人类大脑一致。
简而言之:要构建一个像人类一样思考的 AI,你不仅需要给它眼睛,还需要以特定的方式构建它的“大脑”,使其能够真正将所见与所读进行整合。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。