← 最新论文
💻 computer science

From Large Language Models to Multimodal Intelligence: Bridging AI and Cognitive Science

这篇综述文章指出,尽管大语言模型展示了令人印象深刻的认知能力,但人工智能未来的进步需要通过具身经验、层级调制和自主强化来弥合通往多模态智能的差距,以克服仅限语言系统的固有局限性。

原作者: Yanru Jiang, Rick Dale

发布于 2026-08-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Yanru Jiang, Rick Dale

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大脑升级之路:从纯文本到全身心 AI

想象一下,你正试图教一个机器人如何理解世界。长期以来,科学家们尝试通过向机器人喂养海量的书籍、文章和网站来完成这项任务。这种方法创造了“大语言模型”(LLMs),它们就像是读过几乎所有文献的超级聪明的“复读机”。它们在预测句子中的下一个词、解决数学问题甚至创作诗歌方面表现得不可思析。但问题在于:它们仅通过文字来了解世界。它们从未感受过太阳的热度,从未触摸过砂纸的粗糙,也从未感受过重物的重量。

这引出了人工智能(AI)和认知科学(研究思维如何运作的学科)领域的一个重大问题:仅仅阅读是否足以实现真正的智能?或者说,机器是否需要一个身体才能真正理解世界?你即将阅读的这篇论文探讨了一个观点:虽然语言是一个强大的工具,但它可能缺少了实现真正智能的一些关键要素。论文指出,要构建能够像人类一样学习、适应并与我们互动的 AI,我们需要超越单纯的文本,赋予这些机器“多模态”的感觉——如视觉、听觉和触觉——这样它们才能直接体验世界,而不仅仅是阅读关于世界的描述。


从看菜单到品尝美食

把大语言模型(LLM)想象成一位背下了宇宙中所有食谱的厨师,但从未真正踏入过厨房。这位厨师可以极其详尽地描述一颗草莓,根据数百万条描述列出它的颜色、味道和质地。他们甚至可以写一首关于品尝草莓之喜悦的诗。但如果你递给他们一颗真实的草莓,他们却不知道该如何握住它,不知道该用多大的力气去挤压它,也不知道它在皮肤上的真实触感。他们掌握了关于这种体验的“词汇”,但他们并没有获得这种“体验”本身。

这篇由研究员 Yanru Jiang 和 Rick Dale 撰写的论文提出了一个简单却深刻的问题:如果一台机器只通过语言来了解世界,它能拥有真正的智能吗?

作者认为,虽然这些纯文本的“厨师”在各自的领域表现卓越,但他们遇到了瓶颈。他们在处理信息表征和解决书面问题方面非常出色,但在面对需要“学习如何学习”或在没有说明书的情况下适应奇特新情况时,却显得力不从心。论文指出,要突破这一壁垒,AI 需要从“纯文本”系统进化为“多模态”系统——即一个将语言与视觉、听觉和运动结合在一起的系统,就像人类一样。

两种思维方式:图书馆 vs. 游乐场

为了理解为什么这很重要,论文将思维方式分为两种不同的视角:

  1. 符号认知(图书馆): 这种观点认为语言已经足够了。它主张词语是完美映射到现实世界的符号。如果你知道“玫瑰”这个词以及它连接的所有其他词汇(如“红色”、“多刺”、“浪漫”),你基本上就知道了什么是玫瑰。论文承认现代 AI 在这方面已经做得非常出色。它能发现语言中的模式,这些模式看起来非常像我们大脑的工作方式。例如,AI 可以仅仅通过观察词语如何被共同使用,就推断出“纽约”是一个地方,而“周一”是一个时间,而无需见过地图或日历。
  2. 具身认知(游乐场): 这种观点认为语言是不够的。它主张要真正理解一个词,你需要“经历”过它。你之所以知道“重”是什么意思,不仅仅是因为你读到了定义;而是因为你曾举起过重物,感受过肌肉的紧绷。论文指出,许多概念——比如如何骑自行车或如何端稳一盘饮料——是无法完全用语言捕捉的。你必须去“做”这些动作。

作者并不是说“图书馆”的方法毫无用处。事实上,他们承认这种方法极其强大。但他们认为它是残缺的。就像你无法通过阅读一本关于物理学的书来学会骑自行车一样,AI 也无法仅仅通过阅读关于现实世界的书来学会如何在现实世界中穿行。

为什么仅靠文字是不够的

论文指出了纯文本 AI 始终存在局限性的两个主要原因:

1. “不可言说”的问题
有些东西很难用语言表达。想想特定类型音乐带来的感觉,或者光线照射在玻璃杯上的精确方式。人类通常通过感官和身体来学习这些知识,而不是通过教科书。如果 AI 只能接触到文本,它就会错过这些“无法用言语表达”的概念。这就像试图向一个从未吃过甜食的人描述巧克力的味道;无论你使用多少词汇,在他们亲口尝到之前,他们都不会真正理解。论文建议,为了让 AI 更快速、更灵活地学习新事物,它需要直接体验世界,而不只是阅读关于世界的描述。

2. “人际沟通”的鸿沟
想象你正在和一个看着美丽落日的友人交谈。你说:“看那个!”你的朋友立刻明白你的意思,因为他们能看到和你一样的天空。现在,想象你在和一个只能读取文本的机器人交谈。如果你说“看那个”,机器人根本不知道“那个”指的是什么。它没有眼睛去看落日,也没有身体去转身观看。

论文认为,人类的交流充满了这些“非语言”线索——比如我们在看哪里、说话的速度有多快,或者我们的肢体语言。这些线索帮助我们瞬间理解彼此。纯文本 AI 错失了这一切。它可能会在你只想得到一个简单的“是”或“否”时,给你一个非常冗长且详细的回答,因为它无法感知你的不耐烦或情绪。要成为一个好的对话伙伴,AI 需要是“具身的”——它需要能够观察、倾听并实时对情境做出反应,就像我们一样。

更聪明 AI 的路线图

那么,我们该如何构建这种“多模态”AI 呢?论文概述了三条令人兴奋的前进路径,就像是升级数字大脑的配方:

1. 混合成分(多模态表征学习)
目前,许多 AI 系统是通过将一个语言模型和一个视觉模型(具备视觉能力的模型)在最后阶段“粘合”在一起而构建的。作者建议我们需要做得更好。与其仅仅是将它们粘在一起,不如从一开始就训练它们“共同学习”。想象一下,是在教一个孩子同时说话和看东西,而不是先教他读书,然后再给他看图片。这种“早期集成”可能有助于 AI 理解视觉、听觉与所听内容之间的深层联系,从而产生一个更聪明、更直觉的系统。

2. 大脑的指挥官(层级调制)
我们的大脑是分层组织的。底层处理简单的任务,如“那是一个红点”;而高层则处理复杂的任务,如“我需要接住那个球,以免它掉在地上”。论文建议 AI 也需要类似的“指挥官”系统。这个“指挥官”(类似于人类大脑中的执行功能)应该能够观察所有的不同感官——视觉、听觉、触觉——并决定在特定时刻专注于哪一种。这就像管弦乐队中的指挥家,确保小提琴和架子鼓完美地协同演奏。目前的 AI 在这方面往往表现挣扎;当大量信息涌入时,它们经常会感到混乱。

3. 内在驱动力(自主强化)
最后,论文提出了一个问题:是什么让 AI 想要学习?目前,我们通常必须明确告诉 AI 该做什么,并在它做对时给予“奖励”(比如积分)。但人类并不需要老师来告诉我们去探索;我们天生具有好奇心。我们想知道如果按下那个按钮或爬上那棵树会发生什么。作者建议,未来的 AI 应该拥有一种“内在动机”——一种内置的、去探索和学习的驱动力,类似于我们的大脑如何利用能量来预测接下来会发生什么。这将使 AI 能够自主学习,在不需要人类每次都给出具体任务的情况下,自行发现新事物。

大局观

论文总结道,虽然大语言模型是一个巨大的进步,但它们仅仅是一个开始。它们就像是一位读遍了图书馆所有书籍、却从未走出过建筑物的优秀学生。为了创造出能够像人类一样自然地学习、适应并与我们互动的真正智能机器,我们需要赋予它们身体和感官。

我们需要从“仅仅了解词汇”的 AI 转向“能够体验世界”的 AI。通过将语言与视觉、听觉和运动相结合,并赋予这些机器自主探索和学习的能力,我们可以构建一个未来——在那里,AI 不仅仅是我们交谈的工具,而是一个真正理解我们的伙伴。这不仅仅是在丰富图书馆,更是要打开大门,让 AI 迈步走向户外。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →