A Hierarchical Energy-Based Model for Multimodal Cognition
本文提出了 IM-LEPP,一种通过中心辐射型架构整合视觉与语言的分层能量模型,旨在提供一种关于多模态认知的机制性有效理论,用以解释注意力现象、与心理语言学研究结果保持一致,并提供与基于 Transformer 的模型不同的独特预测。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
大脑的秘密天气图
想象一下,你正试图理解一座城市的运作方式。你可以去研究每一栋建筑里的每一块砖头,或者你可以通过观察交通模式、天气和人流来理解这座城市的“感觉”和“律动”。在脑科学领域,关于哪种方法更好存在着一场巨大的争论。一些科学家想要像绘制砖块蓝图一样,绘制出每一个神经元的地图。而本文的作者则建议,我们应该去观察心灵的“天气”。他们提出,我们的思想和感知不仅仅是电线的放电,更像是在能量景观上移动的状态流,就像球顺着山坡滚下,或河流寻找通往大海的路径一样。
这个想法依赖于一个被称为**预测处理(predictive processing)**的概念。不要把你的大脑仅仅看作是一个记录所见所物的摄像机,而要把它看作一个超级聪明的“猜谜者”。每一秒钟,你的大脑都在不断地对即将发生的事情做出预测——你会听到什么声音、你会看到什么形状,或者句子中下一个词是什么。当你的感官与你的猜测相符时,一切都会感觉非常顺畅。但当现实让你感到意外时(比如你预期是安静的,结果却传来一声狗吠),你的大脑就必须更加努力地去更新它的猜测。这篇文章建立在这样一个观点之上:大脑通过不断调整其内部模型,来最小化这种“惊喜”或“误差”。这就像一个恒温器,它试图让房间保持在完美的温度,只不过它试图保持的不是热量,而是你对世界的理解的准确性。
大脑的核心枢纽:IM-LEPP
现在,让我们进入 IM-LEPP(集成多模态潜能能量预测处理模型)。想象你的大脑是一个巨大且繁忙的机场。在这个机场里,不同的航站楼处理不同类型的信息:一个航站楼负责视觉(看世界),另一个负责语言(听和读单词),还有其他航站楼负责感觉和声音。长期以来,科学家们一直在思考这些独立的航站楼是如何相互交流的。为什么看到一个红苹果会瞬间连接到“苹果”这个词以及饥饿的感觉?
Varma 的论文指出,所有这些航站楼都会将它们的报告发送到一个位于大脑特定区域——**前颞叶(ATL)**的中央“控制塔”。这个塔架充当了一个巨大的枢纽,所有的不同信息流都在这里汇聚成一个统一的现实图景。该模型被称为“轴辐式”(Hub-and-Spoke)模型,因为航站楼(辐条)向中央枢纽(轴心)输送信息,而枢纽又向航站楼发送指令。
这里有一个神奇的魔术:该模型表明,大脑并不仅仅是存储一份包含它听过的每一个词或见过的每一个图像的巨型清单。相反,它使用一种“扩散”过程,这就像是一场缓慢而谨慎的可能性之舞。当你看到一个场景时,你的大脑并不只是拍下一张照片;它会生成一个关于下一刻会发生什么的预测。如果你在看一个弹跳的球,大脑会预测它下一秒的位置。如果你在阅读一个句子,它会预测下一个词。
IM-LPEP 的特别之处在于它如何处理“视觉”与“言语”之间的差异。你的眼睛观察世界是一个连续的流,就像一段视频。但语言是以“块”的形式出现的,就像一系列踏脚石(单词)。该模型通过让视觉航站楼不断更新,而语言航站楼则以爆发式的方式更新,从而解决了这个问题。中央枢纽充当了一个翻译官,将快速移动的视觉流和缓慢移动的词流融合在一起,形成一种平滑的体验。这解释了为什么你可以看着一辆车驶过,并能瞬间理解“那辆车是红色的”这句话,而不会因为两种感官的速度不同而感到困惑。
为什么这很重要:解决“注意力盲视”与“花园路径”
论文利用这个模型来解释一些关于我们思维的奇特现象。
首先,考虑一下注意力盲视(Inattentional Blindness)。你知道那个著名的视频吗?人们在传篮球,这时一个穿着猩猩套装的人走过场景,但一半的观众却没有看到猩猩。论文指出,这是因为你的大脑只为你正在积极关注的事物构建详细的“管道”。如果你专注于球,你的大脑就会为球建立一个强大的预测模型。而猩猩由于不在你的关注范围内,就没有获得专门的管道。它只是背景中的“噪音”的一部分,直到它做出了足够令人惊讶的事情,打破了你的预测。该模型表明,对于那些大脑尚未决定去追踪的事物,你在本质上是“盲目”的。
其次,该模型解释了花园路径句(Garden-Path Sentences)。这些句子会误导你,例如:“The horse raced past the barn fell(那匹被赶过谷仓的马摔倒了)”。当你读到“raced”时,你的大脑预测它是主要动作。但当你读到“fell”时,你的大脑必须做一个突然且剧烈的“U型转弯”,才能意识到原来马是被赶过去的,而不是正在进行比赛的那匹马。论文指出,这不仅仅是一个错误,而是一个物理上的“能量跃迁”。你的大脑卡在了低能谷底(错误的含义),需要一个巨大的“惊喜能量”推力,才能翻过山丘,落在正确的谷底(正确的含义)。
人类大脑与人工智能的区别
论文在人类学习语言的方式与现代人工智能(如你可能知道的聊天机器人)学习方式之间划出了一道清晰的界限。AI 模型就像是读完了整个互联网但从未见过真实苹果或感受过阳光的学生。它们纯粹通过观察哪些词经常出现在一起来学习语言。它们不知道“苹果”是什么“感觉”。
IM-LEPP 表明,人类儿童的学习方式不同。因为我们的语言枢纽与视觉和感觉枢纽相连,所以孩子通过将“苹果”这个词与苹果真实的视觉和触觉体验联系起来,从而学会这个词。这被称为具身化(grounding)。论文指出,这就是为什么儿童学习说话所需的资料远比 AI 需要的少。他们不仅仅是在记忆单词模式,而是将单词附着在一个丰富的、预先存在的现实世界地图之上。
本文尚未说明的内容(目前)
需要注意的是,这篇论文是一个提议,是一个关于大脑可能如何运作的蓝图。作者尚未构建出一个能像人类一样看和说话的完整功能机器人大脑。他们展示了其数学模型可以解释诸如为什么我们会被棘手的句子误导,或者为什么我们会错过视频中的猩猩等现象。他们认为,如果我们按照这些完全相同的规则构建一个计算机程序,它的表现会像人类大脑一样。
论文也承认仍存在谜团。例如,它并没有完全解释大脑如何存储特定事件(如你的生日派对)的长时记忆与一般事实(如什么是狗)的区别。它提出了一个系统,即只有在发生令人惊讶或具有情感色彩的事情时,大脑才会记录记忆,但这个“记忆归档系统”的具体细节仍留待未来的研究。
简而言之,IM-LEPP 为思考心灵提供了一种有趣且充满能量的方式:它不认为心灵是一个静态的计算机,而是一个动态的、起伏的景观,在这里,我们的注意力、感官和语言不断碰撞、融合,共同创造了我们现实生活的叙事。它表明,人类智能的秘密不仅在于拥有一个庞大的数据库,更在于拥有一种聪明的、基于现实的、去预测下一步的方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。