Grounded world models in biological organisms and future embodied AI
本文认为,未来的具身智能应当从被动的、以语言为中心的训练,转向通过主动的环境交互、内在动力学以及社会参与来构建受生物启发且具有落地感的物理世界模型,从而实现鲁棒的、开放式的智能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大脑构建者:为什么机器人需要在说话之前先去触摸
想象一下,你正在试图教一个超级聪明的机器人如何理解这个世界。你有两种主要的方法。第一种方法就像是递给机器人十亿本书和一百万个视频,然后对它说:“读完所有东西,记住其中的模式,并预测接下来会发生什么。”这就是当今大多数著名的人工智能运作的方式。这就像一个学生读完了所有的字典,却从未真正握过一个苹果,感受过它的重量,或品尝过它的甜美。它知道“苹果”、“沉重”和“脆爽”这些词汇,但它并不真正了解什么是苹果。
第二种方法是生物——比如你、我,甚至是一条小虫子——学习的方式。我们不是从阅读手册开始的。我们从移动、碰撞物体、感受饥饿,以及弄清楚推一个球或拉一根绳子会发生什么开始。我们的脑中首先根据这些真实的生命体验来构建一张世界的地图。只有在之后,我们才学会为这些体验贴上标签(语言)。这篇论文讨论了这两种方法之间的差异。它提出了一个重大问题:如果我们想要制造出能够真正理解我们并能在混乱的物理世界中穿行的机器人,我们应该继续往它们脑子里塞书,还是应该让它们出去玩耍?作者们认为,“先玩耍,后说话”的方法可能是当前机器人所缺失的秘诀。
论文的核心思想:从“被动读者”到“主动探索者”
这篇由来自意大利和加拿大的科学家团队撰写的论文指出,我们目前构建人工智能(AI)的方式与自然构建我们的方式是相反的。
目前,AI领域最热门的趋势是“生成式AI”。这些系统通过阅读海量文本和观看视频进行学习。它们在预测句子中的下一个词或视频中的下一帧方面表现得极其出色。论文称之为一种“被动训练机制”。想象一个学生坐在椅子上,盯着屏幕,看着一千个关于人们接球的视频,却从未亲手扔过或接过一次球。他们可能会学到球运动的“统计规律”,但他们并没有学到球撞击手心的“感觉”。作者指出,在这些系统中,语言(文字)是基础。AI先学习语言规则,然后再尝试将图像和动作附加到这些词汇上。
论文建议,生物有机体(如人类、狗甚至蠕虫)的做法恰恰相反。我们首先建立“具身化的世界模型”(grounded world models)。这是一个高级说法,意指我们的脑中基于自身身体在空间中的移动,创造了一张关于世界运作方式的心理地图。我们之所以知道火是热的,是因为我们感受到了热量,而不是因为有人告诉我们“火是热的”。只有在我们拥有了这种物理性的、具身的理解之后,我们才会将语言叠加在其上。对我们而言,词汇只是对那些我们已通过经验获知的事物的标签。
我们的大脑构建更好地图的五种方式
为了证明他们的观点,作者研究了帮助生物构建这些具身地图的五个特定“回路”或大脑部分。他们利用这些例子来说明当今机器人所缺失的东西。
1. GPS 与概念地图
想想你是如何在一个城市中导航的。你不仅仅是在看到红色标志时才左转;你脑中有一个心理地图。你的大脑有一个特殊的系统(在海马体和内嗅皮层中)充当着 GPS 的角色。它使用以六边形图案(像蜂巢一样)排列的“网格细胞”来帮助你精准定位。
但这里最酷的部分在于:这个同样的 GPS 系统不仅适用于物理街道。论文解释说,你的大脑使用这个相同的“网格”来导航“想法”。当你思考一个故事、比较两个不同的概念,甚至理清社交关系时,你的大脑本质上是在一个心理地图中“行走”。论文指出,在生物学中,导航物理空间的能力先于导航抽象思想的能力。目前的 AI 试图直接从文本中学习抽象概念,跳过了物理“行走”的过程。
2. “我能做什么?”探测器(Affordances/功能可及性)
当你看到一把椅子时,你看到的不仅仅是“一个有四条腿的木制物体”。你看到的是“一个我可以坐下的东西”。当你看到一个杯子时,你看到的是“一个我可以抓握的东西”。论文称之为“affordances”。这是视觉与行动能力之间的直接联系。
你的大脑一直在进行一场竞争:“我能爬上那块岩石吗?我能抓起那个苹果吗?”它不仅仅是在描述世界,而是在计算行动的可能性。论文认为,如果一个机器人想要真正理解“小心,那个杯子很脆弱”这句话,它需要拥有一个关于“脆弱”在抓握时是什么感觉的具身模型。它需要知道如果用力过猛,杯子会碎。目前的 AI 知道“脆弱”这个词,但它可能没有那种理解风险所需的内在“肌肉记忆”。
3. 好奇心引擎
你是否曾因为觉得某样东西有趣而产生探索的冲动?这不仅仅是人类的怪癖;这是一种生物驱动力。论文谈到了我们的脑中有一个“元模型”(meta-model),它会追踪我们“不知道多少”。当我们感到好奇时,大脑会释放化学物质(如去甲肾上腺素),让我们变得更加警觉并准备好学习。
这与一个仅仅等待老师给出新数据集的机器人不同。生物个体具有“内在动机”。它们会主动寻求新的体验,以填补自身心理地图中的空白。论文建议,为了让 AI 有效学习,它不应只是等待数据,而应该具备一种内在的驱动力,去寻找那些它尚未理解的事物。
4. 身体的报警系统(Allostasis/稳态调节)
你的大脑不仅仅在思考外部世界,它也在不断监测你的内部世界。它追踪你的饥饿、口渴、体温和能量水平。这被称为“稳态控制”。
想象你的大脑是一个恒温器,它不仅会对冷做出反应,还会预判你会变冷,并在你发抖之前就告诉你穿上外套。这个系统创造了一种“自我”感。它告诉你什么是对你有益的(食物)以及什么是对你有害的(疼痛)。论文认为,这种“我需要这个”或“我想要那个”的内在感觉是所有动机的基础。目前的 AI 系统通常拥有人类赋予的目标(例如“赢得这场游戏”)。它们没有那种驱动它们去行动的内在“饥饿”或“恐惧”。
5. “是我做的吗?”过滤器
当你动动手指时,你的大脑完全知道那看起来会是什么样子。它会向眼睛发送一份动作指令的副本,以便抵消你自身造成的运动。这有助于我们忽略自己引起的运动,从而专注于那些“自主运动”的事物(比如飞过的鸟)。
这就是我们如何区分“自我”与“世界”的方式。如果你碰了鼻子,你知道是你自己干的。如果别人碰了你的鼻子,你会感到惊讶。论文解释说,这种区分“自我产生的动作”与“外部事件”的能力,对于理解因果关系至关重要。如果没有这种能力,机器人可能无法理解是它自己打破了杯子,或者是因为它自己发出了噪音。
这对未来意味着什么
作者谨慎地表示,他们并不是说目前的 AI 是“坏掉的”或生物是“完美的”。他们承认“被动阅读”法在写作和聊天等方面取得了巨大的成功。然而,他们认为,如果我们希望机器人能真正理解物理世界、能与人类自然互动并能自主学习,我们可能需要改变方法。
他们提议,未来的 AI 应该更像生物有机体那样构建:
- 从身体开始: 让 AI 首先通过运动和交互来学习,而不仅仅是通过阅读文本。
- 从底层向上构建地图: 在尝试教授复杂的语言之前,让 AI 先发展出对物体和空间的物理理解。
- 增加自我意识: 给 AI 内在的驱动力(如好奇心或维持平衡的需求),使其成为主动学习者,而非仅仅是被动接受者。
- 进行社会化学习: 正如人类通过与他人互动来学习一样,未来的 AI 可能需要通过与人类和其他智能体共同生活,来建立一种“共享”的世界观。
论文总结道,虽然我们并不确切知道哪些生物特性是必不可少的,哪些仅仅是进化的偶然产物,但忽视生物的学习方式是一个巨大的风险。如果我们想要能真正驾驭我们世界的 AI,我们可能需要停止将其视为一座图书馆,而应将其视为一名充满好奇心的探索者。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。