← 最新论文
🤖 AI

Brain in a Vat: On Missing Pieces Towards Artificial General Intelligence in Large Language Models

这篇观点论文批判了当前大语言模型评估对能力的过度夸大,通过包括任务生成和世界建模在内的四个关键特征定义了通用人工智能,并论证了实现通用人工智能需要通过积极的现实世界参与和迭代的试错学习来弥合“知”与“行”之间的鸿沟。

原作者: Yuxi Ma, Chi Zhang, Song-Chun Zhu

发布于 2026-01-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuxi Ma, Chi Zhang, Song-Chun Zhu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于论文《缸中之脑:论大型语言模型迈向通用人工智能(AGI)所缺失的环节》的解析,通过日常类比将其拆解为简单的概念。

核心思想:“缸中之脑”

想象一个人的大脑从身体中被手术取出,放入了一个装满营养液的罐子里。一台超级计算机直接连接到他的大脑,向他发送电信号,完美地模拟了行走、进食、说话和感知世界的感受。对于罐子里的人来说,生活感觉完全真实。他可以流利地交谈,并能非常详细地描述一个“杯子”。

然而,他从未真正“握住”过杯子,感受过它的重量,或用它喝过水。他之所以知道“杯子”这个词,仅仅是因为计算机告诉他这个词是什么意思。

论文的观点: 像 GPT-4 这样当前的语言大模型(LLM)完全就是这个“缸中之脑”。它们在处理文本和预测句子中下一个词方面非常出色,但它们与物理世界没有任何真实的联系。它们知道事物的“词汇”,但并不了解事物“本身”。


第一部分:为什么我们会被欺骗(“死记硬背”问题)

作者认为,我们之所以认为 LLM 是天才,是因为它们在标准化考试(如 SAT、律师资格考试或 GRE)中得分极高。

类比: 想象一个学生背下了过去 50 年某特定数学考试的所有答案。当你给他一套他已经见过的试卷时,他能拿到满分。但如果你要求他解决一个他从未见过的全新类型的数学问题,或者稍微改变一下数字,他就会表现得一败涂地。他并没有学会“数学”;他只是学会了“模式”。

论文表明,LLMs 也在做同样的事情:

  • 它们擅长“死记硬背”: 它们在拥有大量文本数据的学科(如历史或文学)中表现出色,因为它们记住了其中的模式。
  • 它们在“推理”方面很吃力: 当测试需要实际逻辑、物理知识或解决新问题(如高级数学或科学)时,它们的得分会显著下降。它们只是根据哪些词通常会跟随在其他词后面来进行猜测,而不是理解底层的规则。

第二部分:“语言的旋转木马”

论文描述了一个有趣的实验,其中两个 AI 聊天机器人被留下来互相交谈。

  • 发生了什么: 它们以一句正常的句子开始(“今天天气真热”)。经过几次交流后,它们陷入了循环,只是不断重复说着“谢谢!”和“祝你有美好的一天!”。
  • 教训: 如果没有一个可以互动的真实世界,语言就变成了一场“传声筒”游戏,符号仅仅映射到其他符号。它们并不是在进行关于现实的交流;它们只是在圆圈里互相回响。

第三部分:真正的智能究竟需要什么

作者说,要从“缸中之脑”进化到真正的通用人工智能(AGI),系统需要具备当前 AI 所缺乏的四个特定特质:

  1. 无限任务: 它不应该只能完成固定的清单(如“写一封邮件”或“解一道数学题”)。它需要能够处理出现的任何任务。
  2. 创造新任务: 它不应该只是等待指令。它应该能够观察到一个情境,然后说:“我需要想办法解决这个问题”,并发明一个新的任务来解决它。
  3. 价值体系: 它需要一个“为什么”。就像人类受生存、好奇心或善良驱动一样,AI 需要一套内在的价值观,来决定它下一步应该尝试做什么。
  4. 世界模型: 它需要一个关于现实世界如何运作的心理地图(重力、因果关系、社会规范),而不仅仅是一张关于词语如何相互关联的地图。

第四部分:缺失的环节——“知”与“行”

论文引用了中国哲学家王阳明的观点:“知而不行,非真实之知。”

“杯子”的类比:

  • 当前的 AI: 可以告诉你一个杯子是“圆形的”、“有把手的”、“用于饮水的”。它读过无数遍定义。
  • 真正的智能: 一个婴儿通过抓取、丢弃、感受它的重量、感受它变热、以及水洒出来,从而学习什么是杯子,并意识到:“哦,这是用来盛液体的,如果我把它倾斜得太厉害,水就会洒出来。”

作者认为知识来自于行动。你不能仅仅通过阅读手册(被动输入)来真正理解世界。你必须去触摸、去破坏、去尝试、去失败(主动互动)。

  • “Blicket”实验: 论文提到了一个实验,研究儿童如何学习哪些积木可以启动机器。那些被允许通过“玩耍”积木并进行测试的孩子,比那些仅仅“观看”的孩子学得更快。目前的 AI 就像那个只能观看的孩子;因为它无法触摸零件,所以它无法学习游戏的规则。

第五部分:接下来需要发生什么?

论文的结论是,我们不能仅仅停留在制造更大的文本数据库上。为了构建真正的 AGI,我们需要:

  1. 更好的测试: 我们需要停止测试那些 AI 可能已经从互联网上背下来的内容。我们需要设计能迫使它解决从未见过的全新问题的测试。
  2. 丰富的游乐场: 我们需要构建虚拟世界(元宇宙),让 AI 可以在其中真正地“做”事情。不仅是聊天,还要能拿起物体、感受重量,以及观察打破物体时会发生什么。
  3. 知行合一: 我们需要构建学习与行动合二为一的系统。AI 应该通过尝试、犯错,并根据结果调整自己的理解来学习。

简而言之: 论文指出,“不要再因为 AI 是一个优秀的百科全书而赞美它。它只是一个非常好的模仿者。要让它变得真正聪明,我们需要给它一个身体(或机器人),这样它就可以通过‘做’来学习,而不仅仅是通过‘读’。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →