← 最新论文
💻 computer science

Data-Environment Coverage and the Path from Narrow to General AI:A Cyber-Physical-Social-ThinkingSurvey

本文认为,当前人工智能在因果推理、社会认知和符号组合方面的持续局限性源于缺乏多样化的数据环境而非规模不足,并通过对八十个系统的调查证明,整合物理、社会和思维空间信号对于实现从狭隘模式识别向通用智能的跨越至关重要。

原作者: yi peng, Huansheng Ning, Jianguo Ding

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: yi peng, Huansheng Ning, Jianguo Ding

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人理解这个世界。在过去的十年里,人工智能(AI)领域最重大的突破都来自于向这些机器人喂养海量的数字信息——文本、图像、代码和视频。这就像是给一个学生提供了一座关于海洋的无尽图书馆:他们可以背诵关于潮汐、鱼类和风暴的所有事实,并能写出关于大海的美丽散文。但如果你要求他们真正去游泳,去感受冰冷的水流,或者去应对从未见过的洋流,他们可能会手足无措。这就是目前的“弱人工智能”(Narrow AI)的状态:这些系统擅长处理数字数据,但在处理像因果关系、理解人类意图或需要超越单纯模式匹配的逻辑推理等复杂、混乱的现实世界事务时,却显得力不从心。科学家们将构建这样一种能够胜任所有这些任务的机器体的目标称为“通用人工智能”(AGI)。每个人都在问的一个大问题是:为什么我们还没能实现它?是因为我们的计算机不够大,还是因为我们在教导这些机器的方式上遗漏了什么?

这篇由研究员 Yi Peng、Huansheng Ning 和 Jianguo Ding 撰写的论文认为,问题不在于计算机的大小或我们拥有的数据量,而在于这些数据的来源。作者指出,目前的 AI 正困在“仅限网络”(Cyber-only)的泡沫中,仅通过数字记录进行学习。他们认为,要变得真正聪明,AI 需要走出图书馆,进入现实世界。他们提出了一种看待 AI 学习的新方式,称为“CPST”框架,即网络-物理-社会-思维(Cyber-Physical-Social-Thinking)。你可以把它看作是一个四维的现实地图:

  • 网络(Cyber): 文本、代码和文件的数字世界(当前 AI 所处的世界)。
  • 物理(Physical): 物体、重力和因果关系的物理世界(比如你可以推一下杯子,然后看到它掉落)。
  • 社会(Social): 人类情感、意图和规则的世界(你需要猜测他人的想法)。
  • 思维(Thinking): 严格逻辑、数学和结构化符号的世界(你可以通过它来证明一个定理)。

论文指出,要从一个“智能计算器”进化到“通用智能”,AI 需要在所有这四个世界中实现闭环,而不仅仅是在数字世界中。

巨大的数据泡沫

研究人员调查了八十个不同的 AI 系统,涵盖了从早期的图像分类器到当今最先进的机器人和聊天机器人。他们根据这些系统在多少个“世界”(网络、物理、社会、思维)中实现了“闭环”进行了分类。所谓闭环,是指系统不仅是读取数据,还能对世界产生作用,观察结果,并从中学习。

以下是他们的发现,对于那些崇尚“越大越好”的人来说,这可能有点令人震惊:在他们列出的八十个 AI 系统中,没有任何一个系统成功地在超过两个的世界中实现了闭环。

那些纯粹数字化的(仅限网络)最先进系统正撞上一道难以逾越的屏障。它们非常擅长识别所见数据的模式,但在需要现实世界理解的任务面前却表现得一塌糊涂。例如:

  • 因果推理: 如果你给一个数字化的 AI 看一段机器人堆叠积木的视频,它可能会猜出下一步动作。但如果你问它,“如果我拿掉底部的积木会发生什么?”(这是一个反事实问题),它往往会出错。因为它没有真正“感受”过重力,也没有“推过”积木,所以它并不真正理解物理学。
  • 社会认知: 现在的 AI 可以模仿人类对话,但如果一个人隐藏了真实情感,它就很难理解对方在想什么。这就像在玩扑克牌,你能看清牌面,却无法读懂玩家的面部表情或肢体语言。
  • 逻辑推理: 虽然 AI 可以通过猜测模式来解决数学问题,但当被要求遵循一套严格的、需要对照规则检查自身工作的逐步逻辑路径时,它经常失败。

论文明确排除了“仅仅通过扩大规模(增加参数或训练更多文本)就能解决问题”的观点。他们指出,即使是最庞大、最强大的模型,仍然困在“网络”区域。它们就像一位读遍了全世界所有食谱的厨师,却从未真正接触过炉灶,也从未品尝过菜肴。无论读多少书,如果从未亲自动手,也永远学不会如何烹饪出一顿完美的饭菜。

缺失的要素

作者使用了一个巧妙的比喻来解释为什么“仅限网络”的方法会失败。他们说,这四个世界中的每一个都提供了其他世界无法产生的独特“信号”:

  • 要学习因果关系(因果效应),你需要物理数据。你必须实际“做”一些事情,并观察结果。你不能仅仅通过阅读一本关于物理的书来学习这一点。
  • 要学习社会智能(理解人类),你需要社会数据。你必须与真实的人互动,观察他们的反应,并调整自己的行为。你不能仅仅通过阅读聊天记录来学习这一点。
  • 要学习复杂逻辑,你需要思维数据。你需要一个可以查询和修改的结构化符号与规则系统,而不仅仅是一堆文本。

论文为此提供了有力的证据。他们对比了在除输入数据外完全相同的 AI 系统:

  • 当一个机器人在其他机器人移动的视频上进行训练时,它无法规划自己的动作。但当同一个机器人接受了关于它自己移动并与物体互动的真实视频训练后,它突然学会了如何规划和操作它从未见过的东西。
  • 同样,一个仅作为语言模型的数学解题 AI 几乎答不对任何问题。但当他们将同一个语言模型连接到一个严格的逻辑引擎(一个“思维”工具)时,它的表现大幅飙升。

数据呈现出一个清晰的模式:如果系统能与额外的一个世界(如物理或思维)进行交互,它们更有可能达到更高的能力水平。然而,通往 AGI 的“圣杯”——即一个能同时处理所有四个世界的系统——依然是空白的。在他们对八十个系统的调查中,零个系统成功地在三个或更多世界中实现了闭环。那个真正的“通用智能”应该存在的地图区域,目前还是一片无人区。

通往通用智能的路线图

那么,我们该何去何从?作者不仅指出了问题,还提出了一个三步走的路线图来解决它。

  1. 语义对齐(Semantic Alignment): 我们需要教 AI 如何在这些不同的世界之间进行翻译。现在,AI 可能理解物理传感器的读数,但不知道这如何与一条社会规则或一个逻辑事实相联系。我们需要建立桥梁,让 AI 能够说:“机器人撞到了杯子(物理),这让那个人生气了(社会),所以我应该道歉(思维)。”
  2. 统一世界模型(Unified World Models): 我们需要构建一个能够同时容纳所有这些不同类型信息的单一“大脑”。与其拥有一个负责物理的大脑、一个负责社会规则的大脑和一个负责数学的大脑,我们需要一个能同时驾驭所有这些领域的单一系统。
  3. 治理(Governance): 随着 AI 开始与现实世界(物理)和真实人类(社会)互动,我们需要新的安全规则。我们不能只检查代码,我们还需要确保 AI 理解其行为在现实世界中的后果。

论文以一个大胆的预测结束:通往 AGI 的路径不在于建造更大的计算机或从互联网上抓取更多的文本。而在于构建能够触摸、感受并与物理世界互动的机器人;创造能够进行真实对话和谈判的系统;以及设计能够进行严格逻辑推理的工具。直到 AI 系统能够走出数字图书馆,进入这个由网络-物理-社会-思维构成的、复杂且四维的现实世界之前,它们都将只是聪明但受限的学生,无法毕业成为真正的通用智能。

作者谨慎地指出,这是一个有强有力证据支持的假设,但尚未成为被证实的定律。他们建议,如果一个纯数字化的 AI 确实能在从未接触过现实世界的情况下解决了所有这些问题,那么他们的理论就是错误的。但到目前为止,证据指向了一个清晰的方向:要构建通用智能,我们必须停止将世界视为一个数据集,而要将其视为一个游乐场。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →