A criterion for Artificial General Intelligence: hypothetic-deductive reasoning, tested on ChatGPT
该论文提出将假设演绎推理作为通用人工智能的一项基本标准,并通过测试证明了像 ChatGPT 这样的现有模型在复杂语境下的此类推理能力仅具有局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心问题:AI 真的在“思考”吗?
想象一下,你有一个学生,他读遍了图书馆里的每一本书。他能背诵事实、解决数学题,还能写出听起来极其聪明的文章。但如果你问他:“你是怎么得出这个结论的?”或者“为什么会发生这种现象?”,他可能会语塞。他可能通过猜测词语出现的模式给出了正确的答案,但他并不真正理解答案背后的“规则”。
这篇论文提出了一个问题:ChatGPT 真的是在“思考”,还是仅仅是一个非常擅长猜谜的人?
作者 Louis Vervoort 及其团队认为,要被视为真正的“思考机器”(即被称为 AGI 的通用人工智能),AI 必须掌握一项特定的技能,叫做假设演绎推理(Hypothetic-Deductive Reasoning)。
两项关键技能
论文将“思考”拆解为两种主要能力:
1. 因果推理(“多米诺骨牌”测试)
- 定义: 理解如果推倒第一块多米诺骨牌,最后一块也会倒下。这关乎于理解什么是因,什么是果。
- 论文中的测试: 研究人员使用了“神经元图表”(类似于复杂的、由多米诺骨牌组成的流程图)。他们询问 AI:“如果我拉动这个杠杆,哪些其他杠杆会随之移动,哪些不会?”
- 结果: AI 在处理简单的链条时表现尚可,但当多米诺骨牌变得错综复杂(例如某些杠杆会阻挡其他杠杆)时,AI 就糊涂了。它经常会遗漏根本原因或搞错先后顺序。这就像一个人知道“因果”这个词,却无法在杂乱的房间里追踪一根倒下的多米诺骨牌的路径。
2. 假设演绎推理(“食谱”测试)
- 定义: 这是“科学家式”的思考方式。它包含两个步骤:
- 假设: 为问题选择正确的规则手册(理论)。
- 演绎: 遵循该规则手册中的步骤来得出答案。
- 论文中的测试: 研究人员向 AI 提出了物理和逻辑谜题(例如:“如果我推一排方块,其中一个方块是冰做的,当房间变热时会发生什么?”)。
- 秘密武器: 研究人员不仅要求 AI 给出答案,还要求它列出用来得出该答案的规则(假设)。
- 类比: 想象问一位厨师:“你是怎么做这碗汤的?”如果他们说:“我随便扔了些东西进去,”那他们可能只是运气好。如果他们说:“我利用了盐溶于热水的规则,以及洋葱比胡萝卜熟得快的规则,”那么他们是真的在思考。
测试 ChatGPT 时发生了什么?
研究人员测试了旧版本(ChatGPT-3.5)和更新、更聪明的版本(ChatGPT-4)。
“答案正确,理由错误”的问题:
ChatGPT-4 通常能给出正确的答案来应对这些谜题。它的表现非常惊人!然而,当被要求列出它所使用的规则时,它经常会编造事实。- 例子: 在一次测试中,AI 正确地猜到一桶水会洒出来。但当被问及为什么时,它发明了一个与实际物理情况完全无关的虚假规则,称之为“隔热衬衫”。
- 隐喻: 这就像一个学生因为背下了最终数字而答对了数学题,但当被要求展示解题过程时,他却写下了一个即兴编造的公式。
结论:
论文得出结论,虽然 ChatGPT 非常擅长模仿人类对话和解决简单问题,但它目前缺乏真正的理解。- 它就像一只可以完美说出“天空是蓝色的”的鹦鹉,但并不理解天空为什么是蓝色的,也不理解物理意义上的“蓝色”究竟是什么。
- 当问题变得稍微复杂(结合了不同的概念)时,AI 开始失败。它无法一致地将正确的规则与正确的答案联系起来。
“AGI”的标准
作者为什么是“通用人工智能”(AGI)设定了一个很高的门槛。他们认为,只有当 AI 能够做到以下几点时,才算是在真正“思考”:
- 解决一个问题。
- 明确列出它用来解决该问题的规则和理论。
- 在许多不同类型的问题中都能一致地做到这一点(而不只是针对某一种问题)。
总结:
目前,ChatGPT 是一个出色的即兴表演者。它可以“信口开河”并听起来很聪明。但它尚未证明自己拥有关于世界运作方式的深层逻辑地图。要成为真正的“思考机器”,它需要停止仅仅猜测下一个词,而是开始证明为什么那个词是正确的,并使用真实的规则进行一步步的论证。
在 AI 能够持续通过这些“列出规则”的测试之前,论文指出,它还称不上是真正的 AGI。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。