Process-Constituted Intelligence: A Shared Criterion for Humans and Machines
本文认为,真正的智能是由迭代的认知过程而非输出所定义的,并提出了一个基于七个过程特征的“强等价”框架,用以区分人类认知与仅能复制输出痕迹的当前生成式人工智能,同时提供了设计原则与审计方法,以确保人工智能工具是增强而非侵蚀人类的生成能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
智力往往被误认为是最终的结果:解出的方程、完成的画作、对话中给出的正确答案。几十年来,科学家们一直在争论,一台产生与人类相同结果的机器是否真的在思考。这个问题已从哲学领域转向了生成式人工智能的日常现实——这些工具可以撰写论文、生成代码并创造出与人类作品无异的图像。核心问题不仅在于输出是否优秀,而在于它是如何达成的。在心灵研究中,长期存在着一种区分:一种系统仅仅是匹配人类行为,而另一种系统则是真正复制了产生该行为所需的内部活动。前者就像是一张显示目的地的地图;后者则是旅程本身,包含了所有的转弯、停顿和怀疑时刻。理解这种区别不再仅仅是一个学术练习,因为当人类依赖机器来代替自己思考时,他们可能会跳过那些构建自身思考能力的必要步骤。
来自麦考瑞大学及其他机构的一个研究小组提出了一种衡量智能的新方法,该方法完全聚焦于这一“旅程”。他们认为,真正的智能是由过程构成的——即尝试、失败、修改和学习的迭代活动——而非输出本身。为了测试这一点,他们开发了一个框架,通过七个具体的特征来观察问题的解决过程。这些特征包括:愿意进行多次尝试并舍弃失败尝试的意愿;在不急于给出确信答案的情况下忍受不确定性的能力;以及从材料或环境提供的阻力中学习的能力。他们还观察了解决者如何进行对话、如何对自己负责,以及挣扎本身如何塑造从事这项工作的人。研究人员指出,要使机器真正等同于人类心智,它不仅必须产生正确的答案,还必须以自己的方式展现出这七个特征。
当研究人员将这一框架应用于当前的生成式人工智能时,他们发现了显著的差距。这些系统是基于人类思维的“痕迹”进行训练的:完成的论文、发表的代码和编辑过的图像。它们通过对大量已完成作品的采样,学习如何重现最终产品。虽然输出看起来像是推理或创造力,但人类产生这些内容的内部活动在其中基本是缺失的。机器不会在问题上挣脱挣扎,也不会经历通过多年实践积累而成的判断力的缓慢积累。它只是根据之前看到的模式,预测下一个可能的词或像素。研究人员将此描述为“弱等效”:机器匹配了输入和输出,但连接两者的过程却是缺失或模糊的。即使这些系统通过展示其“解题步骤”(例如在给出答案前列出步骤)来表现出在“思考”,这通常也只是一种装饰性的展示。这些步骤并不一定驱动计算;它们只是旨在看起来像是在推理的另一层输出。
该研究明确反对仅仅通过扩大这些模型的规模或给予更多数据来解决这一问题的观点。向训练集添加更多文本只会提供更多的“完成态痕迹”,而不是构建智能所需的那些混乱且具有迭代性的过程。研究人员也拒绝了“机器必须模仿人类大脑的精确生物架构才能具备智能”的观点。他们提出了一个名为“强等效”的中庸之道。这并不要求机器使用与人类大脑相同的算法,因为这既不可能也不理想。相反,它要求机器的行为由同样的七个过程特征组织起来,即便其物理机制不同。例如,机器可以通过建立一种机制来体现“对不确定性的参与”——即在收集到更多信息之前,标记出模糊的问题并拒绝给出确信的答案,而不是通过产生“怀疑感”。
对人类用户而言,其影响与技术诊断同样关键。研究人员指出,当一个人使用执行生成性工作的工具时,原本通过该项工作本可以建立的能力便无法形成。针对使用人工智能的学生的研究证据表明,虽然他们在工具辅助下表现更好,但在移除工具后表现往往会下降,因为他们跳过了进行学习所需的认知努力。危险不仅在于技能的丧失,更在于形成的失败。那些困难、不确定且具有对话性的活动,正是塑造一个人的判断力和智慧的关键,而这恰恰是人工智能工具最倾向于绕过的部分。如果一个工具解决了用户的模糊性,用户就永远无法学会如何面对这种不确定性。如果一个工具提供了答案,用户就永远无法练习通过试错来培养品味与判断力。
为了应对这一问题,作者对设计人工智能和使用人工智能都提出了新的建议。在机器端,他们建议构建能够迫使系统参与过程的架构,例如让代理(agent)在受到另一个代理挑战时必须修改其方法,而不仅仅是对答案进行投票。在人类端,他们倡导“保留过程”式的辅助。这意味着工具应提供下一个问题或一个反例来扩展用户的思维,而不是直接提供答案。目标是将生成性的步骤留在人手中,确保工具是支持思考活动,而非取代思考。研究人员还概述了一种“过程审计”的方法,即人类和机器使用相同的七个特征作为评分准则在相同任务上接受测试。这将允许科学家衡量机器是在真正参与过程,还是仅仅在模仿过程的形式,并衡量人类用户在使用这些工具辅助时是否保留了其认知能力。
最终,论文指出,一个产生智能的系统与一个构成智能的系统之间的区别,在于记录一个事件与经历一个事件之间的区别。随着这些工具变得越来越强大,重点必须从优化输出转向工程化过程。研究人员并不声称已经解决了智能之谜,也不认为当前的人工智能毫无用处。相反,他们提供了一个清晰的标准,指出了缺失的部分,并为构建尊重思考过程(无论是在硅基还是人类心智中)的系统指明了路径。通过关注活动而非结果,我们可以确保随着机器变得更加强大,它们不会在无意中侵蚀它们本应支持的人类能力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。