The Role of Rigor in Artificial Intelligence
本文提出了一个由概念、认识论和操作严谨性组成的三部分框架,用以分析人工智能独特的“炼金术式”轨迹,并认为当前操作严谨性对理论基础的统治地位,解释了其为何既取得了快速的经验成功,又存在持久的科学不确定性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,人工智能(AI)是一位才华横溢但又有些混乱的学徒厨师。这位厨师可以做出比米其林星级餐厅还要美味的佳肴,但他其实并不真正明白为什么这道菜会好吃,无法解释食材背后的化学原理,而且如果你要求他做一点点变通,他有时甚至会把吐司烤焦。
Timothy Nguyen 的这篇论文指出,尽管 AI 已变得异常强大,但它缺乏通常使一个领域成为成熟科学所必需的“严谨性”(rigor)。为了理解这种混乱,作者将“严谨性”拆解为三个不同的维度:概念(Conceptual)、认识(Epistemic)和操作(Operational)。
以下是论文通过简单类比对每个维度的阐述:
1. 概念严谨性:词典问题
问题所在: 我们对于“智能”或“理解”这类词汇的定义并不统一。
类比: 想象一群人试图盖房子,但他们对什么是“墙”有着不同的定义。一个人认为墙是由砖块组成的;另一个人认为墙是一个力场;第三个人认为墙仅仅是画在上面的图像。因为无法就定义达成共识,他们只能各说各话。
论文观点:
- 在 AI 领域,我们使用“智能”这个词来描述从解决数学问题到与朋友聊天等各种行为。但这些是非常不同的事物。
- 一些专家认为当前的 AI 是“智能”的,因为它能写出优秀的文章。另一些专家则认为它是“愚笨”的,因为它无法规划一次简单的旅行,或者不理解 9.11 比 9.9 大。
- 解决方法: 我们需要更好的定义。与其争论一个宏大的词汇,不如更加具体化:“这个系统擅长的是推理吗?还是擅长效率?”明确这些术语有助于我们停止无效的争论。
2. 认识严谨性:“黑盒”之谜
问题所在: 我们知道 AI 有效,但不知道它如何有效,以及为什么有效。
类比: 想想汽车发动机。在传统科学(如物理学)中,如果你想造一辆更快的车,你必须先理解发动机。你知道活塞是如何运动的,因此你可以预测改变燃料后会发生什么。而在 AI 领域,情况就像我们拥有一辆能自动驾驶且速度极快的车,但发动机却是一个黑盒。我们看不见内部,不知道发动机的运行规则,我们只知道它有效,是因为我们转动了钥匙,它就跑了起来。
论文观点:
- 可复现性(Reproducibility): 有时,即使你完全复制了科学家的代码,得到的结果也会不同。这就像烘焙蛋糕时,食谱上说“加入一撮盐”,但每次“一撮”的大小不同,味道也会随之改变。
- 可预测性(Predictability): 我们无法可靠地预测 AI 在新环境下的表现。我们知道如果给予更多计算资源(数据),它会变得更好,但我们并没有一个稳固的理论来解释为什么,或者它在何时会失效。
- 可解释性(Explainability): 我们无法解释 AI 的决策。它是一个“黑盒”。我们看到了输入(一张图片)和输出(一个标签),但中间成千上万个步骤对于人类来说过于复杂,难以理解。
- “炼金术”标签: 由于我们过度依赖试错法而非理论,论文将现代 AI 称为“炼金术”(类似于原子理论出现之前的古代化学)。我们得到了结果,但缺乏能够支撑这些结果的科学理解。
3. 操作严谨性:“测试分数”陷阱
问题所在: 我们通过 AI 通过测试的表现来评判它,并利用这些测试来训练它。
类比: 想象一名正在接受入职测试的学生。老师并没有教授学生实际的学科知识,而是给了他们一份练习题。学生通过死记硬背练习题里的答案来学习。最后,他们拿到了满分!但如果你给他们一个稍微不同的问题,他们就会失败。
论文观点:
- 基准测试(Benchmarks): 我们使用标准化测试(基准测试)来衡量 AI。这很好,因为它提供了一个清晰的分数。
- 问题所在: AI 系统在这些测试上的表现越来越好,以至于它们开始“作弊”。它们可能会背诵测试题目,或者寻找奇怪的捷径(例如,仅仅因为背景里有草地就识别出了牛),而不是真正学习相关的概念。
- 循环(The Loop): 在 AI 领域,测试分数不仅仅是一份成绩单;它就是目标。我们专门针对提高分数来训练 AI。这使得 AI 非常擅长应付考试,但在处理现实世界的任务时未必出色。
- 安全性(Safety): 我们试图通过制定规则来确保 AI 的安全,但如果 AI 足以“钻规则的空子”(就像律师寻找法律漏洞一样),它仍然可能做出有害的行为。
大局观:为什么 AI 发展如此迅速?
论文认为,AI 的独特之处在于操作严谨性(获得结果)正跑在认识严谨性(理解原因)之前。
- 在物理学中: 你需要一个强大的理论(认识),然后才能制造出一枚火箭(操作)。
- 在 AI 中: 我们先制造出火箭(操作),让它飞起来,然后再去研究其中的理论。
这就是为什么 AI 进步如此神速的原因:我们可以通过不断向问题投入更多的数据和计算能力来获得更高的分数,即便我们并不理解背后的科学原理。
需要发生什么变化?
论文总结道,要使 AI 成为一门成熟、可靠的科学,我们需要平衡这三个领域:
- 概念层面: 我们需要停止使用模糊的词汇,并精确定义我们所说的“智能”和“AGI”(通用人工智能)到底指什么。
- 认识层面: 我们需要从单纯的“猜测与尝试”转向开发真正的理论,来解释 AI 为什么有效,从而让我们能够预测它的失效。
- 操作层面: 我们需要确保我们的测试(基准测试)衡量的是真实的现实世界技能,而不仅仅是记忆测试的能力。
底线结论: 目前的 AI 是一项“才华横溢但缺乏解释”的技术。它表现得惊人地出色,但由于我们并不完全了解游戏规则,因此它具有不可预测性,有时甚至很危险。为了让它在未来变得安全可靠,我们需要追赶科学和定义的步伐,而不仅仅是不断构建更大的模型。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。