Empirical Computation: Prompting versus Programming
这篇愿景论文提出了“经验计算”(empirical computation)这一新范式,即大型语言模型通过提示词而非传统编程来解决计算问题,并指出其独特的能力与局限性要求软件工程界开发新的基础理论与技术,以分析其正确性及根本边界。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有两种完成工作的方式:编程 (Programming) 与 提示 (Prompting)。
旧的方式:编程(严谨的建筑师)
把传统的编程想象成雇佣了一位严格、按部就班的建筑师。你给他们一份蓝图,上面有精确的尺寸、特定的材料和一步步的计划。
- 运作方式: 你告诉计算机如何精确地解决一个问题,比如对一组数字进行排序。你会说:“使用这个特定的算法(归并排序),取这些输入,并遵循这些规则。”
- 结果: 如果建筑师犯了错,你可以找到蓝图中出错的那块砖,修复它,并确信下次建筑一定会稳固。
- 局限性: 建造所需的时间取决于数学的复杂度。对一个巨大的列表进行排序所需的时间是可预测的,其时间复杂度为 。
新的方式:提示(直觉敏锐的艺术家)
现在,想象你雇佣了一位才华横溢、直觉敏锐的艺术家。你不需要给他们一份蓝图。你只需说:“嘿,这里有一堆乱七八糟的数字,你能帮我排序吗?”
- 运作方式: 你使用自然语言(即“提示词”)来描述问题。这个“计算机”(大型语言模型或 LLM)并不遵循一套严格的规则。相反,它根据在互联网上读过的所有内容,来猜测最可能的答案。这就像一位厨师通过品尝汤的味道来猜测食材,而不是遵循食谱。
- 结果: 答案很快就会返回,但它是一个猜测,而不是一个保证。它是“最可能的”答案,而不是“被证明正确的”答案。
论文的发现:令人惊讶的“经验主义”发现
论文作者进行了实验,观察这种“直觉敏锐的艺术家”在处理经典数学问题(如数字排序或在列表中查找项目)时的表现。以下是他们的发现:
1. 时间并不以同样的方式运作
- 编程: 如果你将需要排序的项目数量增加一倍,所需的时间会以特定的数学方式增长。
- 提示: LLM 排序数字所需的时间随着列表变大呈线性增长(即一条直线)。这不是因为数学变得更难了,而是因为 LLM 需要阅读和写入更多的单词(Token)来处理更长的列表。这就像读一本更长的书,所需时间增加是因为要读完更多的文字,而不是因为故事本身变得更复杂了。
2. 准确率随规模扩大而下降
- 编程: 一个正确的程序永远是 100% 正确的。
- 提示: LLM 在处理小任务时表现出色,但随着列表变长,它会感到困惑。
- 对于一个包含 50 个数字的列表,LLM 的正确率约为 90%。
- 对于一个包含 150 个数字的列表,它的正确率仅为 58%。
- 如果你要求它在一个短字符串中寻找特定模式,一旦字符串稍长,它可能几乎会立即失败。
- “思考”模式: 当允许 LLM 在回答前进行“思考”(即逐步推理)时,它的准确率保持得很高,但所需的时间也大大增加了。
3. 语言游戏
- 编程: 无论你用英语还是德语编写代码,计算机读取符号的方式都是一样的。
- 提示: LLM 会受到它在互联网上阅读内容的偏见影响。
- 如果你要求 LLM 排序以英文单词形式呈现的数字(“one, two, three”),它做得很好。
- 如果你要求它排序以德文形式呈现的数字(“eins, zwei, drei”),它几乎完全失败了。
- 为什么? LLM 在互联网上见过数百万个英文示例,但看到的德文示例却少得多。这就像请一位厨师去做一道他从未见过的菜;他可能会猜错。
4. “坏掉的砖块”问题
- 编程: 如果一个程序失败了,你可以找到 Bug,修复代码,然后问题就永久解决了。
- 提示: 如果 LLM 给出了错误答案,你无法轻易找到其中的“Bug”。你不能指向某一行代码去修复它。你可能会尝试改变提示词,或者要求它“再思考一下”,但这并不能保证下次一定会奏效。这就像试图通过改变做梦者的心情来修复一场梦境一样。
核心启示
论文指出,我们正在进入一个被称为**“经验计算” (Empirical Computation)** 的新时代。
在旧世界里,我们信任计算机是因为它们遵循严格的规则(理性主义框架)。在这个新世界里,我们信任计算机是因为它们基于数据做出“受过教育的猜测”(经验主义框架)。
作者呼吁软件工程师不要再试图用分析传统程序的旧方法来分析这些 AI 系统。我们需要新的工具来衡量、测试和理解这些“猜测机器”是如何工作的,因为旧的数学和逻辑规则已不再完全适用。我们需要弄清楚,如何去信任一个“大概正确”而非“绝对正确”的结果。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。