The Hidden Cost of Thinking: Energy Use and Environmental Impact of LMs Beyond Pretraining
本文揭示,现代语言模型开发的环境影响主要由后训练实验和复杂推理流程主导——这两者占总计算量的 82.2%,且使推理模型的后训练成本比指令微调模型高出 17 倍——凸显了当前环境报告标准中一个关键且未被披露的缺口。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是用简单语言和日常类比对论文《思考的隐藏成本》的解释。
全景图:AI 成本的冰山
想象一下,你正在建造一座高科技工厂,用来烘焙完美的蛋糕(一个智能 AI 模型)。多年来,人们只计算烘焙最终蛋糕所消耗的电力,并将这个数字标注在标签上。
这篇论文认为,这就像只看冰山露出水面的一角。作者潜入水下测量了整座冰山。他们发现,烘焙最终模型实际上只是故事的一小部分。真正的能源消耗、碳排放和用水量,发生在最初摸索如何烘焙蛋糕的混乱实验过程中。
1. “思考”模型能耗惊人
研究人员研究了一个名为Olmo 3的新型 AI 模型家族。他们构建了两种类型:
- “指令”模型:能很好地遵循指令(就像一个乐于助人的助手)。
- “思考”模型:通过“思考”步骤来解决复杂问题(就像一位正在推导证明的数学家)。
类比:
想象“指令”模型是一名短跑运动员。它跑完短程比赛并冲过终点。“思考”模型则是一名马拉松运动员,它在途中停下来解决谜题。
- 发现:训练“思考”模型所需的能源是“指令”模型的17 倍。
- 原因:“思考”模型必须生成海量的“练习跑”(称为 rollout),以学习如何进行推理。这就像一个学生必须写出 100 篇练习作文,才能学会写好一篇好文章。论文将这种现象称为“思考的成本”。
2. “隐藏”的成本:试错
这篇论文最大的惊喜在于开发成本。
- 旧观念:我们曾认为大部分能源都用于最终的训练运行(即“期末考试”)。
- 新现实:82%的总能源被用于实验。这包括失败的尝试、测试不同的设置,以及在最终模型构建之前尝试不同的数据混合。
类比:
想象一位厨师试图创造一道新的招牌菜。
- 最终菜肴:端给顾客的那道菜(最终模型)。
- 开发过程:厨师烧掉了 100 锅汤,扔掉了 50 批饼干,并品尝了 20 种不同的香料混合物,才终于做对。
- 论文观点:如果你只计算端给顾客的那道最终菜肴所消耗的电力,你就忽略了厨房里烧掉的 100 锅汤。论文发现,对于现代 AI 而言,烧掉的汤(失败的实验)的成本是最终菜肴的5 倍。
3. 水资源问题:并非数据中心的错
论文还考察了用水量。他们发现该过程消耗了大量水资源(足够一个人饮用 140 年)。
类比:
许多人认为 AI 用水是因为计算机发热,需要用水冷却(就像汽车散热器)。
- 现实:该数据中心使用了“闭环”系统,意味着冷却过程没有造成水资源流失。
- 真正的罪魁祸首:水被用于制造电力以驱动计算机。发电厂(燃煤、燃气、核能)需要消耗大量水资源来产生运行 AI 所需的电力。
- 教训:如果你想节约用水,你不仅需要制造更好的计算机;还需要改变我们为其供电的电力生产方式。
4. 总账单
当研究人员将所有内容相加——最终训练、失败的实验、数据生成以及硬件制造——构建 Olmo 3 模型的总成本为:
- 能源:约 1230 万千瓦时(足以供 847 个美国家庭使用整整一年)。
- 碳排放:约 4251 吨二氧化碳。
- 用水:约 1588.7 万升。
为什么这很重要
论文得出结论,我们目前报告 AI 环境影响的方式是行不通的。我们只报告“最终运行”的成本,这使得问题看起来比实际情况小得多。
随着 AI 模型变得更智能、需要更多的“思考”(推理),以及开发过程变得更加复杂,这些隐藏成本将急剧飙升。作者呼吁开发者停止隐藏“烧掉的汤”,开始报告整个厨房的全部成本,而不仅仅是最后一顿饭。
简而言之:构建智能 AI 很昂贵,但摸索如何构建它的过程更加昂贵,而“思考”模型则是所有模型中能耗最高的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。