✨ 要点🔬 技术摘要
想象一下你正在经营一家面包店。多年来,你只关心一件事:你的蛋糕有多好吃 (性能)。你把蛋糕做得越来越大,使用的面粉和糖也越来越多(参数),并假设越大就意味着越好。
但最近,你意识到了一些可怕的事情:你的面包店消耗电力的速度惊人,而且烤箱的碳足迹正在伤害地球。你也意识到,虽然你花了巨资在烘焙蛋糕(训练)上,但你每天仅仅是在交付 这些蛋糕(推理)时,就会花费更多的钱。
这篇论文介绍了一个名为 ECOpt (能量消耗优化器)的新工具,旨在帮助面包师(机器学习工程师)解决这个问题。以下是它的工作原理,我们使用简单的类比来解释:
1. 问题所在:“越大越好”的迷思
长期以来,科技界一直认为,如果你只是数一数食材的数量(参数)或搅拌步骤的数量(数学运算,称为 FLOPs),你就能猜出烘焙一个蛋糕需要多少能量。
作者对此进行了测试,发现这就像仅仅通过数引擎里的螺栓数量来猜测汽车的油耗一样。这根本行不通。
他们发现,改变你移动食材的方式(比如改变食谱中的“步长/stride”)可以在不改变食材数量的情况下节省大量能量。
他们还发现,仅仅因为一台机器功能强大(比如一个巨大的工业烤箱),并不意味着它就是高效的。如果你用一个巨大的烤箱去烤一个小蛋糕,烤箱为了保持热度会浪费大量的能量,即使蛋糕本身很小。
2. 解决方案:“智能菜单” (ECOpt)
与其靠猜,作者构建了一个名为 ECOpt 的工具。你可以把它想象成一个智能菜单规划师 。
平衡的艺术: 通常,你必须做出选择:“我是想要最美味的蛋糕(高性能),还是想要成本最低的蛋糕(高能量效率)?”
帕累托前沿 (Pareto Frontier): ECOpt 绘制了一张名为“帕累托前沿”的地图。想象一张图表,X 轴是“美味度”,Y 轴是“能量成本”。该工具能找到那条“甜点曲线”。这条曲线上的每一个点都代表一种蛋糕,在这种情况下,你无法在不支付更多能量代价的前提下获得更多的美味,也无法在不损失部分美味的前提下节省更多能量。
结果: 它为面包师提供了一份选项清单。“这是一个美味度为 90% 但能节省 50% 能量的蛋糕。这是另一个美味度为 95% 但能节省 20% 能量的蛋糕。”你可以根据自己能接受的权衡进行选择。
3. 实验中的关键发现
作者在真实的“蛋糕”(AI 模型)上测试了这个工具,并发现了一些令人惊讶的事情:
硬件一致性: 他们在不同的机器(笔记本电脑、台式机、超级计算机)上测试了同一个模型。令人惊讶的是,能量效率 (每滴电能做多少“功”)在所有这些机器上都非常相似。这意味着我们应该开始为我们的模型发布能量数据,就像我们在食品上标注卡路里一样,因为这些数字足够可靠,可以进行比较。
“空烤箱”效应: 他们发现,如果你在一个庞大、强大的计算机上运行一个小模型,计算机会浪费能量,因为它没有被充分利用。这就像是用喷气发动机来驱动一辆自行车。他们使用 ECOpt 来调整“批大小 (batch size)”(一次烘焙多少个蛋糕)以填满烤箱。仅这一项改变就让过程的效率提升了 38 倍 。
回本速度: 工具本身运行优化也需要消耗一点能量。然而,作者计算出,在生成仅仅 4,802 个 token (文本片段)之后,通过使用优化设置所节省的能量就已经抵消了运行该优化工具所消耗的能量。这是一个快速获益的过程。
4. 寻找新食谱(神经架构搜索)
最后,他们使用 ECOpt 从零开始发明新的蛋糕食谱(一个被称为“神经架构搜索”的过程),用于特定的任务(识别动物图像)。
他们不仅仅是在寻找“最好的”蛋糕,而是在寻找最佳的平衡 。
他们发现了 7 种新食谱 ,在同时考虑美味度 和能量成本 时,这些食谱优于目前的“最先进水平”(已知最好的食谱)。
他们发现,针对速度(延迟)的最佳食谱与针对能量的最佳食谱是不同的。一个宽而浅的蛋糕可能很快,但一个深而窄的蛋糕可能更省电。ECOpt 能帮你找到符合你特定需求的正确形状。
核心结论
这篇论文指出,我们不能只是不断制造更大、更贪婪的 AI 模型。我们需要聪明地进行烘焙。ECOpt 是一个工具,它帮助工程师停止猜测,开始做出明智的选择,确保他们的模型不仅聪明,而且具有高能量效率并对环境友好。它将“绿色环保”这个模糊的概念转变为设计过程中一个具体且可衡量的组成部分。
技术摘要:优化机器学习中的能效与性能
问题陈述 机器学习(ML)模型计算复杂性的指数级增长,导致了能源消耗和环境影响的显著增加。尽管近期法规(如《欧盟人工智能法案》)要求公布能源使用情况,但目前的机器学习研究主要侧重于模型性能,往往忽略了能源指标。现有文献频繁依赖参数量和浮点运算量(FLOPs)作为能源消耗的代理指标,然而这些指标与实际能源使用量往往并不相关。此外,先前关于机器学习环境影响的研究大多忽略了推理成本,尽管推理通常占据了机器学习计算成本的大部分(例如,在 AWS 上高达 90%)。目前的碳足迹估算工具通常需要高度的代码耦合,且无法为提高效率提供具有操作性的反馈,同时超参数调优器通常也不考虑环境影响或推理成本。
方法论 为了解决这些差距,作者开发了 ECOpt (能源消耗优化器),这是一个旨在同时优化模型超参数以兼顾能效与性能的 Python 框架。
优化公式: 该问题被构建为一个多目标优化任务。系统在超参数空间 S S S 中进行搜索,以寻找性能指标(f p f_p f p ,例如准确率)与能源效率指标(f e f_e f e )之间的帕累托前沿(Pareto frontier)。
能源测量: ECOpt 利用基于软件的能量计,特别是 CodeCarbon ,该工具聚合了来自设备驱动程序(例如用于 GPU 的 NVIDIA nvidia-smi 和用于 CPU 的 RAPL)的功耗数据。该框架专注于计算能耗,将效率量化为“每焦耳样本数”(或文本生成的“每焦耳 Token 数”)。它统计了所有活跃组件(CPU、GPU、RAM)的功率消耗,而非仅仅是加速器。
优化算法: 该框架采用了使用期望超体积改进(Expected Hypervolume Improvement, EHVI)采集函数(具体为并行噪声 EHVI,即 q q q NEHVI)的多目标贝叶斯优化(MOBO) 。选择这种方法是因为其具备样本效率,能够以比随机搜索或网格搜索更少的评估次数发现权衡曲线(帕累托前沿)。
工作流: 过程包括将数据集拆分为训练集和评估集。在每次迭代中,ECOpt 构建并训练一个采样超参数的模型,在评估集上执行推理,测量目标值,并更新用于指导下一步搜索的代理模型(高斯过程)。
核心贡献
权衡形式化: 作者将机器学习中性能与能源之间的权衡搜索形式化为一个多目标优化问题。
自动化流程: 他们描述了一种基于 MOBO 的全自动化程序,用于发现表征这种权衡的经验帕累托前沿。
开源框架: ECOpt 以可复用的 Python 包形式发布,包含用于复现实验的脚本。
实证发现: 该工作通过广泛的实验评估表明:
参数量和 FLOPs 是不可靠的能源消耗代理指标。
用于文本生成的 Transformer 模型在不同硬件配置下表现出相对一致的能源效率。
Transformer 模型存在能源缩放定律,即能源效率随参数量呈对数线性下降。
针对能源效率进行优化可以产生净正向的环境影响,因为优化所消耗的能量可以很快通过节省下来的能源回收。
实验结果 作者在各种硬件(虚拟机、笔记本电脑、台式机、服务器和 HPC 节点)和模型类型(CNN、Transformer)上进行了实验。
指标有效性: 在缩放神经网络层数和调整 CNN 步长(stride)的实验中,作者观察到虽然参数量保持不变,但能源消耗和 FLOPs 却发生了显著变化。这证实了参数量是衡量能源效率的不合适代理指标。同样,在 CNN 中,FLOPs 与实际能源使用量之间的相关性较弱。
硬件一致性: 在五台不同的机器上测试 Transformer 模型(GPT-2, Qwen3, Gemma 3, Llama 3.1)显示,虽然不同模型规模之间的绝对能源效率有所不同,但特定模型的效率在不同硬件之间保持相对一致(跨机器的标准差为 0.2372,而跨模型的标准差为 0.4608)。这表明发布模型能源指标是有价值的。
GPU 利用率: 在针对服务器上 Gemma 3 的批次大小(batch size)进行优化的实验中,ECOpt 确定了最优批次大小为 831(产生 2.67 tokens/J),该数值低于显存(VRAM)能容纳的最大值。相比于默认批次大小 1,该配置实现了 38 倍的能源效率提升。作者计算出,通过该优化所消耗的能量在生成仅 4,802 个 token 后即可回收。
神经架构搜索 (NAS): 将 ECOpt 应用于 CIFAR-10 上的 CNN NAS 任务,该框架识别出了七种帕累托最优架构。表现最好的模型达到了 76.09% 的准确率 和 20.12 samples/J 。这在准确率和时间效率方面均优于随机搜索基准(71.17% 准确率)和人工调优基准(70.07% 准确率)(分别为 61 分钟对比三天)。值得注意的是,作者发现虽然他们的模型在单纯的准确率上并非最先进(SOTA),但考虑到能源效率,它们提供了比现有 SOTA 模型更优的“单位能量准确率”表现。
意义与主张 论文声称,通过同时优化超参数以兼顾能源效率和性能,从业者可以在不牺牲推理质量的前提下降低机器学习的能源成本。作者认为,目前对参数量和 FLOPs 的依赖掩盖了模型的真实环境成本。通过提供一个能通过可解释的帕累托前沿来量化权衡的工具,ECOpt 为部署成本和环境影响的决策提供了依据。
作者谦虚地指出,他们在 CIFAR-10 上优于 SOTA 的发现主要是由于该领域缺乏已发表的能源指标,而非模型架构本身取得了根本性突破。他们倡导在模型发布中广泛采用能源指标,以促进竞争和关注。这项工作还强调,优化能源效率与优化延迟(latency)有所不同;延迟优化通常倾向于使用宽网络以最大化硬件利用率,而能源效率优化则可能需要平衡宽度与深度,以最小化功耗,特别是在硬件未完全饱和的情况下。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。