← 最新论文
🤖 machine learning

Leveraging AutoML for Sustainable Deep Learning: A Multi-Objective HPO Approach on Deep Shift Neural Networks

本文利用多目标自动机器学习(AutoML)来优化用于图像分类的 Deep Shift 神经网络,通过发现全新的、反直觉的量化策略,找到了在提升约 20% 准确率的同时减少超过 60% 碳排放的帕累托最优配置。

原作者: Leona Hennig, Marius Lindauer

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Leona Hennig, Marius Lindauer

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观:让 AI 更绿色、更聪明

想象你有一个非常聪明的机器人厨师(深度学习),它能完美地识别食物的照片。然而,这个厨师是个贪吃鬼。为了完成工作,它需要一个巨大的厨房、大量的电力,并且会产生大量的热量和烟雾(碳排放)。这就是目前许多深度学习模型的现状:它们功能强大,但运行成本高昂且对环境不利。

这篇论文的作者想要打造一个“可持续”版本的厨师。他们专注于一种特定类型的神经网络,称为深度移位神经网络(Deep Shift Neural Network, DSNN)

DSNN 类比:
把标准的神经网络想象成一位为每一种食材都进行复杂数学运算(乘法)的厨师。他很精准,但速度慢且耗能高。
DSNN 则像是一位使用捷径的厨师。他不是做复杂的数学运算,而只是“移动”食材的位置(就像把一堆硬币向左或向右移动)。在计算机术语中,这被称为“位移”(bit shift)。这极其快速且消耗极少的能量,但由于捷径有时会导致错误,所以很难把食谱做得尽善尽美。

问题所在:“默认”食谱并非最优

研究人员发现,虽然 DSNN 是个好主意,但还没有人找到它的“完美食谱”。那些“默认”设置(人们构建这些网络的标准方式)就像是在使用一本通用的食谱。它虽然可行,但并不是最有效率或最精确的版本。

他们怀疑,如果能把食材进行微调,就能得到一个更准确、更节能的厨师。但通过手工寻找这些完美的微调参数,就像是蒙着眼睛在草堆里找针一样困难。变量实在太多了:

  • 应该有多少层使用“移位”这个技巧?
  • 测量应该有多精确?
  • 厨师应该如何舍入数字?

解决方案:“自动管家”(AutoML)

为了解决这个问题,作者使用了 AutoML(自动化机器学习)。想象一个“自动管家”在为你进行成千上万次实验。你不再需要靠猜来制定食谱,管家会尝试成千上万种不同的食材组合,烹饪它们,品尝它们,并检查它们消耗了多少能量。

然而,烹饪一顿完整的饭需要很长时间。因此,他们使用了**多保真度(Multi-Fidelity)**的方法。

  • 低保真度: 管家在汤煮了 5 分钟后就尝一小勺。这是一个快速的猜测,但它能告诉你这锅汤是否彻底毁了。
  • 高保真度: 如果汤看起来很有潜力,管家就会让它完整地煮满一小时,以获得真正的味道。

这节省了大量的时间和电力,因为管家会在发现糟糕的食谱时及早停止烹饪。

目标:“完美的平衡”(多目标优化)

通常,当你优化一个食谱时,你只关心一件事:“味道好吗?”(准确度)。
但在这里,作者想要同时优化两件事

  1. 味道: 模型的准确度如何?(最小化误差)。
  2. 成本: 烹饪它消耗了多少能量?(最小化排放)。

这两个目标往往是相互冲突的。通常,为了让汤更好喝,你必须使用更昂贵的食材(更多的能量)。作者使用了一种称为**帕累托优化(Pareto Optimization)**的技术来寻找这个“甜点位”。

帕累托类比:
想象一张地图,X 轴是“消耗能量”,Y 轴是“准确度”。

  • 有些点很差:高能量,低准确度。
  • 有些点很好:低能量,高准确度。
  • 帕累托前沿(Pareto Front) 是“最佳交易的前线”。它展示了那些处于临界点的配置:在这些点上,如果你想获得更高的准确度,就必须消耗更多能量;如果你想节省更多能量,就必须牺牲准确度。

令人惊讶的发现

“自动管家”发现了一些违背常识的结果:

  1. 少即是多: 大家都认为你需要对网络中的所有层都使用“移位”技巧才能最省电。但管家发现,在极少数层(有时在 20 层中仅用 1 层或 3 层)使用移位技巧效果反而最好。这就像是意识到你只需要在主菜时使用捷径,而不是在开胃菜和甜点时也用捷径,从而达到速度与味道的最佳平衡。
  2. 精度至关重要: 尽管在使用捷径,但他们发现保持“分数位”(数字中微小的、精确的部分)的高精度是至关重要的。这就像是用捷径来切菜,但你仍然需要一把非常锋利的刀才能切得完美。
  3. 默认设置是错误的: 专家们一直使用的“默认”设置实际上被这些新配置所超越。新设置比旧的默认设置准确度提高了 20%,且能效提升了高达 60%

“秘密配料”:学习率

研究人员还发现,学习率(厨师从错误中学习的速度)是影响能量消耗的一个巨大因素。如果你选择的学习率太随机或不对,厨师会浪费大量的能量去尝试学习。自动管家能够自动找到完美的学习率,这节省了惊人的能量。

总结

这篇论文证明,通过使用自动化系统来测试成千上万种这些能量效率网络的“食谱”,我们可以找到比人类设计出的方案更优越的配置。

  • 结果: 我们得到了更聪明、更清洁的模型。
  • 方法: 我们使用“品尝勺”策略(多保真度)来避免在糟糕的想法上浪费资源。
  • 洞察: 构建这些网络的最佳方式并不是“全盘使用”捷径,而是一种微妙且反直觉的平衡——即克制地使用捷径,同时保持高精度。

作者总结道,这种“绿色 AutoML”方法对于未来至关重要,尤其是在为自动驾驶汽车或工厂机器人等小型设备运行 AI 时,电池寿命和速度是至关重要的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →