← 最新论文
🤖 machine learning

Position: Zeroth-Order Optimization in Deep Learning Is Underexplored, Not Underpowered

本文主张,深度学习中的零阶优化并非本质上不可扩展,而是由于短视的设计实践导致其未被充分探索,因此呼吁转向子空间方法、系统感知优势以及去混淆评估的范式转变,以释放其在大规模、资源高效学习中的潜力。

原作者: Sijia Liu, Yicheng Lang, Soumyadeep Pal, Changsheng Wang, Yancheng Huang, Chongyu Fan, James Diffenderfer, Bhavya Kailkhura, Yihua Zhang

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Sijia Liu, Yicheng Lang, Soumyadeep Pal, Changsheng Wang, Yancheng Huang, Chongyu Fan, James Diffenderfer, Bhavya Kailkhura, Yihua Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《深度学习中的零阶优化未被充分探索,而非能力不足》的通俗解读,辅以日常类比。

核心理念:并非工具坏了,只是我们尚未学会如何使用它

想象你试图在一个巨大、漆黑的山谷中找到最低点(这代表训练复杂的 AI 模型)。

  • 旧方法(一阶优化): 你拥有一把魔法手电筒,它不仅照亮地面,还能确切地告诉你哪里是“下”方(梯度)。这就是当今大多数 AI 的训练方式。它速度很快,但这把手电筒需要巨大的电池(海量计算机内存),而且如果你试图在怪异、非标准的地形(如模拟器或黑盒系统)上使用它,很容易损坏。
  • “零阶”(ZO)方法: 你没有手电筒,只有一根棍子。为了判断哪里是下方,你用棍子朝不同方向戳地面。如果感觉地面变低了,你就朝那个方向迈步。这就是零阶(ZO)优化。它占用的内存极少,且适用于任何地形,即使你看不见地面。

问题所在: 长期以来,人们认为“棍子法”对于大山来说太慢且笨拙。他们相信,要戳够地面次数以找到谷底,需要耗费永恒的时间。

论文的论点: 作者们说:“停!你们对棍子法的评判有失公允。”他们认为 ZO 并不弱,只是未被充分探索。我们一直用错了棍子(逐个戳地面的每一寸)。如果我们改变“戳”的方式,就能让它变得和手电筒一样强大,却无需沉重的电池。


六个关键点(“操作指南”)

作者提出了六种重新思考如何使用“棍子”以使其更有效的新方法。

1. 不要随机乱戳(P1 & P2)

类比: 想象你试图在一大片田野里找到种植树木的最佳位置。

  • 错误做法: 大多数人同时向所有方向随机戳地。这会产生大量“噪声”(混乱),并需要戳数百万次。
  • 修正方案: 论文指出,“要更聪明地选择戳哪里。”不要到处乱戳,而是按照特定、有结构的模式去戳。同时,要意识到戳更多次可以减少混乱,但会消耗更多时间。你需要在“戳多少次”和“信号有多清晰”之间找到完美的平衡。

2. 使用指南针,而不仅仅是棍子(P3)

类比: 当你用棍子戳地时,你实际上是在测量某个特定方向上的坡度(就像指南针的指针)。

  • 洞察: 作者们说,我们应该停止假装只是在猜测。我们应该将这些“戳”视为对特定方向坡度的测量。如果我们将“棍子法”与理论上的“完美指南针”(称为方向导数)进行比较,我们就能确切地看到我们的方法究竟有多好。这有助于我们停止在任务本身极其困难时去责怪工具。

3. 聚焦重要部分(P4)

类比: 想象试图通过查看整个星球的地图来导航城市。这令人难以承受。

  • 修正方案: 不要戳整个星球,而是放大到一个小街区(一个子空间)。作者们指出,AI 模型往往隐藏着这样的模式:只有少数几个方向是重要的。如果我们只在这些特定的“街区”(低维子空间)里戳,就能用远少得多的戳击次数获得清晰的答案。这就像导航城市时,只看主要街道,而不是每一条小巷。

4. “隐形团队”优势(P5)

类比: 想象一个工人团队试图搬运一张沉重的沙发。

  • 旧方法(手电筒): 他们都需要看到完全相同的蓝图,并不断交谈以协调。这需要大量的时间和带宽。
  • ZO 方法: 因为“棍子法”只需要发送一个数字(比如“这里更低!”),而不是整张蓝图,工人们可以更快地沟通。他们甚至可以使用共享的秘密代码(随机种子)来知道该戳哪里,而无需交谈。这使得 ZO 优化对于在不同计算机上工作的团队来说极其快速,并且节省了大量能量。

5. 不要因任务太简单而责怪工具(P6)

类比: 想象一个学生参加考试。

  • 问题: 有时,老师给学生一张小抄(称为任务对齐),让考试变得超级简单。学生得了 A,但你不知道他是聪明还是仅仅运气好。
  • 修正方案: 作者们说:“停止提供小抄!”我们需要在那些不允许使用小抄的难题上测试“棍子法”。如果该方法仍然有效,那么我们就知道工具实际上很强大。如果它失败了,我们就知道工具需要改进。这能防止我们仅仅因为考试被操纵就认为工具很出色。

行动呼吁:我们下一步该做什么?

作者们不仅仅是在抱怨;他们正在为未来提供路线图:

  1. 改变游戏规则: 停止用“小抄”(任务对齐)来测试这些方法,也不去衡量需要多少次“戳”(查询)。我们需要公平的测试。
  2. 停止戳遍整个世界: 放弃戳每一个参数。开始在小而更聪明的组(子空间)中戳,或者使用“谱”技巧来找到最重要的方向。
  3. 为棍子构建新工具: 我们目前正试图将“棍子法”塞进为“手电筒”构建的工具中。我们需要构建专门为棍子法设计的新型计算机系统。这些系统会更轻量、更快速,并能在更便宜的计算机上运行。
  4. 超越 AI 的视野: 这种方法不仅仅适用于 AI。它非常适合那些根本无法使用手电筒的领域,例如:
    • 量子计算机: 物理定律使得“手电筒”(梯度)根本无法使用。
    • 科学模拟器: 当你测试物理模型(如桥梁或天气系统)且无法在数学上计算坡度时。

核心结论

这篇论文认为,零阶优化是一辆法拉利,而我们一直在停车场里开着它。 我们一直笨拙地使用它,认为它缓慢且无力。但如果我们修建正确的道路(系统),在正确的车道(子空间)上行驶,并停止使用小抄(任务对齐),结果会发现,它实际上是一种极其强大、内存高效且可扩展的方式,可用于训练下一代 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →