← 最新论文
🤖 machine learning

Breaking chains with trees: Deep learning with O(logN)\mathcal{O}(\log N) parallel time complexity

本文引入了分层块局部学习(Hierarchical Block-Local Learning, HBLL),这是一种将深度神经网络分解为通过局部目标进行训练的层次化链接块的新型框架,旨在消除顺序反向传播,从而在保持视觉和语言任务竞争力的同时,实现 O(logN)\mathcal{O}(\log N) 的并行时间复杂度。

原作者: Neeraj Mohan Sushma, Aditya Nagarsekar, Cabrel Teguemne Fokam, Robin Schiewer, Amit Kumar Pal, Anand Subramoney, David Kappel

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Neeraj Mohan Sushma, Aditya Nagarsekar, Cabrel Teguemne Fokam, Robin Schiewer, Amit Kumar Pal, Anand Subramoney, David Kappel

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个由 1,000 人组成的庞大团队如何解开一个复杂的谜题。

旧方法(反向传播):“传声筒”式的瓶颈
目前,大多数 AI 模型都是使用一种被称为“反向传播”(Backpropagation)的方法进行训练的。这就像是在玩一个“倒着玩”的“传声筒”游戏。

  1. 团队从头到尾完成谜题的解法(前向传播)。
  2. 他们发现最后一步出了错。
  3. 他们必须将修正信息一个人接一个人地,从最后一步一直向后传回最开始的地方(反向传播)。
  4. 问题所在: 在前一个人完成耳语之前,没有人可以改变自己的策略。如果你有 1,000 个人,这个“耳语”的过程会非常漫长。这被称为“锁定”(Locking)。这意味着你不能通过增加更多计算机来提高速度,因为每个人都在等待前一个人。这也像是试图在汽车行驶的过程中修理发动机;你需要知道整辆车的运作方式才能修理其中一个零件。

新方法 (HBLL): “经理树”结构
这篇论文介绍了一种名为分层块局部学习(Hierarchical Block-Local Learning, HBLL)的新方法。与其让 1,000 个人排成一长队等待耳语,不如将团队组织成一个经理金字塔

  • 结构: 你不再是拥有一个 1,000 人的单列队伍,而是拥有一个树状结构。在底层是小型团队。在他们之上,是管理两个团队的经理。再往上,是管理这些经理的经理,以此类推,直到顶端的 CEO。
  • 训练过程: 当错误发生时,CEO 不需要把信息一直传到最底层。
    • CEO 告诉两个高层经理哪里错了。
    • 那两个经理再告诉他们的四个下属经理。
    • 下属经理再告诉他们的八个下属经理。
    • 神奇之处: 因为信息在树状结构中向下分裂,信息传递变得非常迅速。如果你有 1,000 层,信息只需要经过大约 10 步(对数时间)就能到达底部,而不是 1,000 步。
  • 局部学习: 每个小团队(或称为“块”)只需要关注自己直接相邻的部分。他们不需要了解整个公司的秘密才能完成工作。他们只需要确保自己负责的局部谜题碎片能与上下方的碎片完美契合即可。

为什么这很重要(“打破锁链”的比喻)
论文声称这种方法打破了等待的“锁链”。

  • 速度: 因为“耳语”是通过树状结构而非直线传播的,所以训练时间随着模型变大而增长得非常缓慢。论文声称它可以在 O(logN)O(\log N) 时间内训练深度网络,这意味着如果你的网络规模翻倍,训练时间并不会翻倍,而只是增加了一点点。
  • 无需“权重传输”: 在旧方法中,“反向耳语”需要使用与“前向思考”完全相同的线路。而 HBLL 不需要这种完美的对称性。这就像你可以通过不走原路的方式来修好一条路。

他们测试了什么
作者在几个具有挑战性的任务上测试了这种“经理树”方法:

  1. 数字识别 (MNIST): 他们展示了即使是在传统方法(反向传播)无法学到任何有用信息的极深网络中,该方法依然有效。
  2. 物体识别 (CIFAR-10 & 100): 他们将其应用于“视觉 Transformer”(用于观察图像的 AI)。即使在图像缺失部分或标签存在噪声的情况下,它的表现也与标准方法一样出色。
  3. 文本写作 (WikiText-103): 他们用它来教 AI 预测句子中的下一个词。它表现良好,证明了该方法同样适用于语言任务。
  4. 时间序列 (RNNs): 他们将其适配于随时间发生任务的模型(例如逐词阅读句子)。他们发现了一种方法,可以在训练时进行并行处理(像树一样),但在使用时仍按顺序运行(像正常的句子一样)。

隐藏的超能力:灵活的推理
这个树状结构的一个很酷的副作用是,AI 会隐式地学习许多不同的“子网络”。

  • 想象一下,AI 有一条“完整路径”(使用全部 1,000 层)来应对困难的谜题。
  • 但它也有“短路径”(仅使用顶部的几层)来应对简单的谜题。
  • 这意味着你可以使用同一个训练好的模型,根据任务的难易程度,去做快速简单的任务或深度复杂的任务,而无需重新训练。这就像是一个瑞士军刀,你可以根据需要只拿出螺丝刀,或者使用整个工具。

总结
这篇论文提出了一种不再让所有人排队等待的 AI 训练方法。通过将学习过程组织成一个分层树结构,让局部团队解决各自的小问题,AI 可以更高效地进行并行学习。它实现了与标准方法相当的效果,但消除了“锁定”这一瓶颈,使得训练大规模模型变得更加高效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →