← 最新论文
🤖 machine learning

SURGE: Surrogate Gradient Adaptation in Binary Neural Networks

本文介绍了 SURGE,这是一种新颖的可学习框架,它通过采用带有全精度辅助分支的双路径梯度补偿器和自适应梯度缩放器来动态平衡梯度贡献,从而缓解二值神经网络中的梯度失配和信息丢失问题,进而在各项任务中超越了最先进的方法。

原作者: Haoyu Huang, Boyu Liu, Linlin Yang, Yanjing Li, Yuguang Yang, Xuhui Liu, Canyu Chen, Zhongqian Fu, Baochang Zhang

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Haoyu Huang, Boyu Liu, Linlin Yang, Yanjing Li, Yuguang Yang, Xuhui Liu, Canyu Chen, Zhongqian Fu, Baochang Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个机器人识别猫和狗。为了让这个机器人足够快且足够小,能够安装在像智能手表这样微小的电池供电设备上,你决定简化它的“大脑”。你不再让它使用复杂的高精度数字(如 3.14159),而是强制它只使用两个简单的开关:开(1)关(-1)

这被称为二值神经网络(BNN)。它极其高效,但存在一个大问题:教一个只懂得“开/关”思维的机器人,就像试图教一个只能说“是”或“否”的学生如何解数学题。当老师试图纠正学生的错误(这一过程称为“反向传播”或梯度下降)时,“否”这个答案没有可供遵循的斜率。数学计算因此崩溃,导致机器人陷入停滞或学习效果极差。

旧方法:“猜测与截断”法

多年来,研究人员使用一种称为**直通估计器(STE)**的技巧。

  • 类比:想象机器人犯了一个错误。老师说:“好吧,假装你没说‘否’,假装你说了‘是’,然后我们继续。”
  • 问题:这是一个粗略的猜测。这就像老师忽略学生答案中偏差过大的部分。如果学生的答案过高或过低,老师就将其截断(切断),并说:“让我们假装那部分从未发生过。”这丢弃了有价值的信息,导致机器人形成带有偏见且不完整的理解。

新方法:SURGE(“影子导师”)

这篇论文介绍了一种名为SURGE(代理梯度自适应)的新方法。SURGE 不再仅仅依靠猜测,而是在训练过程中引入了一个影子导师

其工作原理分为两个主要部分:

1. 双路径梯度补偿器(影子导师)

想象一下,在训练期间,机器人拥有两个并行工作的“大脑”:

  • 主脑(二值化):这是你真正想要保留的机器人。它只使用 1 和 -1。它负责实际工作。
  • 影子导师(全精度):这是第二个“完美”的大脑,与主脑并行运行。它使用正常的复杂数字。它能清晰地看到一切。

它们如何协同工作:

  • 前向传播(学习):主脑使用 1 和 -1 做出决策。影子导师在一旁观察,但不改变主脑的最终答案。输出结果与普通的二值机器人完全一致。
  • 反向传播(修正):当需要修正错误时,主脑试图使用旧的“猜测与截断”方法进行自我学习。但此时影子导师会介入。它说:“嘿,主脑因为截断数据而遗漏了一些细节。让我计算那些缺失部分的真实修正值,并将其添加到主脑的学习中。”

这使得主脑能够利用影子导师的精度进行学习,而自身无需变得复杂。一旦训练完成,影子导师就会被丢弃,留下的只是一个微小、快速的二值机器人。

2. 自适应梯度缩放器(音量旋钮)

这里存在一个风险:影子导师非常聪明,可能会大声喊出它的修正意见,以至于淹没了主脑自身的学习。

  • 解决方案:SURGE 包含一个智能的音量旋钮(称为自适应梯度缩放器)。
  • 工作原理:它持续监听主脑和影子导师。如果影子导师的修正过于强烈,它就调低音量;如果太弱,就调高音量。它动态地平衡两者,使它们完美协作,而不会让一方压倒另一方。

为何这很重要

作者在三类不同的任务上测试了这种新的“影子导师”系统:

  1. 图像分类:识别图片(如猫、狗或手写数字)。
  2. 目标检测:在视频或图像中寻找物体。
  3. 语言理解:阅读和理解文本(如 BERT 模型)。

结果:
在每一项测试中,SURGE 方法都优于之前的最佳方法。

  • 在著名的ImageNet数据集(一个巨大的照片集合)上,使用 SURGE 训练的二值网络达到了**62.0%**的准确率,显著超越了之前的最佳记录。
  • 它还在目标检测和语言任务中提升了性能,证明了这种“影子导师”方法适用于不同类型的 AI。

总结

SURGE 通过为“二值”(开/关)AI 模型在训练期间提供一个临时的、高精度的“影子导师”,解决了训练难题。这位导师填补了二值模型丢弃的缺失信息,但一旦训练结束,导师就会消失,留下一个超快、微小且高度准确的二值模型,随时准备部署到现实世界的设备上。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →