Activation-Free Backbones for Image Recognition: Polynomial Alternatives within MetaFormer-Style Vision Models
本文介绍了 PolyNeXt,这是一系列无激活函数的视觉骨干网络,其在 MetaFormer 风格架构中利用哈达玛积以多项式替代方案取代标准非线性函数,在图像识别与分割任务中实现了最先进的性能,同时降低了计算成本。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在构建一个超级智能的机器人,它能够观察图片并准确告诉你它看到了什么。多年来,制造这些机器人的工程师们一直依赖一组特定的“魔法开关”,称为激活函数(如 ReLU 或 GELU)。这些开关就像交通信号灯或闸门;它们决定哪些信息能通过机器人的“大脑”,哪些会被阻挡。行业惯例认为,如果没有这些特定的闸门,机器人就无法学习复杂的模式。
这篇题为《用于图像识别的无激活函数骨干网络》的论文,挑战了这一长期持有的信念。作者 Jeffrey Wang 及其同事表示:“实际上,你并不需要那些特定的交通信号灯。你可以使用完全不同的数学方法,构建出更智能、更高效的机器人。”
以下是他们所做的工作及其重要性的简要说明,并辅以日常类比:
1. 问题所在:“交通信号灯”瓶颈
在现代人工智能中,机器人的“大脑”由多层构成。信息流经这些层,在每一步都会遇到一个“交通信号灯”(即激活函数),该信号灯会开启、关闭或改变信号的形状。
- 旧方法:机器人计算出一个数字,经过一个交通信号灯,然后继续前进。
- 问题:作者认为,这些交通信号灯并非创造复杂性的唯一途径。事实上,它们可能效率低下,有时甚至会成为阻碍。
2. 解决方案:用“食谱”代替“开关”
作者没有使用交通信号灯,而是用多项式取而代之。
- 类比:想象你在烤蛋糕。
- 旧方法(激活):你混合配料,然后停下来检查一条特定规则(交通信号灯),看看是否应该加更多的糖。
- 新方法(多项式):你只需按照特定的数学食谱将配料混合在一起。复杂性来自于你如何混合它们,而不是停下来检查规则。
具体来说,他们用哈达玛积(Hadamard products) 取代了那些“停下来检查”的步骤。
- 这是什么? 想象你有两个数字列表。你不是将它们相加,而是逐个元素地将它们相乘。
- 神奇之处:当你将两个数字列表相乘时,你会自动创建一个复杂的、弯曲的关系(即多项式),而无需任何特殊的“交通信号灯”开关。这就像将红色和蓝色颜料混合会自然产生紫色,而无需一个“紫色开关”。
3. 三种新工具
团队构建了三种新工具,以取代机器人“大脑”中的旧工具:
- PolyMLP:取代标准的“前馈”层(处理信息的部分)。它不再使用闸门,而是将两股数据流相乘。
- PolyConv:取代“卷积”层(寻找边缘或纹理等形状的部分)。它通过乘法混合图像的不同视图。
- PolyAttn:取代“注意力”机制(决定图像哪些部分重要的部分)。它不使用复杂的指数数学函数(如陡峭的山坡),而是使用平滑的多项式曲线。
4. 挑战:“雪球效应”
这种新方法存在一个大问题。
- 类比:如果你将两个大数字相乘,你会得到一个巨大的数字。如果在下一层再次这样做,你会得到一个极其巨大的数字。如果你持续这样做 100 层,数字会变得如此之大以至于爆炸(就像雪球滚下山坡,变得太重而无法控制)。这导致机器人的训练崩溃。
解决方案:作者发明了一种“稳定食谱”,以防止雪球爆炸:
- Sigmoid-Scale:他们添加了一个微小的“调光开关”,如果数字变得太大,它会自动调低音量。
- 多输入跳跃连接:他们构建了“旁路道路”,让两步之前的信息跳过某一层,确保信号不会丢失或失真。
- 深而窄:他们发现,将机器人的“大脑”设计得非常深(很多层)但很窄(宽度较小),比通常的宽而浅的设计效果更好。
5. 结果:更快、更强、更稳健
他们在庞大的图像数据集(ImageNet)上测试了他们新的"PolyNeXt"机器人。
- 性能:他们的多项式机器人在表现上与使用旧“交通信号灯”开关的最佳机器人一样好,甚至更好。
- 效率:他们以更少的参数(更少的“大脑物质”)和更少的计算能力实现了这些结果。
- 稳健性:当他们向机器人展示模糊、嘈杂或绘制得奇怪(分布外数据)的图像时,多项式机器人在正确猜测方面出人意料地优于旧机器人。
- 隐私潜力:由于他们移除了复杂的“指数”数学和除法步骤,这些机器人更接近与全同态加密(FHE) 兼容。
- 什么是 FHE? 这是一种在不解密数据的情况下对加密数据进行数学运算的方法。这对隐私至关重要。旧的“交通信号灯”开关很难与加密配合使用;而这些新的多项式开关则对加密友好得多。
6. 结论
该论文证明,激活函数并非构建强大图像识别人工智能的根本必需品。它们只是工程问题的一个解决方案。通过转向多项式数学(用乘法代替门控)并添加一些安全机制以保持数学稳定,作者创建了一个新的 AI 模型家族,它们:
- 同样聪明(甚至更聪明)于当前模型。
- 更高效(运行成本更低)。
- 更稳健(更能处理奇怪的图像)。
- 更利于隐私(更容易加密)。
简而言之:他们将“交通信号灯”从机器人的“大脑”中移除,用一种巧妙的混合食谱取而代之,结果发现机器人实际上开得更好了。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。