Drawback of Enforcing Equivariance and its Compensation via the Lens of Expressive Power
本文表明,尽管在两层 ReLU 网络中强制实施等变性会降低其表达能力,但通过增加模型规模可以弥补这一局限,而这悖论性地导致了假设空间维度的降低和泛化能力的提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试教一个机器人识别形状。你注意到,一个正方形无论旋转 90 度还是上下翻转,看起来都是一样的。这被称为对称性。
在机器学习的世界里,科学家们构建了特殊的“感知对称性”机器人(称为等变神经网络),迫使它们从一开始就理解这些规则。其理念是:“如果输入以特定方式发生变化,机器人的内部思考也应以相匹配的方式发生变化。”这通常会使机器人在学习上变得更聪明、更迅速。
然而,这篇论文提出了一个棘手的问题:强迫机器人遵循这些对称规则,是否会使其降低学习其他事物的能力?
以下是他们研究发现的分解,使用了简单的类比:
1. “僵化蓝图”问题(缺点)
想象你是一位正在设计房屋的建筑师。
- 普通网络(GN) 就像一位灵活的建筑师。他们可以根据土地的具体形状,随心所欲地绘制墙壁、窗户和门。
- 对称网络(LEN) 就像一位被迫使用“对称蓝图”的建筑师。如果他们在左侧放置一扇窗户,就必须在右侧放置一扇完全相同的窗户。如果他们向一个方向倾斜一面墙,就必须向相反方向倾斜另一面墙。
论文表明,这种“僵化蓝图”可能成为一个问题。有时,为了构建特定形状(比如一个角度奇怪的屋顶),普通建筑师只需要一面独特的墙。但对称建筑师由于被迫镜像一切,可能需要三到四面墙才能达到同样的效果。
研究发现: 如果你给两位建筑师完全相同数量的建筑材料(相同的“模型大小”),对称建筑师往往无法像普通建筑师那样完美地构建出该形状。由于双手被规则束缚,他们的“表达能力”较弱。
2. “多买砖块”解决方案(补偿)
那么,对称方法毫无用处吗?不。论文指出有一个解决办法:只需给他们更多的砖块。
如果对称建筑师被迫用三面墙来完成普通建筑师用一面墙就能完成的工作,你只需给他们更大的一堆砖块(扩大模型大小)。
- 论文证明,如果你将对称网络的大小增加一个特定的量(与数据可以旋转或翻转的方式数量相关),它就能构建出普通网络能构建的任何形状。
- 事实上,对于某些任务,将对称网络的大小翻倍就足以使其与普通网络一样出色。
3. 惊喜:“更大但更简单”(优势)
这是最令人惊讶的部分。通常,当你把模型做得更大时,你会担心它会变得“困惑”或过拟合(死记硬背训练数据而不是学习规则)。
但论文发现,尽管对称网络在物理上更大(拥有更多神经元),但其内部逻辑实际上更简单。
- 类比: 想象普通建筑师有 9 个不同的旋钮可以调节房屋。对称建筑师有 12 个旋钮(因为网络更大),但由于对称规则,这 12 个旋钮全部被锁定在一起。转动一个旋钮会自动带动其他旋钮。因此,对称建筑师实际上只控制着5 个独立旋钮。
结果: 由于对称网络拥有更少的“独立旋钮”(更小的假设空间),它实际上更擅长泛化。它不太可能因新的、未见过的数据而感到困惑。它用原始规模换取了结构上的简洁性,这结果证明是一个双赢的组合。
总结
- 问题: 强迫神经网络尊重对称性(如旋转或翻转)限制了其自由度,如果不给予足够的资源,会使其难以学习复杂形状。
- 解决方法: 你可以通过扩大对称网络(增加更多神经元)来解决这个问题。
- 额外好处: 尽管对称网络更大,但其内部规则如此严格,以至于与相同规模的普通网络相比,它实际上拥有更“简单的心智”。这使其在学会新事物时不易感到困惑,表现得令人惊讶地出色。
简而言之:对称约束可能会限制小型模型,但如果你扩大模型规模,你就能获得两全其美的效果:既拥有学习复杂模式的能力,又具备良好泛化的简洁性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。