← 最新论文
🤖 machine learning

Sphere Retraction Normalizations

本文通过证明所有球面残差流的检索映射都简化为控制旋转角的单个标量参数,从而推广了测地线归一化(Geodesic Normalization),并提出了在 nanoGPT 上表现优于现有方法的 pp-SpheretNorm 系列方法,其核心在于识别出指数映射仅仅是一个极限情况而非最优选择。

原作者: Jie Zhang, Cheng-Fang Su, Yi-Jui Huang, Min-Te Sun

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Jie Zhang, Cheng-Fang Su, Yi-Jui Huang, Min-Te Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图用乐高积木搭建一座摩天大楼,但每当你增加一层新楼层时,整座塔就开始摇晃、扭曲或坍塌。这就是科学家们在构建“深度神经网络”——那些驱动从聊天机器人到图像生成器等一切事物的超智能计算机大脑——时面临的日常挣扎。这些网络是由一层层堆叠在一起的,就像建筑中的楼层。为了让它们正常工作,工程师们使用了一种被称为“残差连接”(residual connection)的特殊技巧,这就像是一个滑梯,让信息可以从一层跳跃到下一层,防止塔身变得过于摇晃。

长期以来,保持这些塔稳定的最佳方法是使用一种叫做“层归一化”(LayerNorm)的方法,它就像一位严厉的建筑师,不断检查砖块的大小,以确保它们不会变得太大或太小。但即使是这位严厉的建筑师也有缺陷:有时塔变得太高,顶层停止了学习;或者底层变得过于兴奋,导致整个结构摇晃崩溃。最近,一种名为“测地归一化”(Geodesic Normalization,简称 GeoNorm)的新想法尝试解决这个问题,它将这座塔想象成不是建在平地上,而是建在一个巨大的、隐形的球体表面上。在这个球体上,信息沿着最短的路径移动,就像飞机飞越地球一样,这能让数据的规模保持完美恒定。这是一个天才的想法,但发明这个方法的科学家们使用了一个非常特定且复杂的数学工具来绘制那条路径,并假设那是唯一的路径。

这篇题为《球面收缩归一化》(Sphere Retraction Normalizations)的论文提出了一个简单但具有革命性的问题:“那个特定的工具是我们在球面上行走的唯一方式吗?还是有其他更好的路径?”作者张洁、苏成方及其团队决定不再将球面视为一个僵硬的、单路径的轨道,而是去探索在弯曲表面上移动的所有可能方式。他们发现,大家都在使用的那个复杂工具(指数映射,exponential map)实际上只是光谱中的一个极端端点。通过探索中间地带,他们发现了两种更简单的方法,既能像原方法一样保持塔身的稳定,又更容易计算。

该团队引入了三种新方法,统称为“SpheretNorms”。把球面想象成一个巨大的地球仪,把信息想象成一名旅行者。旧方法(GeoNorm)就像是一名必须遵循特定、蜿蜒道路的旅行者,需要复杂的导航工具。作者表明,你其实可以走捷径。他们发现了两种新的“收缩”(retractions,即在球面上移动的数学捷径):一种叫做 Proj-SpheretNorm,它就像是将影子垂直投影到地面,然后再踏回到表面;另一种叫做 Cay-SpheretNorm,它利用一种巧妙的几何技巧将旅行者旋转到下一个位置。

为了证明这些想法有效,研究人员不仅在纸上做数学题,还使用了一种流行的轻量级 AI 模型“nanoGPT”构建了数字塔。他们在两个大规模文本数据集 OpenWebTextFineWeb-Edu 上测试了这些方法。他们构建了不同高度的模型,层数从 12 层到 36 层不等,并在大约 65.5 亿个 token(token 是文本的一个块,比如一个单词或单词的一部分)上进行了训练。

结果令人惊讶。虽然旧的 “GeoNorm” 方法表现不错,但它并不是最好的。事实上,作者发现,“完美”的路径并不在旧方法所在的那个极端端点,而是在光谱的中间位置。他们创建了一个灵活的方法家族,称为 p-SpheretNorm,其中一个数字 p 控制着旅行者的移动方式。

  • p = 1 时,你会得到“投影法”(Proj-SpheretNorm)。
  • p = 2 时,你会得到“几何技巧法”(Cay-SpheretNorm)。
  • p 变得非常大时,你会得到旧的 GeoNorm 方法。
  • p 变得非常小时,你会得到标准的、基于平地的法。

在实验中,Proj-SpheretNorm(即 p = 1 的版本)成为了冠军。在中型和大型模型上,它实现了最低的训练和验证损失,不仅击败了旧的 GeoNorm,还击败了其他流行的方法,如 Pre-LNPeri-LNKeel。例如,在 FineWeb-Edu 数据集的 24 层模型上,该新方法实现的验证困惑度(perplexity,分数越低越好)为 16.81,而之前的最佳方法 Peri-LN 为 19.09。在 OpenWebText 数据集上,它同样表现优于竞争对手。

或许最重要的一点是,新方法具有极高的稳定性。在某些测试中,像 Pre-LNKeel 这样的旧方法完全失败了,它们的验证得分爆炸到了像 111.70 甚至 2081.50 这样的数字,这意味着 AI 停止了学习并开始随机猜测。相比之下,所有三种新的 SpheretNorm 方法在每种设置下都能平稳收敛,即使是在最深的 36 层模型中也是如此。

作者还测试了这些模型在“下游任务”上的表现,这就像是给 AI 一系列测验,看看它到底有多聪明。他们使用了 11 个不同的基准测试,涵盖了阅读理解、逻辑谜题和科学问题等内容。在 FineWeb-Edu 训练数据的 11 项指标中有 12 项,以及 OpenWebText 数据集中的 12 项指标中有 10 项1-SpheretNorm 模型(即 p=1 版本)都取得了最高分。它在“困惑度”测试中表现尤为出色,将 LAMBADA 数据集上的困惑度从最佳基准线的 59.55 降低到了 46.74,这是一个巨大的进步。

论文总结道,GeoNorm 中使用的指数映射并不是“圣杯”,它仅仅是光谱中的一个端点。通过选择光谱上的另一个点(特别是 p=1),我们可以构建更深、更稳定且更准确的 AI 模型,而无需复杂的计算。作者认为,这为我们思考如何连接神经网络中的层开辟了新的途径——从僵硬的、单一路径的解决方案转向灵活的几何选择家族。虽然他们指出,这些方法可能并不适用于所有类型的 AI 架构(例如那些需要保留特定对称性的架构),但他们已成功证明,在超球面上,存在着一个充满更好路径的广阔世界等待着被探索。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →