← 最新论文
💬 NLP

GeoNorm: Unify Pre-Norm and Post-Norm with Geodesic Optimization

本文介绍了 GeoNorm,一种通过将层输出解释为具有层级衰减的流形上的测地更新,从而统一了 Pre-Norm 和 Post-Norm 方法的新型归一化方法,在实现 Transformer 模型性能一致提升的同时,其计算开销微乎其微。

原作者: Chuanyang Zheng, Jiankai Sun, Yihang Gao, Chi Wang, Yuehao Wang, Jing Xiong, Liliang Ren, Bo Peng, Qingmei Wang, Xiaoran Shang, Mac Schwager, Anderson Schneider, Yuriy Nevmyvaka, Xiaodong Liu

发布于 2026-01-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Chuanyang Zheng, Jiankai Sun, Yihang Gao, Chi Wang, Yuehao Wang, Jing Xiong, Liliang Ren, Bo Peng, Qingmei Wang, Xiaoran Shang, Mac Schwager, Anderson Schneider, Yuriy Nevmyvaka, Xiaodong Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人写故事。为了做到这一点,机器人使用了一种名为 Transformer 的复杂机器。在这个机器内部,有很多层“工人”(比如注意力工人(attention workers)和前馈工人(feed-forward workers)),他们沿着一条链条传递信息。

每当一个工人向下一个工人传递消息时,消息都需要被“归一化”(normalized)。把归一化想象成一个 音量旋钮 或一把 尺子。它确保消息在进入下一步之前,既不会太大声(过大),也不会太小声(过小)。

长期以来,工程师有两种调节这个音量旋钮的主要方法:

  1. Post-Norm(后归一化): 工人完成工作,将他们的消息添加到链条中,然后 有人检查音量并进行调整。
  2. Pre-Norm(前归一化): 在工人开始工作 之前,有人先检查音量,这样工人每次开始时都能得到一个大小完美的信号。

两种方法都有其优缺点。Post-Norm 有时会导致音量剧烈飙升(就像回授产生的尖叫声);而 Pre-Norm 则可能导致早期的工人比起后期的工人喊得太响。

新的想法:GeoNorm

这篇论文的作者们说:“为什么我们只是用尺子来检查音量呢?让我们思考一下消息行进的 路径。”

他们意识到,这些消息移动的方式就像是在一个 地球仪(球体)的表面上行走,而不是在平坦的地面上行走。

  • 旧的方法(投影/Projection): 想象你正在地球仪上行走。你沿着直线迈出一步(就像一束激光)。如果你一直走直线,你最终会从地球仪掉进太空。为了修复这个问题,旧方法会说:“噢不,你掉了!让我们直接把你拉回到表面上来。”这是一种笨拙且突兀的修正,会扭曲你的方向。
  • 新的方法(测地线/Geodesic): 作者们建议,与其走直线然后掉下去,不如沿着球体的 弯曲表面 行走。在数学中,曲面上最短的路径被称为 测地线(Ge geodesic,就像飞机为了从纽约飞往伦敦而飞行弧线,而不是直线一样)。

GeoNorm 用这种笨拙的“拉回地面”法,替换成了平滑的“沿曲线行走”法。它使用了一个叫做 指数映射(exponential map)的数学工具,以确保消息自然地留在“地球仪”上,沿着曲线移动,而不会掉落或需要剧烈的修正。

“衰减”技巧

论文还引入了一种处理“步长”(即机器人迈出的步子有多大)的聪明方法。

  • 想象你在爬山。在山脚下,你可以迈出大步且自信;但随着你爬得越高,地形变得越复杂,你应该迈出更小、更谨慎的步伐。
  • GeoNorm 应用了这种逻辑。它在初始阶段使用较大的更新,并随着消息在网络更深层中移动,逐渐减小步长。这可以防止机器人在链条接近末端时跌跌撞撞或感到困惑。

他们发现了什么?

作者在不同的“徒步路线”(如 Arxiv 和 Books3 等数据集)以及不同规模的“机器人”(从小型到巨大的模型规模)上测试了这种新方法。

  1. 性能更好: 使用 GeoNorm 的机器人始终学习得更快,并且最终获得了更好的“分数”(更低的错误率),表现优于使用旧方法的机器人。
  2. 稳定性: 旧方法有时会出现“损失峰值”(loss spikes,即性能突然崩溃),尤其是在机器人非常深或者训练时间很长的情况下。GeoNorm 要平滑得多,且不会崩溃。
  3. 没有额外成本: 最棒的部分是?这种在地球仪上行走的新方式并不会让机器人背负更重的背包。它不会增加额外的内存消耗,也不会让计算机变慢;它只是改变了机器人 移动的方式

总结

这篇论文认为,与其强迫 AI 的消息去适应一个盒子(旧的归一化方法),我们应该让它们沿着它们本该旅行的弯曲表面自然流动。通过这样做,AI 会变得更稳定、学习得更好,而且不需要额外的计算能力就能实现这一切。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →