GeoNorm: Unify Pre-Norm and Post-Norm with Geodesic Optimization
本文介绍了 GeoNorm,一种通过将层输出解释为具有层级衰减的流形上的测地更新,从而统一了 Pre-Norm 和 Post-Norm 方法的新型归一化方法,在实现 Transformer 模型性能一致提升的同时,其计算开销微乎其微。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人写故事。为了做到这一点,机器人使用了一种名为 Transformer 的复杂机器。在这个机器内部,有很多层“工人”(比如注意力工人(attention workers)和前馈工人(feed-forward workers)),他们沿着一条链条传递信息。
每当一个工人向下一个工人传递消息时,消息都需要被“归一化”(normalized)。把归一化想象成一个 音量旋钮 或一把 尺子。它确保消息在进入下一步之前,既不会太大声(过大),也不会太小声(过小)。
长期以来,工程师有两种调节这个音量旋钮的主要方法:
- Post-Norm(后归一化): 工人完成工作,将他们的消息添加到链条中,然后 有人检查音量并进行调整。
- Pre-Norm(前归一化): 在工人开始工作 之前,有人先检查音量,这样工人每次开始时都能得到一个大小完美的信号。
两种方法都有其优缺点。Post-Norm 有时会导致音量剧烈飙升(就像回授产生的尖叫声);而 Pre-Norm 则可能导致早期的工人比起后期的工人喊得太响。
新的想法:GeoNorm
这篇论文的作者们说:“为什么我们只是用尺子来检查音量呢?让我们思考一下消息行进的 路径。”
他们意识到,这些消息移动的方式就像是在一个 地球仪(球体)的表面上行走,而不是在平坦的地面上行走。
- 旧的方法(投影/Projection): 想象你正在地球仪上行走。你沿着直线迈出一步(就像一束激光)。如果你一直走直线,你最终会从地球仪掉进太空。为了修复这个问题,旧方法会说:“噢不,你掉了!让我们直接把你拉回到表面上来。”这是一种笨拙且突兀的修正,会扭曲你的方向。
- 新的方法(测地线/Geodesic): 作者们建议,与其走直线然后掉下去,不如沿着球体的 弯曲表面 行走。在数学中,曲面上最短的路径被称为 测地线(Ge geodesic,就像飞机为了从纽约飞往伦敦而飞行弧线,而不是直线一样)。
GeoNorm 用这种笨拙的“拉回地面”法,替换成了平滑的“沿曲线行走”法。它使用了一个叫做 指数映射(exponential map)的数学工具,以确保消息自然地留在“地球仪”上,沿着曲线移动,而不会掉落或需要剧烈的修正。
“衰减”技巧
论文还引入了一种处理“步长”(即机器人迈出的步子有多大)的聪明方法。
- 想象你在爬山。在山脚下,你可以迈出大步且自信;但随着你爬得越高,地形变得越复杂,你应该迈出更小、更谨慎的步伐。
- GeoNorm 应用了这种逻辑。它在初始阶段使用较大的更新,并随着消息在网络更深层中移动,逐渐减小步长。这可以防止机器人在链条接近末端时跌跌撞撞或感到困惑。
他们发现了什么?
作者在不同的“徒步路线”(如 Arxiv 和 Books3 等数据集)以及不同规模的“机器人”(从小型到巨大的模型规模)上测试了这种新方法。
- 性能更好: 使用 GeoNorm 的机器人始终学习得更快,并且最终获得了更好的“分数”(更低的错误率),表现优于使用旧方法的机器人。
- 稳定性: 旧方法有时会出现“损失峰值”(loss spikes,即性能突然崩溃),尤其是在机器人非常深或者训练时间很长的情况下。GeoNorm 要平滑得多,且不会崩溃。
- 没有额外成本: 最棒的部分是?这种在地球仪上行走的新方式并不会让机器人背负更重的背包。它不会增加额外的内存消耗,也不会让计算机变慢;它只是改变了机器人 移动的方式。
总结
这篇论文认为,与其强迫 AI 的消息去适应一个盒子(旧的归一化方法),我们应该让它们沿着它们本该旅行的弯曲表面自然流动。通过这样做,AI 会变得更稳定、学习得更好,而且不需要额外的计算能力就能实现这一切。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。