← 最新论文
🤖 machine learning

Less Tokens, Better Forecasts: Sparse Residual Routing for Efficient Weather Prediction

该论文介绍了 Sparse-Reslim,一种无参数的路由模块,它通过仅让稀疏的 token 子集通过昂贵的 Transformer 块,同时通过残差增量更新保留全网格表示,从而在不牺牲预报质量的前提下,提高了基于 ViT 的天气预报的效率和准确性,并实现了显著的加速和内存减少。

原作者: Janet Wang, Yunbei Zhang, Lin Zhao, Xi Xiao, Jihun Hamm, Xiao Wang

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Janet Wang, Yunbei Zhang, Lin Zhao, Xi Xiao, Jihun Hamm, Xiao Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图预测全球的天气。为了实现这一目标,计算机将地球的大气层分解成一个巨大的网格,由数百万个微小的方块组成(就像一张巨大的像素化地图)。对于每一个方块,计算机都必须计算风速、温度和气压将如何变化。

问题所在:“忙碌的小蜜蜂”瓶颈
目前的天气模型表现得像一只勤奋但效率略低的蜜蜂。它会访问花园里的每一朵花(网格方块),无论这些地方多么无聊或空旷。

  • 有些区域,比如飓风中心或平静的海洋,变化并不大。
  • 而其他区域,比如风暴的边缘,则非常混乱且变化剧烈。

然而,计算机在处理那些“无聊”的平静区域时所花费的时间和精力,与处理那些“兴奋”的风暴区域时是完全一样的。这是一种能量的浪费。

旧的解决方案:“剪切与粘贴”的错误
科学家们曾尝试通过让计算机忽略无聊的区域(剪枝)或将它们合并成一个大斑块(合并)来解决这个问题。

  • 类比: 想象你正在写一个关于城市的故事。为了节省时间,你决定跳过对安静郊区的描写,只是在空白处写上“郊区存在”。
  • 问题: 在天气预报中,你不能仅仅跳过某个地点。一个地点的情况会影响到相邻的地点。如果你删除了一个点或者用一个“占位符”替换了它,故事就会断掉。计算机会感到困惑,因为它在地图上不再拥有每个方块的数值,这会破坏对第二天的预测。

新的解决方案:Sparse-Reslim(“增量交付”系统)
该论文的作者创造了一种名为 Sparse-Reslim 的新方法。把它想象成一种聪明的快递服务,它改变的是“如何完成工作”,而不是改变“交付的内容”。

它是这样运作的,使用一个简单的类比:

  1. 三阶段工厂: 想象计算机的大脑是一个拥有三个房间的工厂:

    • 第一间房(稠密早期): 每一位工作人员(网格方块)都会得到一份完整的简报。每个人都参与其中。
    • 第二间房(稀疏中期): 这是昂贵的、重体力活的房间。经理并没有把所有 10,000 名工人送进去,而是随机挑选了仅 25% 的人(即“被选中的标记/tokens”)。
    • 第三间房(稠密后期): 所有人重新聚在一起进行最后的总结。
  2. 神奇的技巧(残差增量/Residual Delta):

    • 在中间的房间里,只有那 25% 被选中的工人进行繁重的计算。他们计算出天气应该如何变化。
    • 其余 75% 的工人则坐在走廊里。他们不干活,但他们完整地保留了最初的简报,原封不动
    • 交付: 这 25% 的工人完成了数学计算,并递交了一张被称为“增量”(Delta,意为“变化”)的小纸条。
    • 计算机将这张纸条上的“变化”重新粘贴回那些工人所在的特定位置。
    • 至关重要的一点是: 那 75% 坐在走廊里的工人并没有得到一张“假”纸条或“空白”纸条。他们只是保留了原始的简报。地图仍然是 100% 完整的,没有任何东西被删除,也没有任何东西被替换成掩码。

为什么这意义重大

  • 速度: 因为计算机在中间部分只对 25% 的网格进行复杂的数学运算,所以它的运行速度快了 2.5 倍。在最高分辨率下,它几乎快了 3 倍
  • 内存: 它使用的计算机内存(VRAM)不到原来的一半,因为它不需要同时为每一个点都持有沉重的计算数据。
  • 更好的准确性: 出人意料的是,天气预测比旧的、缓慢的方法更准确
    • 原因: 论文指出,随机选择哪些工人进入中间房间起到了“随机正则化器”(stochastic regularizer)的作用(这是一种高级说法,指防止计算机过度专注于某种特定的模式,从而帮助它更好地学习)。这就像一位老师随机点名学生回答问题;比起只询问那些固定的优等生,这种方式能让全班同学都保持警觉并学得更好。

结果
团队在两种类型的天气模型(一种预测单一未来,另一种生成多种可能的未来)上进行了测试。在这两种情况下:

  • 模型的训练速度大大加快。
  • 它们使用了更少的内存。
  • 它们对风速、温度和气压的预测比标准模型更加准确。

总结
Sparse-Reslim 就像一位聪明的管理者,他意识到并非世界的每一个部分都需要一支专家团队在每一秒钟都全力投入工作。通过让安静的区域“休息”,同时让专家们处理活跃区域,并将专家的发现重新添加回地图,该系统变得更快、更便宜,而且出人意料地更聪明。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →