✨ 要点🔬 技术摘要
想象一下,试图通过观察一本巨大的、杂乱无章的相册来了解地球。每一页都是地球上某个特定地点的照片,但这些照片拍摄的时间不同,使用的相机也不同,而且其中一半都被云层或雾气遮挡住了。这就是科学家利用卫星研究地球的日常现实。他们需要将这些混乱、不完整的快照转化为一张清晰、可用的地图,用以展示地球正在发生的变化——无论是追踪森林如何生长、统计农作物数量,还是发现污染。为了做到这一点,他们使用了被称为“基础模型”的东西。把这些模型想象成读过以往所有卫星照片的超级聪明的学生。这些学生并不会给你原始的、沉重的照片,而是将信息总结成一张微小的、高效的“身份证”(即嵌入/embedding)来代表每一个地点。这张身份证能告诉你关于该位置所需的一切信息,而无需携带整本相册。然而,大问题在于:我们如何训练这些学生,让他们变得尽可能优秀,同时又不浪费大量的电力和时间?
这篇题为 TESSERA V2 的论文正是为了回答这个问题的巨大实验。研究人员进行了 395 次不同的训练过程,以找出构建这些地球观测 AI 模型的完美配方。他们发现了一些令人惊讶的事实。首先,他们发现通常衡量学生进步的方式——观察他们的“作业分数”(预训练损失)——实际上是预测他们在现实世界中表现的糟糕指标。这就像一个学生在练习测试中拿了 A,但在期末考试中不及格一样;论文表明,依赖这个分数会浪费大量的计算资源。相反,他们发现获胜策略是让模型的“大脑”(编码器)变得更大并喂给它更多的数据,同时保持负责组织答案的部分(投影器)小巧且固定。
但问题在于:一个巨大的大脑运行起来非常昂贵。如果你建立一位超级聪明的老师,每天使用她的成本会太高。因此,团队使用了一个被称为“蒸馏”的巧妙技巧。他们利用他们的新规则训练了一个拥有 20 亿参数的巨型“老师”模型,然后教了四个较小的“学生”模型去模仿它的思考方式。这些学生与老师相比非常渺小,但依然极其聪明。更酷的是,这些学生可以吐出不同尺寸的答案,就像俄罗斯套娃(Matryoshka)一样。你可以要求一个仅需极少存储空间但保留了 92% 准确性的 16 维微小答案,或者如果你需要每一个细节,也可以要一个完整的 128 维答案。结果是,诞生了一个比测试过的任何开源或私有系统都更便宜、运行更快且在现实任务中更准确的模型家族,这证明了有时,规模化的最佳方式是先训练一个巨头,然后再将其缩小。
技术摘要:TESSERA V2 – 扩展像素级地球基础模型
问题陈述
将地球观测(EO)应用于下游任务面临着显著的瓶颈:数据准备工作极其繁重(辐射定标、云层校正、跨传感器协调)、地面真值标签稀缺且具有地域性,且原始影像包含不规则的采样频率和云层遮挡。虽然“嵌入即数据”(embeddings-as-data)类产品旨在提供分析就绪的地球表面向量表示,但现有系统存在规格僵化的问题。它们通常提供单一且固定的嵌入维度和模型规模,迫使所有用户无论其具体的预算或任务需求如何,都必须承担相同的存储和 I/O 成本。此外,在地球观测领域,关于如何分配预训练计算量(在编码器规模、投影器规模和数据量之间进行分配)的缩放法则(scaling laws)仍不明确,许多研究依赖于预训练损失作为下游性能的代理指标——由于卫星数据的独特特征(如云层主导和轨道采样),这一代理指标可能并不可靠。
方法论
1. 下游驱动的缩放研究
作者进行了迄今为止规模最大的受控地球观测缩放研究,涉及在固定的像素级 Barlow Twins 系列框架下的 395 次训练运行 。
架构: 通过初步筛选,选择了一个固定的像素级 Sentinel-1/2 编码器架构家族。
变量: 研究在三个维度上进行了搜索:编码器规模(N e n c N_{enc} N e n c ,16 种宽度,参数量从 7M 到 278M)、投影器规模(N p r o j N_{proj} N p r o j ,4 种宽度)以及训练数据量(D D D ,0.03M 到 3,202M d-pixels)。
评估: 每个模型都在来自 ALPHAEARTH 套件的 15 个多样化下游任务 (分类、变化检测、回归)上进行了评估。
计算度量: 总训练 FLOPs 使用特定公式计算,该公式考虑了每步的三次编码器传递(两个增强视图 + 一个混合视图/mix-up view)以及 Barlow Twins 互相关代价。
2. 关键发现:缩放法则
该研究得出了两个关键的经验性发现,这些发现与标准的语言/视觉缩放假设相矛盾:
发现 F1(损失是较差的代理指标): 收敛的预训练损失几乎无法预测下游性能(∣ P e a r s o n r ∣ < 0.2 |Pearson\ r| < 0.2 ∣ P e a r so n r ∣ < 0.2 )。仅基于损失进行模型选择,需要比基于实际任务性能进行选择多出约 2–5 倍的计算量 ,才能达到相同的下游得分。
发现 F2(最优分配): 随着训练预算的增长,最优策略是同时增加 编码器容量 和 训练数据 ,同时保持 投影器规模固定 。投影器充当的是“一次性训练支架”,而非缩放轴。拟合的幂律关系为 N e n c ∝ C 0.36 N_{enc} \propto C^{0.36} N e n c ∝ C 0.36 和 D ∝ C 0.63 D \propto C^{0.63} D ∝ C 0.63 ,而 N p r o j ∝ C 0.011 N_{proj} \propto C^{0.011} N p r o j ∝ C 0.011 (在统计学上与零无异)。
3. 教师-学生蒸馏与 MATRYOSHKA 嵌入
为了弥合大规模、高性能教师模型与可部署产品之间的差距,作者采用了蒸馏策略:
教师训练: 使用推导出的缩放规则(过大编码器 + 匹配数据,固定投影器)在约 140 亿 d-pixels 上训练了一个庞大的 2B 参数像素级编码器 。
蒸馏: 使用冻结的 2B 教师模型来蒸馏一系列紧凑的学生模型(包括 N, S, M, L 尺寸,参数量范围从 1M 到 44M)。
MATRYOSHKA 表示: 与自监督预训练仅识别旋转不变子空间不同,针对固定教师的蒸馏提供了必要的信号来对嵌入坐标进行排序。这使得学生模型能够生成 嵌套嵌入 ,其中维度 d ∈ { 16 , 32 , 64 , 128 } d \in \{16, 32, 64, 128\} d ∈ { 16 , 32 , 64 , 128 } 的前缀都是有效的表示。16 维的前缀在仅消耗 1/8 存储成本的情况下,仍能保留约 92% 的全维度性能。
推理优化: 系统使用 自适应桶采样(adaptive bucket sampling) ,将变长的观测序列打包进能容纳它们的最小固定长度桶中,并通过中点重采样填充剩余部分。这避免了任意丢弃观测值或重复数据。
关键结果
性能: 蒸馏后的 TESSERA v2-2B-L (44M 参数)优于测试的所有开源及商业嵌入产品,包括 ALPHAEARHE (480M 参数)和 OlmoEarth-L (308M 参数)。
在 14 个留出数据集的综合测试中,TESSERA v2 取得了 0.647 的综合得分,高于排名第二的系统(0.614)。
在 15 个任务的 ALPHAEARTH 套件中,它得分 0.593 ,超过了 ALPHAEARTH(0.560)和 TESSERA v1(0.541)。
效率: 44M 参数的学生模型在实现最先进性能的同时,其推理成本比 2B 教师模型低 两个数量级 ,且显著低于更大的商业模型。
存储适应性: MATRYOSHKA 前缀允许用户在存储与性能之间进行权衡。16 维前缀在仅用 1/8 存储成本的情况下仍能维持约 92% 的完整得分,而 32 维前缀则能维持约 97%。
伪影减少: TESSERA v2 显著减少了 v1 中可见的沿轨道条带(along-track striping)和分块缝隙(tile-seam)不连续现象,同时保持了年际稳定性。
意义与主张
本文声称提供了一个 具体的、基于经验的地球观测像素级基础模型缩放配方 ,将范式从“训练大型模型并寄希望于损失相关性”转变为“训练大型模型、通过下游性能进行选择、并进行蒸馏”。
重新定义地球观测的缩放: 作者断言,地球观测的缩放法则与语言/视觉有着本质区别;依赖预训练损失是低效且具有误导性的。所提出的分配规则(增加编码器和数据,固定投影器)被认为是地球观测的最优路径。
蒸馏是实现嵌套嵌入的必要条件: 本文声称,由于坐标对称性问题,无法通过自监督前缀损失有效地学习嵌套嵌入(MATRYOSHKA);相反,针对固定教师的蒸馏 是提供使前缀在不同维度下均可用的排序信号所必需的。
产品的可行性: TESSERA v2 不仅仅是一个模型,更是一个提供 适应性 的可部署产品家族。它允许用户根据其特定的预算约束选择模型规模和嵌入维度,而无需重新训练,解决了现有“分析就绪”类数据产品中的关键空白。
作者计划发布覆盖 2017–2025 年的全球 10m 年际嵌入作为 TESSERA 产品第 2 版,并将代码和检查点(checkpoints)向社区开放。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。