← 最新论文
🤖 machine learning

TESSERA v2: Scaling Pixel-wise Earth Foundation Models

本文呈现了针对像素级地球观测基础模型规模最大规模的受控缩放研究,揭示了预训练损失是下游性能的一个较差预测指标,并建立了一种计算分配规则,能够创建出既能超越现有产品、又支持灵活且低成本的马特罗什卡(Matryoshka)嵌入的高性能紧凑型蒸馏学生模型。

原作者: Zhengpeng Feng, Sadiq Jaffer, Ira Shokar, Jovana Knezevic, James Ball, Pedro Sousa, Mark Elvers, Madeline Lisaius, Clement Atzberger, Robin Young, Aneesh Naik, Niall Robinson, David Coomes, Anil Madha
发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhengpeng Feng, Sadiq Jaffer, Ira Shokar, Jovana Knezevic, James Ball, Pedro Sousa, Mark Elvers, Madeline Lisaius, Clement Atzberger, Robin Young, Aneesh Naik, Niall Robinson, David Coomes, Anil Madhavapeddy, Srinivasan Keshav

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,试图通过观察一本巨大的、杂乱无章的相册来了解地球。每一页都是地球上某个特定地点的照片,但这些照片拍摄的时间不同,使用的相机也不同,而且其中一半都被云层或雾气遮挡住了。这就是科学家利用卫星研究地球的日常现实。他们需要将这些混乱、不完整的快照转化为一张清晰、可用的地图,用以展示地球正在发生的变化——无论是追踪森林如何生长、统计农作物数量,还是发现污染。为了做到这一点,他们使用了被称为“基础模型”的东西。把这些模型想象成读过以往所有卫星照片的超级聪明的学生。这些学生并不会给你原始的、沉重的照片,而是将信息总结成一张微小的、高效的“身份证”(即嵌入/embedding)来代表每一个地点。这张身份证能告诉你关于该位置所需的一切信息,而无需携带整本相册。然而,大问题在于:我们如何训练这些学生,让他们变得尽可能优秀,同时又不浪费大量的电力和时间?

这篇题为 TESSERA V2 的论文正是为了回答这个问题的巨大实验。研究人员进行了 395 次不同的训练过程,以找出构建这些地球观测 AI 模型的完美配方。他们发现了一些令人惊讶的事实。首先,他们发现通常衡量学生进步的方式——观察他们的“作业分数”(预训练损失)——实际上是预测他们在现实世界中表现的糟糕指标。这就像一个学生在练习测试中拿了 A,但在期末考试中不及格一样;论文表明,依赖这个分数会浪费大量的计算资源。相反,他们发现获胜策略是让模型的“大脑”(编码器)变得更大并喂给它更多的数据,同时保持负责组织答案的部分(投影器)小巧且固定。

但问题在于:一个巨大的大脑运行起来非常昂贵。如果你建立一位超级聪明的老师,每天使用她的成本会太高。因此,团队使用了一个被称为“蒸馏”的巧妙技巧。他们利用他们的新规则训练了一个拥有 20 亿参数的巨型“老师”模型,然后教了四个较小的“学生”模型去模仿它的思考方式。这些学生与老师相比非常渺小,但依然极其聪明。更酷的是,这些学生可以吐出不同尺寸的答案,就像俄罗斯套娃(Matryoshka)一样。你可以要求一个仅需极少存储空间但保留了 92% 准确性的 16 维微小答案,或者如果你需要每一个细节,也可以要一个完整的 128 维答案。结果是,诞生了一个比测试过的任何开源或私有系统都更便宜、运行更快且在现实任务中更准确的模型家族,这证明了有时,规模化的最佳方式是先训练一个巨头,然后再将其缩小。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →