← 最新の論文
🤖 machine learning

TESSERA v2: Scaling Pixel-wise Earth Foundation Models

本論文は、ピクセル単位の地球観測基盤モデルに関する最大規模の制御されたスケーリング研究を提示し、事前学習の損失がダウンストリームの性能の予測因子としては不十分であることを明らかにし、既存の製品を凌駕するコンパクトで高性能な蒸留済み生徒モデルの作成を可能にすると同時に、柔軟で低コストなマトリョーシカ埋め込みをサポートする計算資源配分ルールを確立するものである。

原著者: Zhengpeng Feng, Sadiq Jaffer, Ira Shokar, Jovana Knezevic, James Ball, Pedro Sousa, Mark Elvers, Madeline Lisaius, Clement Atzberger, Robin Young, Aneesh Naik, Niall Robinson, David Coomes, Anil Madha
公開日 2026-08-07
📖 1 分で読めます☕ さくっと読める

原著者: Zhengpeng Feng, Sadiq Jaffer, Ira Shokar, Jovana Knezevic, James Ball, Pedro Sousa, Mark Elvers, Madeline Lisaius, Clement Atzberger, Robin Young, Aneesh Naik, Niall Robinson, David Coomes, Anil Madhavapeddy, Srinivasan Keshav

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

地球を理解するために、巨大で散らかったフォトアルバムを眺めている様子を想像してみてください。ページごとに地球上の特定の場所の写真が載っていますが、写真は撮られた時期もカメラもバラバラで、その半分は雲や霧に覆われています。これが、人工衛星を使って地球を研究している科学者たちが日々直面している現実です。彼らは、これら混沌とした不完全なスナップショットを、地球で何が起きているのか(森林がどのように成長しているか、作物の数を数えるか、あるいは汚染を見つけるかなど)を示す、明確で使い勝手の良い地図へと変えなければなりません。これを行うために、彼らは「基盤モデル」と呼ばれるものを使用します。これらのモデルを、これまでに撮影されたあらゆる衛星写真に目を通してきた、非常に賢い学生だと考えてみてください。彼らは、生の重たい写真を与える代わりに、情報を非常に小さく効率的な「IDカード」(埋め込み)へと要約します。このIDカードは、アルバム全体を持ち歩かなくても、その場所について必要な情報をすべて教えてくれるものです。しかし、大きな疑問が常にありました。それは、いかにして膨大な電気代や時間を無駄にすることなく、これらの学生を最高に賢く訓練するか、という点です。

TESSERA V2 と題されたこの論文は、まさにその疑問に答えるための大規模な実験です。研究者たちは、地球観測AIモデルを構築するための完璧なレシピを見つけ出すために、395回もの異なるトレーニングセッションを実施しました。その結果、いくつかの驚くべき事実を発見しました。第一に、学生の進捗を判断する通常の方法、つまり「宿題のスコア」(事前学習の損失)を見ることは、実は実世界でのパフォーマンスを予測する上で極めて不適切な指標であることを見出しました。それは、練習テストでAを取ったのに本番の試験に落ちる学生のようなもので、このスコアに頼ることは膨大な計算資源を浪えさせることをこの論文は示しています。代わりに、彼らが見つけた勝利の方程式は、モデルの「脳」(エンコーダー)をより大きくし、より多くのデータを投入することであり、一方で答えを整理する部分(プロジェクター)は小さく固定しておくことでした。

しかし、一つ問題があります。巨大な脳は、動かすのにコストがかかるのです。もし超スマートな教師を作ったとしても、毎日それを使うにはコストがかかりすぎます。そこで、チームは「蒸留」と呼ばれる巧妙なトリックを用いました。彼らは、新しいルールに従って、20億パラメータを持つ一つの巨大な「教師」モデルを訓練し、その後、4つの小さな「生徒」モデルにその思考を模倣するように教えました。これらの生徒たちは教師に比べれば極めて小さい存在ですが、それでも驚くほど賢いのです。さらに素晴らしいことに、これらの生徒たちは、ロシアのマトリョーシカ人形のように、異なるサイズで答えを出すことができます。ストレージ容量をほとんど消費しない非常に小さな16次元の答えを求めることもできますが、その場合でも92%の精度を維持しています。あるいは、細部まで全てが必要であれば、フルサイズの128次元の答えを求めることも可能です。その結果、公開されているシステムや非公開のシステムと比較しても、より安価に保存・実行でき、かつ実世界のタスクにおいてより正確なモデルのファミリーが誕生しました。これは、スケールアップするための最善の方法が、「巨大なものを訓練してから、それを縮小させること」であることを証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →