複雑なシステム、例えば天気、株式市場、または交通流の未来を予測しようとしていると想像してください。これらのシステムは、互いに影響し合う多くの異なる可動部分(変数)を持っています。あるときは、あるものが上昇すると、もう一つのものも上昇します(相乗効果)。別のときは、あるものが上昇すると、もう一つは下降します(拮抗作用)。
長らく、これらの未来を予測しようとするコンピュータモデルには、2 つの大きな問題がありました:
- 「言語の壁」: 温度や交通速度など、異なる種類のデータを直接混ぜ合わせようとしていました。これは、ミキサーでリンゴとオレンジを混ぜて、滑らかなジュースができると期待するようなものです。単位や意味が全く異なるため、コンピュータは混乱します。
- 「万能型」の盲点: ほとんどのモデルは、一度に一つの変数しか見ていなかったか、あるいはすべてが友好的であると仮定していました。ある変数は互いに競合し(負の相関)、他の変数は協力し合っているという事実を見落としていました。
そこで登場したのが、新しい「時系列基盤モデル」であるFalcon-Xです。これは、これらの混沌としたシステムのための超スマートな通訳兼指揮者だと考えてください。その仕組みを簡単なステップに分解して説明します。
1. 「万能通訳」(潜在プロトタイプ空間)
Falcon-X は、生データ(例えば「100 度」対「50 台」)を直接比較することを強制する代わりに、まずすべてを潜在プロトタイプ空間と呼ばれる秘密の普遍的な言語に変換します。
- 比喩: 英語、中国語、スペイン語など、異なる言語を話す人々が満員の部屋にいると想像してください。彼らが直接話し合うよう強制するのではなく、専門家である通訳グループ(プロトタイプ)がいます。全員が通訳に話し、通訳は特定の言語そのものではなく、言葉の背後にある意味を理解します。
- なぜ役立つのか: これにより「言語の壁」が解決されます。データが電力に関するものか交通に関するものかに関係なく、Falcon-X はそれらを同じ「意味」に変換するため、互いに理解し合うことができます。
2. 「二重視点レンズ」(Diff-Attention)
ほとんどの AI モデルは、ポジティブなことしか見えないカメラのようです。二つのものが一緒に動けば、カメラは「良い!」と言います。しかし、二つのものが離れて動けば、カメラは混乱するか、それを無視します。
Falcon-X には、特別なDiff-Attentionメカニズムがあります。これは二つのレンズを使用します:
- 相乗効果レンズ: 互いに助け合うものを探します(例:雨と傘)。
- 拮抗作用レンズ: 互いに競合するものを探します(例:価格と需要)。
- 比喩: 法廷の判事を想像してください。この判事は「賛成」側だけを聞くのではなく、「賛成」と「反対」の両方の主張を同時に聞き、互いに比較衡量する特別な能力を持っています。これにより、ある変数が別のものを反対方向に押しやるような複雑な関係をモデルが理解できるようになります。
3. 「スマート配達人」(変量再構成ルーター)
通訳たちが仕事を終え、判事が主張を衡量した後、モデルは元のデータに対する具体的な予測(例えば「気温はどうなるか?」)に戻す必要があります。
- 比喩: 忙しいレストランのキッチンだと考えてください。シェフ(モデル)は完璧な巨大なシチュー(普遍的な理解)を調理します。しかし、あなたは特定のスープを注文し、友人はサラダを注文しました。ルーターは、その巨大なシチューからどの材料があなたのおスープに属し、どの材料が友人のサラダに属するかを正確に知っているウェイターです。鍋全体をあなたの皿に放り込むのではなく、各料理のために慎重に選び、組み立てます。
- なぜ役立つのか: これにより、モデルが多くの異なるシステムの混合から学習したとしても、詳細が混同されることなく、依然としてあなたの特定のシステムに対する正確な答えを提供できることが保証されます。
結果
著者らは、Falcon-X を天気、エネルギーグリッド、販売などの実世界のデータの大規模なコレクションでテストしました。
- スコア: 精度において、Chronos-2 や Moirai などの以前の最高モデルをすべて上回りました。
- 「ゼロショット」の超能力: この「普遍的な言語」を学習したため、これまで見たことのないものを予測することができます。訓練されていない新しいデータセットを示しても、特定の数字だけでなく、背後にあるパターンを理解しているため、良い推測を行うことができます。
まとめ
Falcon-X は、異なる言語を話し、争い、協力する人々でいっぱいの混沌とした部屋のようなものです。それは彼らを、すべてを共通言語に翻訳する通訳グループに送り、友好的な関係と敵対的な関係の両方を衡量する判事を介し、その後、各人に必要なものを正確に提供するスマートなウェイターを戻します。その結果、次に何が起こるかの、より明確で正確な図が得られます。
技術的サマリー:Falcon-X
問題定義
時系列基盤モデル(TSFMs)は、大規模なクロスドメイン事前学習を活用することで予測を再構築しています。しかし、既存の TSFM は、異質な多変量データを処理する際に、2 つの根本的な限界に直面しています。
- 意味的ミスマッチ: ほとんどのモデルは、生の変量空間で直接動作します。異なるデータセットからの異質な物理量(例:温度対交通量)を混合する場合、標準的なグループアテンション機構は、それらの異なる意味を整合させることに失敗します。これにより「意味の崩壊」が生じ、モデルは転用可能な時間的構造ではなく、偽のデータセット固有の相関を学習してしまいます。
- 限られた関係的表現力: 現実世界のシステムは、相乗的(正)および拮抗的(負)の依存関係を含む、複雑な相互作用を示します。非負の softmax スコアに依存する標準的なアテンション機構は、主に集約効果を捉え、対立するダイナミクスや拮抗的な関係を明示的にモデル化することに苦労します。
現在のアプローチは、多変量系列を平坦化するか、生空間内でグループアテンションを使用することが多く、次元数に対してスケーリング性が低い、あるいは異質な意味を解離できないという問題があり、ゼロショット転送能力を制限しています。
手法:Falcon-X
Falcon-X は、物理変量を相互作用空間から解離するように設計されたエンコーダのみの基盤モデル(5 億 9100 万パラメータ)です。これは、4 つの主要な段階からなる統一潜在プロトタイプ空間パラダイムを導入します。
1. 前処理とトークン化
- 正規化: 入力には、欠損エントリを保持するために、観測値のみから計算されたインスタンスごとの平均と標準偏差を用いた arcsine 変換が施されます。
- トークン化: 系列には、相対的なタイムスタンプと二値の観測マスクが追加されます。その後、非重複のパッチに分割され、残差パッチ埋め込み機構を介して隠れ次元に投影されます。
2. 時間アテンション
Falcon-X は、内在的な時間的パターンを最初に捉えるために、エンコーダのみのトランスフォーマーアーキテクチャを採用します。n 層の時間アテンションが、時間次元に沿って各変量に対して独立して適用されます。これにより、クロス変量相互作用が発生する前に、堅牢な時間的ダイナミクスが抽出され、早期の意味的絡み合いが防止されます。
3. 変量アテンション(中核的イノベーション)
この段階は、異質な入力と統一された表現の間のギャップを埋めます。
- 統一プロトタイプ差分アテンション(UPDA): 生の変量を混合する代わりに、Falcon-X はそれらを固定次元の潜在プロトタイプ空間(C)に投影します。これは、2 つの学習可能なキー行列:Kpos(相乗的)およびKneg(拮抗的)を用いた差分アテンション機構を利用します。
- モデルは両方のキーに対してアテンションスコアを計算します:Apos=softmax(QKposT) およびAneg=softmax(QKnegT)。
- 統一表現は、差分スコアに基づいて値を集約することで導き出されます:HC=(Apos−λAneg)TV。
- 直交性損失がKposとKnegを制約し、意味の独自性を確保します。これにより、モデルは正および負の親和性の両方を明示的に捉えることができます。
- 潜在エンティティアテンション(LEA): 共有プロトタイプ空間で整合が取れた後、グローバルなクロス変量相互作用が標準的なマルチヘッドアテンションを介して実行されます。すべてのエンティティが次元に依存しない意味空間に存在するため、異なる変量数と物理的意味を持つデータセット間でのシームレスなゼロショット転送が促進されます。
- 変量再構成ルーター(VRR): 特定の軌道を再構築するために、要求と配信のメカニズムが使用されます。元の時間的埋め込みからのルーティング要求(Rreq)がプロトタイプインデックス(Pidx)と照合され、ソースコンテキスト(Sctx)から関連する意味ペイロードが取得されます。
- 最終出力は、ゲート付き残差接続を介して元の時間的埋め込みと再構成されたクロス変量表現を融合します:H^=HT+G(HT)⊙HV。このゲートは融合を動的に調整し、相関の弱いシステムでは意味的干渉を防ぎつつ、相関の強いシステムでは依存関係を活用します。
4. 予測ヘッド
このモデルは、Quantile Loss を使用して一連の分位数にわたる将来の分布を予測する、確率的予測パラダイムを採用しています。
主要な貢献
- 新しい異質モデリングパラダイム: Falcon-X は、生空間での混合から、統一された潜在プロトタイプ空間への移行を図ります。これにより、データセット間の意味的相違を解決する汎用的な座標系が作成され、原理的なゼロショット知識転送が可能になります。
- アーキテクチャの革新:
- 差分プロトタイプアテンション: 非負のアテンションの限界を克服し、相乗的および拮抗的なダイナミクスの両方を明示的にモデル化します。
- 変量再構成ルーター: グローバルコンテキストと局所的な時間信号を適応的に融合するゲート機構であり、多様な依存強度にわたる堅牢性を保証します。
- 実証的卓越性: このモデルは、包括的なベンチマークで最先端のパフォーマンスを示し、その構造的適応性を検証しています。
実験結果
Falcon-X は、多様なドメイン(自然、エネルギー、金融、医療など)を網羅する 2 つの大規模ベンチマーク、GIFT-Evalおよびfev-benchで評価されました。
- GIFT-Eval: Falcon-X は、0.666 MASEおよび0.453 CRPSという最高の全体的パフォーマンスを達成しました。STRIDE(+1.2% MASE)、Toto-2.0-FT(+1.9% MASE)、Timer-S1(+3.9% MASE)などの強力なベースラインを上回りました。特に、予測期間が長くなるにつれてその優位性が増し、中期的(0.68 MASE)および長期的(0.70 MASE)な結果で最高を記録しました。
- fev-bench: Falcon-X は、厳密に内生ターゲット系列に依存しながら、Chronos-2(0.652 vs. 0.645 MASE)に次ぐ 2 位となり、TiRex や Moirai 2.0 などの他の最近のモデルを上回りました。
- アブレーション研究: 負のプロトタイプキー(Kneg)を削除すると、最も深刻なパフォーマンス低下が生じ、拮抗的な関係のモデル化の必要性が確認されました。ユニバリアートとマルチバリアートの共同学習は、2 段階のカリキュラム学習よりも優れていることが証明されました。
- スケーリング: このモデルはニューラルスケーリング則に従い、パラメータが 5900 万から 5 億 9100 万にスケールするにつれて、一貫したパフォーマンス向上を示しています。
意義と主張
本論文は、Falcon-X が複雑な多変量環境に対する原理的かつスケーラブルなパラダイムを提供すると主張しています。物理変量を相互作用空間から解離し、相乗的および拮抗的な二重依存関係を明示的にモデル化することで、現在の TSFM が抱える意味的整合性と関係的表現力のボトルネックに対処します。著者らは、このアプローチが、生変量次元に結合されることなく再利用可能なクロスドメインパターンを学習することを可能にする、堅牢なゼロショット構造的転送を実現すると提唱しています。この研究は、時系列のためのより統合的で表現豊かな基盤モデルへの一歩として提示され、今後の研究を支援するためにコードは公開されています。
毎週最高の machine learning 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録