← 最新の論文
🤖 machine learning

SJEPA: Learning Elegant Latent Dynamics with Hybrid Symbolic-Neural Predictors

SJEPAは、記号的な法則と正則化されたニューラル補正を組み合わせることで優美な潜在ダイナミクスを学習し、演算子圧縮を通じて表現の崩壊を防ぎつつ、予測の忠実度、表現の質、および記号的な簡潔性の間の制御可能なトレードオフを強制する、再構成フリーの結合埋め込み予測アーキテクチャである。

原著者: Yongchao Huang

公開日 2026-08-06
📖 1 分で読めます☕ さくっと読める

原著者: Yongchao Huang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

=== 要約 ===

技術的要約:SJEPA – ハイブリッドな記号・ニューラル予測器による優雅な潜在ダイナミクスの学習

1. 問題定式化

結合埋め込み予測アーキテクチャ(JEPA)は、コンテキスト埋め込みからターゲット埋め込みを予測することで抽象的な状態を学習し、予測のセマンティクスとピクセルレベルの変動を分離する。しかし、標準的なJEPAは通常、不透明なニューラル遷移モデルを採用している。これらのモデルは正確ではあるが、どの変数が相互作用しているのか、アクションがいかに未来を変化させるのか、あるいは学習された座標が簡潔な動力学的記述をサポートしているのかどうかを明らかにすることはない。

本論文は、特定のギャップに対処する:JEPAは、予測的な状態だけでなく、それらの状態における「優雅な(elegant)」ダイナミクスを学習できるか? ここで「優雅」とは、予測に十分な、コンパクトで簡潔な法則として操作的に定義される。課題は、表現を崩壊させる(遷移を些細なものにするために情報を消去する)ことなく、あるいはダイナミクスをアンダーフィットさせることなく、情報量の多い予測状態に対して、最も単純で適切な支配法則を見つけることである。

2. メソドロジー:SJEPAフレームワーク

著者らは、潜在遷移演算子を、記号的な支配法則と正則化されたニューラル補正のハイブリッドへと分解する、再構成フリーのフレームワークであるSymbolic JEPA (SJEPA) を導入する。

2.1 ハイブリッド予測器アーキテクチャ

コンテキスト埋め込み ZCZ_C とサイド情報 ϵ\epsilon(例:アクション、時間オフセット)が与えられたとき、ターゲット埋め込み Z^T\hat{Z}_T は次のように予測される:
Z^T=FE,α(ZC,ϵ)+cϕ(ZC,ϵ) \hat{Z}_T = F_{E,\alpha}(Z_C, \epsilon) + c_\phi(Z_C, \epsilon)

  • 記号的法則 (FE,αF_{E,\alpha}): 構造 EE(算術、多項式、超越関数、またはドメイン固有のプリミティブの文法からなる)と係数 α\alpha を持つコンパクトな式。これは、支配的で再利用可能なダイナミクスを捉える。
  • ニューラル補正 (cϕc_\phi): 選択された記号文法では適切に表現できない効果(例:摩擦、未解決の相互作用、近似誤差)を補正するニューラルネットワーク。

2.2 制約付き演算子圧縮

核心となる原理は制約付き演算子圧縮である。目的は、表現が情報量を保持し、かつ崩壊しないことを保証しながら、遷移演算子の複雑さを最小化することである。

最適化問題は次のように定式化される:
minθ,θˉ,E,α,ϕΩ(E)+λcRcorr(ϕ) \min_{\theta, \bar{\theta}, E, \alpha, \phi} \Omega(E) + \lambda_c R_{corr}(\phi)
subject to Lpred(θ,θˉ,E,α,ϕ)δpred,(θ,θˉ)Θrepr \text{subject to } L_{pred}(\theta, \bar{\theta}, E, \alpha, \phi) \le \delta_{pred}, \quad (\theta, \bar{\theta}) \in \Theta_{repr}

  • 目的関数: 記号的複雑性 Ω(E)\Omega(E) と補正への依存度 Rcorr(ϕ)R_{corr}(\phi) を最小化する。
  • 予測制約 (LpredδpredL_{pred} \le \delta_{pred}): アンダーフィッティングを防ぐ。モデルは十分に正確でなければならない。
  • 表現制約 (Θrepr\Theta_{repr}): エンコーダが遷移を些細なものにするために、すべての観測を定数ベクトルにマッピングして表現を崩壊させることを防ぐ。これは、状態が情報量を保持し、崩壊していないことを保証するための正則化(例:VICRegスタイルの分散保存)を通じて強制される。

2.3 学習戦略

本フレームワークは2つのモードをサポートする:

  1. エンドツーエンドの交互学習: エンコーダ(表現)と記号・ニューラル・ダイナミクスを共同で最適化する。プロセスは以下を交互に行う:
    • ダイナミクス探索: 現在の座標に対する最も単純な記号法則を見つけるために、エンコーダを固定する。
    • 空間探索: 表現がより単純な遷移をサポートするように、記号構造を固定してエンコーダを更新する。
  2. 凍結エンコーダ学習: 学習済みのエンコーダ(例:ViT, DINO, I-JEPA)を使用し、記号法則と補正のみを学習する。これは、既存の表現がコンパクトなダイナミクスを露出しているかどうかの診断として機能する。

2.4 ベイジアン拡張

本論文は、記号構造、係数、およびガウス過程(GP)補正に対して不確実性を置くベイジアン定式化を提案している。これにより、データが単一の法則を決定的に特定するのに不十分な場合に、複数の競合する説明を保持することが可能になる。

3. 主要な理論的洞察

  • 予測座標の非識別性: 予測座標は一意的ではない。任意の可逆的な変換が潜在空間の予測精度を保持する。しかし、遷移法則の記号的複雑性は座標系によって変化する。演算子圧縮は、遷移が最も単純になる座標を選択するための帰納バイアスとして機能する。
  • 崩壊のショートカット: 明示的な表現制約がない場合、演算子の複雑性を最小化することは、表現の崩壊への直接的なショートカットを生み出す。エンコーダはすべての観測を定数ベクトル z0z_0 にマッピングでき、これにより恒等予測器がゼロの誤差とゼロの複雑さで達成できてしまう。表現制約は、これを防ぐために不可欠である。
  • 割り当て制御: 記号成分とニューラル成分の間の分解は、予測損失だけでは識別できない。ニューラル成分が記号文法で表現可能なダイナミクスを吸収してしまうのを防ぐために、補正項に対する正則化 (RcorrR_{corr}) が必要であり、これにより記号的法則が支配的なメカニズムを保持することを保証する。

4. 実験結果

著者は、制御された振り子実験を用いてフレームワークを検証している。

実験 1: 座標と方程式の共同学習

  • セットアップ: 高次元でノイズを含む観測を持つ振り子システム。Neural JEPA、事後的な記号回帰(凍結されたNeural JEPAの座標に対してシンボルを適合させる手法)、およびSJEPA(共同学習)を比較した。
  • 知見:
    • 単純性: 共同学習によるSJEPAは、事後的な適合と比較して、平均記号複雑性を約5.6分の1に削減した(26.0から4.67へ)。
    • 精度: SJEPAは、事後的な記号回帰よりも有意に低い物理状態ロールアウト誤差とOOD(分布外)ダイバージェンスを達成したが、柔軟なNeural JEPAが生の予測においては最も正確であった。
    • 崩壊の検証: 制約を取り除いた(表現制約を除去した)単一ステップの診断により、埋め込みがほぼ定数となり、ゼロのベクトル場となった。これは、理論的な崩壊のショートカットを裏付けるものである。

実験 2: 文法誤指定下でのハイブリッド・ダイナミクス

  • セットアップ: 真のダイナミクスには二次抵抗(ppp|p|)が含まれていたが、記号文法は意図的にこの項を除外するように制限されていた。
  • 知見:
    • 正則化の効果: 補正の正則化を用いることで、記号成分は表現可能な項(例:sin(q)\sin(q))を保持し、ニューラル補正は残差の抵抗に集中した。正規化された補正エネルギー比は低かった(0.06)。
    • 正則化なしの場合: 正則化のないハイブリッドでは、ニューラル補正が表現可能なダイナミクスを吸収してしまい、記号係数が縮小し、補正エネルギー比が増大した(0.55)。
    • 結論: 正則化は割り当てを正常に制御し、表現可能なダイナミクスに対して記号的メカニズムを保持しつつ、ニューラル成分を残差に使用することを可能にした。

5. 意義と主張

本論文は、SJEPAが標準的なニューラル予測器や事後的な記号適合とは異なる、補完的な方向性をJEPAファミリーの中に提供すると主張している。

  • 制御可能なトレードオフ: SJEPAは、柔軟なニューラルネットワークに対して生の予測精度において普遍的な優位性を主張するものではない。代わりに、予測の忠実度、表現の質、記号的簡潔さ、および記号・ニューラル間の割り当ての間で、制御可能なトレードオフを提供する。
  • 優雅なダイナミクス: 演算子圧縮が、表現の崩壊を防ぎつつ、単純でありながらも適切なダイナミクスを誘発する予測座標を選択できることを示している。
  • 解釈可能性: 得られるモデルは、不透明なニューラル予測器とは異なり、微分可能で線形化が可能であり、プランニングに使用できるコンパクトで検査可能な支配法則(例:振動子のような相互結合)を提供する。
  • モジュール性: 本フレームワークはモジュール式であり、交互学習、凍結エンコーダ、ベイジアン不確実性、およびアクション条件付き制御をサポートしている。

著者は、実験が特定のシステム(振り子)に対する制御された診断であることに留意し、高次元の視覚データ、現実世界の科学的データセット、および複雑な制御タスクへの汎用性は今後の課題であると述べ、謙虚な姿勢を保っている。主要な貢献は、「最も単純で適切なダイナミクスを学習する」という概念を、演算子圧縮と表現の完全性のバランスを取る制約付き最適化問題として定式化したことにある。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →