← Derniers articles
🤖 machine learning

SJEPA: Learning Elegant Latent Dynamics with Hybrid Symbolic-Neural Predictors

SJEPA est une architecture de prédiction par plongement conjoint sans reconstruction qui apprend des dynamiques latentes élégantes en combinant des lois symboliques avec des corrections neurales régularisées, imposant ainsi un compromis contrôlable entre fidélité prédictive, qualité de représentation et parcimonie symbolique, tout en empêvant l'effondrement de la représentation par compression d'opérateurs.

Auteurs originaux : Yongchao Huang

Publié 2026-08-06
📖 1 min de lecture☕ Lecture pause café

Auteurs originaux : Yongchao Huang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

=== RÉSUMÉ TECHNIQUE ===

Résumé Technique : SJEPA – Apprentissage de la Dynamique Latente Élégante avec des Prédicteurs Hybrides Symboliques-Neuraux

1. Formulation du Problème

Les architectures prédictives à plongement conjoint (JEPA) apprennent des états abstraits en prédisant des plongements cibles à partir d'emplacements de contexte, séparant ainsi la sémantique prédictive de la variabilité au niveau des pixels. Cependant, les modèles JEPA standards emploient généralement des modèles de transition neuronaux opaques. Bien qu'efficaces, ces modèles ne révèlent pas quelles variables interagissent, comment les actions modifient le futur, ou si les coordonnées apprises permettent une description dynamique concise.

Le papier traite d'une lacune spécifique : Un JEPA peut-il apprendre non seulement des états prédictifs, mais aussi des dynamiques « élégantes » sur ces états ? Ici, l'« élégance » est définie opérationnellement comme une loi compacte et parcimonieuse qui reste adéquate pour la prédiction. Le défi consiste à trouver la loi de régissement la plus simple et adéquate pour un état prédictif informatif sans provoquer l'effondrement de la représentation (l'effacement de l'information pour rendre la transition triviale) ou le sous-apprentissage de la dynamique.

2. Méthodologie : Cadre SJEPA

L'auteur introduit le Symbolic JEPA (SJEPA), un cadre sans reconstruction qui décompose l'opérateur de transition latent en un hybride composé d'une loi de régissement symbolique et d'une correction neurale régularisée.

2.1 Architecture du Prédicteur Hybride

Étant donné un plongement de contexte ZCZ_C et une information latérale ϵ\epsilon (ex: action, décalage temporel), le plongement cible Z^T\hat{Z}_T est prédit par :
Z^T=FE,α(ZC,ϵ)+cϕ(ZC,ϵ) \hat{Z}_T = F_{E,\alpha}(Z_C, \epsilon) + c_\phi(Z_C, \epsilon)

  • Loi Symbolique (FE,αF_{E,\alpha}) : Une expression compacte avec une structure EE (issue d'une grammaire d'opérations arithmétiques, polynomiales, transcendantales ou de primitives spécifiques au domaine) et des coefficients α\alpha. Elle capture les dynamiques dominantes et réutilisables.
  • Correction Neurale (cϕc_\phi) : Un réseau de neurones qui corrige les effets que la grammaire symbolique sélectionnée ne peut exprimer de manière adéquate (ex: friction, interactions non résolues, erreurs d'approximation).

2.2 Compression de l'Opérateur sous Contrainte

Le principe central est la compression de l'opérateur sous contrainte. L'objectif est de minimiser la complexité de l'opérateur de transition tout en garantissant que la représentation reste informative et non effondrée.

Le problème d'optimisation est formulé comme suit :
minθ,θˉ,E,α,ϕΩ(E)+λcRcorr(ϕ) \min_{\theta, \bar{\theta}, E, \alpha, \phi} \Omega(E) + \lambda_c R_{corr}(\phi)
sous contrainte de Lpred(θ,θˉ,E,α,ϕ)δpred,(θ,θˉ)Θrepr \text{sous contrainte de } L_{pred}(\theta, \bar{\theta}, E, \alpha, \phi) \le \delta_{pred}, \quad (\theta, \bar{\theta}) \in \Theta_{repr}

  • Objectif : Minimiser la complexité symbolique Ω(E)\Omega(E) et la dépendance à la correction Rcorr(ϕ)R_{corr}(\phi).
  • Contrainte Prédictive (LpredδpredL_{pred} \le \delta_{pred}) : Empêche le sous-apprentissage ; le modèle doit être suffisamment précis.
  • Contrainte de Représentation (Θrepr\Theta_{repr}) : Empêche l'encodeur de faire s'effondrer l'état vers un vecteur constant pour trivialiser la transition. Ceci est imposé via des régularisations (ex: type VICReg de préservation de la variance) pour garantir que l'état reste informatif et non effondré.

2.3 Stratégies d'Apprentissage

Le cadre prend en charge deux modes :

  1. Apprentissage Alterné de Bout en Bout : Optimise conjointement l'encodeur (représentation) et la dynamique symbolique/neurale. Le processus alterne entre :
    • Recherche de la Dynamique : Fixer les encodeurs pour trouver la loi symbolique la plus simple pour les coordonnées actuelles.
    • Recherche de l'Espace : Fixer la structure symbolique pour mettre à jour les encodeurs afin que la représentation supporte une transition plus simple.
  2. Apprentissage avec Encodeur Gelé : Utilise un encodeur pré-entraîné (ex: ViT, DINO, I-JEPA) et apprend uniquement la loi symbolique et la correction, servant de diagnostic pour déterminer si les représentations existantes exposent des dynamiques compactes.

2.4 Extension Bayésienne

Le papier propose une formulation bayésienne où l'incertitude est placée sur la structure symbolique, les coefficients et une correction par Processus Gaussien (GP). Cela permet au modèle de conserver plusieurs explications concurrentes lorsque les données sont insuffisantes pour identifier une loi unique de manière décisive.

3. Aperçus Théoriques Clés

  • Non-identifiabilité des Coordonnées Prédictives : Les coordonnées prédictives ne sont pas uniques ; toute transformation invertible de l'espace latent préserve la précision de la prédiction. Cependant, la complexité symbolique de la loi de transition varie selon les systèmes de coordonnées. La compression de l'opérateur agit comme un biais inductif pour sélectionner les coordonnées où la transition est la plus simple.
  • Le Raccourci de l'Effondrement : Sans contraintes de représentation explicites, la minimisation de la complexité de l'opérateur crée un raccourci direct vers l'effondrement de la représentation. L'encodeur peut mapper toutes les observations vers un vecteur constant z0z_0, permettant à un prédicteur identité d'atteindre une erreur nulle avec une complexité nulle. Les contraintes de représentation sont essentielles pour prévenir cet effondrement.
  • Contrôle de l'Allocation : La décomposition entre les composantes symboliques et neurales n'est pas identifiable par la perte de prédiction seule. Une régularisation sur le terme de correction (RcorrR_{corr}) est nécessaire pour empêcher la composante neurale d'absorber des dynamiques que la grammaire symbolique pourrait représenter, garantissant ainsi que la loi symbolique conserve le mécanisme dominant.

4. Résultats Expérimentaux

L'auteur valide le cadre à l'aide d'expériences contrôlées sur un pendule.

Expérience 1 : Apprentissage Conjoint de Coordonnées et d'Équations

  • Configuration : Un système de pendule avec des observations de haute dimension et bruitées. Comparaison entre le JEPA Neural, la régression symbolique post-hoc (ajustement de symboles aux coordonnées d'un Neural JEPA gelé) et le SJEPA (apprentissage conjoint).
  • Résultats :
    • Simplicité : Le SJEPA conjoint a réduit la complexité symbolique moyenne d'un facteur ~5,6 par rapport à l'ajustement post-hoc (passant de 26,0 à 4,67).
    • Précision : Le SJEPA a obtenu une erreur de déroulement (rollout) de l'état physique et une divergence hors distribution (OOD) nettement plus faibles que la régression symbolique post-hoc, bien que le Neural JEPA flexible soit resté le plus précis en termes de prédiction brute.
    • Vérification de l'Effondrement : Un diagnostic à une étape sans contrainte (suppression des contraintes de représentation) a entraîné des plongements quasi constants et un champ de vecteurs nul, confirmant le raccourci théorique de l'effondrement.

Expérience 2 : Dynamique Hybride sous Erreur de Grammaire

  • Configuration : La dynamique réelle incluait une traînée quadratique (ppp|p|), mais la grammaire symbolique était intentionnellement restreinte pour exclure ce terme.
  • Résultats :
    • Effet de la Régularisation : Avec la régularisation de la correction, la composante symbolique a conservé les termes représentables (ex: sin(q)\sin(q)), et la correction neurale s'est concentrée sur la traînée résiduelle. Le ratio d'énergie de la correction normalisée était faible (0,06).
    • Sans Régularisation : L'hybride non régularisé a permis à la correction neurale d'absorber la dynamique représentable, réduisant les coefficients symboliques et augmentant le ratio d'énergie de la correction à 0,55.
    • Conclusion : La régularisation contrôle avec succès l'allocation, préservant le mécanisme symbolique pour les dynamiques représentables tout en utilisant la composante neurale pour les résidus.

5. Signification et Revendications

Le papier affirme que le SJEPA fournit une direction complémentaire au sein de la famille JEPA, distincte des prédicteurs neuraux standards ou de l'ajustement symbolique post-hoc.

  • Compromis Contrôlable : Le SJEPA ne prétend pas une supériorité universelle en termes de précision prédictive brute par rapport aux réseaux de neurones flexibles. Au lieu de cela, il offre un compromis contrôlable entre fidélité prédictive, qualité de la représentation, parsimonie symbolique et allocation symbolique-neurale.
  • Dynamiques Élégantes : Il démontre que la compression de l'opérateur peut sélectionner des coordonnées prédictives dont les dynamiques induites sont simples mais adéquates, à condition que les contraintes de représentation empêchent l'effondrement.
  • Interprétabilité : Les modèles résultants offrent des lois de régissement compactes et inspectables (ex: couplage de type oscillateur) qui peuvent être différenciées, linéarisées et utilisées pour la planification, contrairement aux prédicteurs neuraux opaques.
  • Modularité : Le cadre est modulaire, supportant l'apprentissage alterné, les encodeurs gelés, l'incertitude bayésienne et le contrôle conditionné par l'action.

L'auteur reste modeste, notant que les expériences sont des diagnostics contrôlés sur un système spécifique (pendule) et que la généralisation à des données visuelles de haute dimension, à des ensembles de données scientifiques du monde réel et à des tâches de contrôle complexes constitue un travail futur. La contribution principale est la formalisation de « l'apprentissage de la dynamique la plus simple et adéquate » en tant que problème d'optimisation sous contrainte équilibrant la compression de l'opérateur et l'intégrité de la représentation.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →