SJEPA: Learning Elegant Latent Dynamics with Hybrid Symbolic-Neural Predictors
SJEPA is een reconstructievrije joint-embedding predictieve architectuur die elegante latente dynamiek leert door symbolische wetten te combineren met geregulariseerde neurale correcties, waardoor een controleerbare afweging tussen voorspellende getrouwheid, representatiekwaliteit en symbolische spaarzaamheid wordt afgedwongen terwijl representatie-instorting wordt voorkomen door operatorcompressie.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Technische Samenvatting: SJEPA – Het leren van elegante latente dynamica met hybride symbolisch-neurale predictoren
1. Probleemformulering
Joint-embedding predictive architectures (JEPAs) leren abstracte toestanden door doel-embeddings te voorspellen vanuit context-embeddings, waarbij ze predictieve semantiek scheiden van pixel-niveau variabiliteit. Hoewel accuraat, maken deze modellen echter meestal opake neurale transitie-modellen. Ondanks hun nauwkeurigheid onthullen deze modellen niet welke variabelen interageren, hoe acties de toekomst veranderen, of of de geleerde coördinaten een beknopte dynamische beschrijving ondersteunen.
Het artikel adresseert een specifiek gat: Kan een JEPA niet alleen predictieve toestanden leren, maar ook "elegante" dynamica over die toestanden? Hier wordt "elegant" operationeel gedefinieerd als een compacte, parsimonieuze wet die adequaat blijft voor voorspelling. De uitdaging is om de eenvoudigste adequate leidende wet te vinden voor een informatieve predictieve staat zonder de representatie te laten inklappen (informatie wissen om de transitie triviaal te maken) of de dynamica te onderfitten.
2. Methodologie: SJEPA-framework
De auteur introduceert Symbolic JEPA (SJEPA), een reconstructievrij framework dat de latente transitie-operator deelt in een hybride van een symbolische leidende wet en een geregulariseerde neurale correctie.
2.1 Hybride Predictor Architectuur
Gegeven een context-embedding en zij-informatie (bijv. actie, tijdsoctet), wordt de doel-embedding voorspeld door:
- Symbolische Wet (): Een compacte expressie met structuur (afkomstig uit een grammatica van rekenkundige, polynomiale, transcendente of domeinspecifieke primitieven) en coëfficiënten . Dit vangt dominante, herbruikbare dynamica op.
- Neurale Correctie (): Een neuraal netwerk dat corrigeert voor effecten die de geselecteerde symbolische grammatica niet adequaat kan uitdrukken (bijv. wrijving, onopgeloste interacties, benaderingsfouten).
2.2 Beperkte Operatorcompressie
Het kernprincipe is beperkte operatorcompressie (constrained operator compression). Het doel is om de complexiteit van de transitie-operator te minimaliseren terwijl de representatie informatief en niet-gecollabeerd blijft.
Het optimalisatieprobleem wordt geformuleerd als:
- Doelstelling: Minimaliseer symbolische complexiteit en de afhankelijkheid van de correctie .
- Predictieve Beperking (): Voorkomt onderfitting; het model moet accuraat genoeg zijn.
- Representatie Beperking (): Voorkomt dat de encoder de staat laat inklappen naar een constante vector om de transitie triviaal te maken. Dit wordt afgedwongen via regularisaties (bijv. VICReg-stijl variantbehoud) om te garanderen dat de staat informatief en niet-gecollabeerd blijft.
2.3 Leerstrategieën
Het framework ondersteunt twee modi:
- End-to-End Alternerende Leermethode: Optimaliseert gezamenlijk de encoder (representatie) en de symbolische/neurale dynamica. Het proces wisselt af tussen:
- Dynamics Search: Het fixeren van encoders om de eenvoudigste symbolische wet voor de huidige coördinaten te vinden.
- Space Search: Het fixeren van de symbolische structuur om encoders bij te werken, zodat de representatie een eenvoudigere transitie ondersteunt.
- Frozen Encoder Learning: Gebruikt een vooraf getrainde encoder (bijv. ViT, DINO, I-JEPA) en leert alleen de symbolische wet en de correctie, wat dient als een diagnostisch instrument om te bepalen of bestaande representaties compacte dynamica blootleggen.
2.4 Bayesiaanse Uitbreiding
Het artikel stelt een Bayesiaanse formulering voor waarbij onzekerheid wordt geplaatst over de symbolische structuur, de coëfficiënten en een Gaussian Process (GP) correctie. Dit stelt het model in staat om meerdere concurrerende verklaringen te behouden wanneer data onvoldoend is om één wet besluitvaardig te identificeren.
3. Belangrijke Theoretische Inzichten
- Niet-identificeerbaarheid van Predictieve Coördinaten: Predictieve coördinaten zijn niet uniek; elke inverteerbare transformatie van de latente ruimte behoudt de voorspellingsnauwkeurigheid. Echter, de symbolische complexiteit van de transitiewet varieert over verschillende coördinatensystemen. Operatorcompressie fungeert als een inductieve bias om coördinaten te selecteren waar de transitie het eenvoudigst is.
- De Collapse Shortcut: Zonder expliciete representatiebeperkingen creëert het minimaliseren van de operatorcomplexiteit een directe shortcut naar representatie-inklapping. De encoder kan alle observaties mappen naar een constante vector , waardoor een identiteit-predictor een fout van nul bereikt met nul complexiteit. Representatiebeperkingen zijn essentieel om dit te voorkomen.
- Allocatiecontrole: De decompositie tussen de symbolische en neurale componenten is niet identificeerbaar door louter de predictiefout. Regularisatie op de correctieterm () is vereist om te voorkomen dat de neurale component dynamica absorbeert die de symbolische grammatica zou kunnen representeren, zodat de symbolische wet het dominante mechanisme behoudt.
4. Experimentele Resultaten
De auteur valideert het framework met gecontroleerde pendel-experimenten.
Experiment 1: Gezamenlijke Coördinaat- en Vergelingsleer
- Setup: Een pendelsysteem met hoogdimensionele, ruizige observaties. Vergeleken worden Neural JEPA, post-hoc symbolische regressie (het fitten van symbolen aan de frozen Neural JEPA coördinaten) en SJEPA (gezamenlijk leren).
- Bevindingen:
- Eenvoud: Gezamenlijke SJEPA verminderde de gemiddelde symbolische complexiteit met een factor ~5,6 vergeleken met post-hoc fitting (van 26,0 naar 4,67).
- Nauwkeurigheid: SJEPA bereikte aanzienlijk lagere fouten in de fysieke-toestand rollout en lagere Out-of-Distribution (OOD) divergentie dan post-hoc symbolische regressie, hoewel de flexibele Neural JEPA de meest accurate bleef in ruwe voorspelling.
- Collapse Verificatie: Een ongecontroleerde een-stap diagnostic (verwijderen van representatiebeperkingen) resulteerde in bijna constante embeddings en een nul-vectorveld, wat de theoretische collapse shortcut bevestigt.
Experiment 2: Hybride Dynamica onder Grammatica Mis-specificatie
- Setup: De ware dynamica bevatte kwadratische weerstand (), maar de symbolische grammatica werd opzettelijk beperkt door deze term uit te sluiten.
- Bevindingen:
- Regularisatie Effect: Met correctie-regularisatie behield de symbolische component de representeerbare termen (bijv. ), en de neurale correctie richtte zich op de residuele weerstand. De genormaliseerde correctie-energie ratio was laag (0,06).
- Zonder Regularisatie: De ongeregulariseerde hybride liet de neurale correctie de representeerbare dynamica absorberen, waardoor de symbolische coëfficiënten krompen en de correctie-energie ratio steeg naar 0,55.
- Conclusie: Regularisatie controleert de allocatie succesvol, waarbij het symbolische mechanisme behouden blijft voor representeerbare dynamica, terwijl de neurale component wordt gebruikt voor residuen.
5. Betekenis en Claims
Het artikel beweert dat SJEPA een complementaire richting biedt binnen de JEPA-familie, die verschilt van standaard neurale predictoren of post-hoc symbolische fitting.
- Controleerbare Trade-off: SJEPA claimt geen universele superioriteit in ruwe voorspellende nauwkeurigheid over flexibele neurale netwerken. In plaats daarvan biedt het een controleerbare afweging tussen voorspellende getrouwheid, representatiekwaliteit, symbolische parsimonie en symbolisch-neurale allocatie.
- Elegante Dynamica: Het demonstreert dat operatorcompressie coördinaten kan selecteren waarvan de geïnduceerde dynamica eenvoudig doch adequaat is, mits representatiebeperkingen de inklapping voorkomen.
- Interpretabiliteit: De resulterende modellen bieden compacte, inspecteerbare leidende wetten (bijv. oscillator-achtige cross-coupling) die gedifferentieerd, gelineariseerd en gebruikt kunnen worden voor planning, in tegenstelling tot opake neurale predictoren.
- Modulariteit: Het framework is modulair en ondersteunt alternerende leerprocessen, frozen encoders, Bayesiaanse onzekerheid en actie-geconditioneerde controle.
De auteur blijft bescheiden en merkt op dat de experimenten gecontroleerde diagnostics zijn op een specifiek systeem (pendel) en dat generalisatie naar hoogdimensionele visuele data, real-world wetenschappelijke datasets en complexe controle-taken toekomstig werk blijft. De primaire bijdrage is de formalisering van "het leren van de eenvoudigste adequate dynamica" als een geoptimaliseerd probleem onder beperkingen dat de balans zoekt tussen operatorcompressie en representatie-integriteit.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.