← Últimos artículos
🤖 machine learning

SJEPA: Learning Elegant Latent Dynamics with Hybrid Symbolic-Neural Predictors

SJEPA es una arquitectura de predicción de incrustación conjunta libre de reconstrucción que aprende dinámicas latentes elegantes combinando leyes simbólicas con correcciones neuronales regularizadas, imponiendo así un compromiso controlable entre la fidelidad predictiva, la calidad de la representación y la parsimonia simbólica, al tiempo que evita el colapso de la representación mediante la compresión de operadores.

Autores originales: Yongchao Huang

Publicado 2026-08-06
📖 1 min de lectura☕ Lectura para el café

Autores originales: Yongchao Huang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

=== RESUMEN ===

Resumen Técnico: SJEPA – Aprendizaje de Dinámicas Latentes Elegantes mediante Predictores Híbridos Simbólico-Neurales

1. Formulación del Problema

Las arquitecturas predictivas de incrustación conjunta (JEPAs, por sus siglas en inglés) aprenden estados abstractos prediciendo incrustaciones de objetivos a partir de incrustaciones de contexto, separando la semántica predictiva de la variabilidad a nivel de píxel. Sin embargo, los JEPAs estándar suelen emplear modelos de transición neurales opacos. Aunque son precisos, estos modelos no revelan qué variables interactúan, cómo las acciones alteran el futuro o si las coordenadas aprendidas sustentan una descripción dinámica concisa.

El artículo aborda una brecha específica: ¿Puede un JEPA aprender no solo estados predictivos, sino también dinámicas "elegantes" sobre esos estados? Aquí, "elegante" se define operativamente como una ley compacta y parsimoniosa que sigue siendo adecuada para la predicción. El desafío consiste en encontrar la ley rectora más simple y adecuada para un estado predictivo que no colapse la representación (borrando información para que la transición sea trivial) ni subajuste las dinámicas.

2. Metodología: Marco de Trabajo SJEPA

El autor introduce el JEPA Simbólico (SJEPA), un marco libre de reconstrucción que descompone el operador de transición latente en un híbrido de una ley rectora simbólica y una corrección neural regularizada.

2.1 Arquitectura del Predictor Híbrido

Dado un embedding de contexto ZCZ_C e información lateral ϵ\epsilon (por ejemplo, acción, desfase temporal), el embedding objetivo Z^T\hat{Z}_T se predice mediante:
Z^T=FE,α(ZC,ϵ)+cϕ(ZC,ϵ) \hat{Z}_T = F_{E,\alpha}(Z_C, \epsilon) + c_\phi(Z_C, \epsilon)

  • Ley Simbólica (FE,αF_{E,\alpha}): Una expresión compacta con estructura EE (proveniente de una gramática de primitivas aritméticas, polinómicas, trascendentales o específicas del dominio) y coeficientes α\alpha. Esto captura dinámicas dominantes y reutilizables.
  • Corrección Neural (cϕc_\phi): Una red neuronal que corrige los efectos que la gramática simbólica seleccionada no puede expresar adecuadamente (por ejemplo, fricción, interacciones no resueltas, errores de aproximación).

2.2 Compresión de Operadores con Restricciones

El principio central es la compresión de operadores con restricciones. El objetivo es minimizar la complejidad del operador de transición asegurando que la representación siga siendo informativa y no colapse.

El problema de optimización se formula como:
minθ,θˉ,E,α,ϕΩ(E)+λcRcorr(ϕ) \min_{\theta, \bar{\theta}, E, \alpha, \phi} \Omega(E) + \lambda_c R_{corr}(\phi)
sujeto a Lpred(θ,θˉ,E,α,ϕ)δpred,(θ,θˉ)Θrepr \text{sujeto a } L_{pred}(\theta, \bar{\theta}, E, \alpha, \phi) \le \delta_{pred}, \quad (\theta, \bar{\theta}) \in \Theta_{repr}

  • Objetivo: Minimizar la complejidad simbólica Ω(E)\Omega(E) y la dependencia de la corrección Rcorr(ϕ)R_{corr}(\phi).
  • Restricción Predictiva (LpredδpredL_{pred} \le \delta_{pred}): Evita el subajuste; el modelo debe ser lo suficientemente preciso.
  • Restricción de Representación (Θrepr\Theta_{repr}): Evita que el codificador colapse el estado a un vector constante para trivializar la transición. Esto se implementa mediante regularizadores (por ejemplo, preservación de la varianza tipo VICReg) para asegurar que el estado siga siendo informativo y no colapsado.

2.3 Estrategias de Aprendizaje

El marco soporta dos modos:

  1. Aprendizaje Alterno de Extremo a Extremo: Optimiza conjuntamente el codificador (representación) y las dinámicas simbólicas/neurales. El proceso alterna entre:
    • Búsqueda de Dinámicas: Fijar los codificadores para encontrar la ley simbólica más simple para las coordenadas actuales.
    • Búsqueda de Espacio: Fijar la estructura simbólica para actualizar los codificadores de modo que la representación soporte una transición más simple.
  2. Aprendizaje con Codificador Congelado: Utiliza un codificador preentrenado (por ejemplo, ViT, DINO, I-JEPA) y solo aprende la ley simbólica y la corrección, sirviendo como un diagnóstico de si las representaciones existentes exponen dinámicas compactas.

2.4 Extensión Bayesiana

El artículo propone una formulación Bayesiana donde se coloca la incertidumbre sobre la estructura simbólica, los coeficientes y un Proceso Gaussiano (GP) de corrección. Esto permite al modelo retener múltiples explicaciones competidoras cuando los datos son insuficientes para identificar una sola ley de manera decisiva.

3. Percepciones Teóricas Clave

  • No Identificabilidad de las Coordenadas Predictivas: Las coordenadas predictivas no son únicas; cualquier transformación invertible del espacio latente preserva la precisión de la predicción. Sin embargo, la complejidad simbólica de la ley de transición varía según el sistema de coordenadas. La compresión de operadores actúa como un sesgo inductivo para seleccionar coordenadas donde la transición es más simple.
  • El Atajo del Colapso: Sin restricciones de representación explícitas, minimizar la complejidad del operador crea un atajo directo hacia el colapso de la representación. El codificador puede mapear todas las observaciones a un vector constante z0z_0, permitiendo que un predictor de identidad logre error cero con complejidad cero. Las restricciones de representación son esenciales para prevenir esto.
  • Control de la Asignación: La descomposición entre los componentes simbólicos y neurales no es identificable solo por la pérdida de predicción. Se requiere la regularización del término de corrección (RcorrR_{corr}) para evitar que el componente neural absorba dinámicas que la gramática simbólica podría representar, asegurando que la ley simbólica retenga el mecanismo dominante.

4. Resultados Experimentales

El autor valida el marco utilizando experimentos de péndulo controlado.

Experimento 1: Aprendizaje Conjunto de Coordenadas y Ecuaciones

  • Configuración: Un sistema de péndulo con observaciones de alta dimensión y ruido. Se compararon el JEPA Neural, la regresión simbólica post-hoc (ajuste de símbolos a las coordenadas de un JEPA Neural congelado) y SJEPA (aprendizaje conjunto).
  • Hallazgos:
    • Simplicidad: El SJEPA conjunto redujo la complejidad simbólica media en un factor de ~5.6 en comparación con el ajuste post-hoc (de 26.0 a 4.67).
    • Precisión: SJEPA logró un error de despliegue de estado físico y una divergencia fuera de la distribución (OOD) significativamente menores que la regresión simbólica post-hoc, aunque el JEPA Neural flexible fue el más preciso en la predicción bruta.
    • Verificación del Colapso: Un diagnóstico de un solo paso sin restricciones (eliminando las restricciones de representación) resultó en incrustaciones casi constantes y un campo vectorial de vectores cero, confirmando el atajo de colapso teórico.

Experimento 2: Dinámicas Híbridas bajo Error de Especificación de la Gramática

  • Configuración: Las dinámicas reales incluían arrastre cuadrático (ppp|p|), pero la gramática simbólica se restringió intencionalmente para excluir este término.
  • Hallazgos:
    • Efecto de la Regularización: Con la regularización de la corrección, el componente simbólico retuvo los términos representables (por ejemplo, sin(q)\sin(q)), y la corrección neural se centró en el residuo del arrastre. La relación de energía de la corrección normalizada fue baja (0.06).
    • Sin Regularización: El híbrido no regularizado permitió que la corrección neural absorbiera las dinámicas representables, reduciendo los coeficientes simbólicos y aumentando la relación de energía de la corrección a 0.55.
    • Conclusión: La regularización controla con éxito la asignación, preservando el mecanismo simbólico para las dinámicas representables mientras utiliza el componente neural para los residuos.

5. Significancia y Reivindicaciones

El artículo afirma que SJEPA proporciona una dirección complementaria dentro de la familia JEPA, distinta de los predictores neurales estándar o el ajuste simbólico post-hoc.

  • Compromiso Controlable: SJEPA no pretende una superioridad universal en la precisión predictiva bruta sobre las redes neurales flexibles. En su lugar, ofrece un compromiso controlable entre fidelidad predictiva, calidad de representación, parsimonia simbólica y asignación simbólico-neural.
  • Dinámicas Elegantes: Demuestra que la compresión de operadores puede seleccionar coordenadas predictivas cuyas dinámicas inducidas sean simples pero adecuadas, siempre que las restricciones de representación eviten el colapso.
  • Interpretabilidad: Los modelos resultantes ofrecen leyes rectoras compactas e inspeccionables (por ejemplo, acoplamientos cruzados de tipo oscilador) que pueden diferenciarse, linealizarse y utilizarse para la planificación, a diferencia de los predictores neurales opacos.
  • Modularidad: El marco es modular, admitiendo aprendizaje alterno, codificadores congelados, incertidumbre Bayesiana y control condicionado por acción.

El autor mantiene la modestia, señalando que los experimentos son diagnósticos controlados sobre un sistema específico (péndulo) y que la generalización a datos visuales de alta dimensión, conjuntos de datos científicos del mundo real y tareas de control complejas sigue siendo un trabajo futuro. La contribución principal es la formalización de "aprender la dinámica más simple y adecuada" como un problema de optimización con restricciones que equilibra la compresión de operadores y la integridad de la representación.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →