← Últimos artigos
🤖 machine learning

SJEPA: Learning Elegant Latent Dynamics with Hybrid Symbolic-Neural Predictors

O SJEPA é uma arquitetura de incorporação conjunta livre de reconstrução que aprende dinâmicas latentes elegantes ao combinar leis simbólicas com correções neurais regularizadas, impondo assim um compromisso controlável entre fidelidade preditiva, qualidade de representação e parcimônia simbólica, enquanto evita o colapso de representação por meio de compressão de operador.

Autores originais: Yongchao Huang

Publicado 2026-08-06
📖 1 min de leitura☕ Leitura rápida

Autores originais: Yongchao Huang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

=== RESUMO ===

Resumo Técnico: SJEPA – Aprendendo Dinâmicas Latentes Elegantes com Preditores Híbridos Simbólico–Neurais

1. Formulação do Problema

Arquiteturas preditivas de incorporação conjunta (JEPAs) aprendem estados abstratos ao prever incorporações (embeddings) de destino a partir de incorporações de contexto, separando a semântica preditiva da variabilidade ao nível de pixel. No entanto, os JEPAs padrão geralmente empregam modelos de transição neurais opacos. Embora precisos, esses modelos não revelam quais variáveis interagem, como as ações alteram o futuro ou se as coordenadas aprendidas suportam uma descrição dinâmica concisa.

O artigo aborda uma lacuna específica: Pode um JEPA aprender não apenas estados preditivos, mas dinâmicas "elegantes" sobre esses estados? Aqui, "elegante" é definido operacionalmente como uma lei compacta e parcimoniosa que permanece adequada para a predição. O desafio é encontrar a lei governante mais simples e adequada para uma representação preditiva sem colapsar a representação (apagando informações para tornar a transição trivial) ou subajustar (underfitting) as dinâmicas.

2. Metodologia: Estrutura SJEPA

O autor introduz o Symbolic JEPA (SJEPA), uma estrutura livre de reconstrução que decompõe o operador de transição latente em um híbrido de uma lei governante simbólica e uma correção neural regularizada.

2.1 Arquitetura do Preditor Híbrido

Dada uma incorporação de contexto ZCZ_C e informação lateral ϵ\epsilon (ex: ação, deslocamento temporal), a incorporação de destino Z^T\hat{Z}_T é prevista por:
Z^T=FE,α(ZC,ϵ)+cϕ(ZC,ϵ) \hat{Z}_T = F_{E,\alpha}(Z_C, \epsilon) + c_\phi(Z_C, \epsilon)

  • Lei Simbólica (FE,αF_{E,\alpha}): Uma expressão compacta com estrutura EE (proveniente de uma gramática de primitivas aritméticas, polinomiais, transcendentais ou específicas do domínio) e coeficientes α\alpha. Isso captura dinâmicas dominantes e reutilizáveis.
  • Correção Neural (cϕc_\phi): Uma rede neural que corrige efeitos que a gramática simbólica selecionada não consegue expressar adequadamente (ex: fricção, interações não resolvidas, erros de aproximação).

2.2 Compressão de Operador com Restrições

O princípio central é a compressão de operador com restrições. O objetivo é minimizar a complexidade do operador de transição enquanto garante que a representação permaneça informativa e não colapsada.

O problema de otimização é formulado como:
minθ,θˉ,E,α,ϕΩ(E)+λcRcorr(ϕ) \min_{\theta, \bar{\theta}, E, \alpha, \phi} \Omega(E) + \lambda_c R_{corr}(\phi)
sujeito a Lpred(θ,θˉ,E,α,ϕ)δpred,(θ,θˉ)Θrepr \text{sujeito a } L_{pred}(\theta, \bar{\theta}, E, \alpha, \phi) \le \delta_{pred}, \quad (\theta, \bar{\theta}) \in \Theta_{repr}

  • Objetivo: Minimizar a complexidade simbólica Ω(E)\Omega(E) e a dependência da correção Rcorr(ϕ)R_{corr}(\phi).
  • Restrição Preditiva (LpredδpredL_{pred} \le \delta_{pred}): Evita o subajuste; o modelo deve ser preciso o suficiente.
  • Restrição de Representação (Θrepr\Theta_{repr}): Evita que o codificador colapse a representação para um vetor constante para trivializar a transição. Isso é imposto via regularizadores (ex: preservação de variância do tipo VICReg) para garantir que o estado permança informativo e não colapsado.

2.3 Estratégias de Aprendizado

A estrutura suporta dois modos:

  1. Aprendizado Alternado End-to-End: Otimiza conjuntamente o codificador (representação) e as dinâmicas simbólicas/neurais. O processo alterna entre:
    • Busca de Dinâmica: Fixar os codificadores para encontrar a lei simbólica mais simples para as coordenadas atuais.
    • Busca de Espaço: Fixar a estrutura simbólica para atualizar os codificadores de modo que a representação suporte uma transição mais simples.
  2. Aprendizado de Codificador Congelado: Utiliza um codificador pré-treinado (ex: ViT, DINO, I-JEPA) e aprende apenas a lei simbólica e a correção, servindo como um diagnóstico para verificar se as representações existentes expõem dinâmicas compactas.

2.4 Extensão Bayesiana

O artigo propõe uma formulação Bayesiana onde a incerteza é colocada sobre a estrutura simbólica, os coeficientes e um processo gaussiano (GP) de correção. Isso permite que o modelo retenha múltiplas explicações concorrentes quando os dados são insuficientes para identificar uma única lei de forma decisiva.

3. Insights Teóricos Chave

  • Não Identificabilidade de Coordenadas Preditivas: As coordenadas preditivas não são únicas; qualquer transformação invertível no espaço latente preserva a precisão da predição. No entanto, a complexidade simbólica da lei de transição varia entre sistemas de coordenadas. A compressão de operador atua como um viés indutivo para selecionar coordenadas onde a transição é mais simples.
  • O Atalho do Colapso: Sem restrições de representação explícitas, a minimização da complexidade do operador cria um atalho direto para o colapso da representação. O codificador pode mapear todas as observações para um vetor constante z0z_0, permitindo que um preditor de identidade atinja erro zero com complexidade zero. Restrições de representação são essenciais para evitar isso.
  • Controle de Alocação: A decomposição entre os componentes simbólicos e neurais não é identificável apenas pela perda de predição. A regularização no termo de correção (RcorrR_{corr}) é necessária para evitar que o componente neural absorva dinâmicas que a gramática simbólica poderia representar, garantindo que a lei simbólica retenha o mecanismo dominante.

4. Resultados Experimentais

O autor valida a estrutura usando experimentos controlados de pêndulo.

Experimento 1: Aprendizado Conjunto de Coordenadas e Equações

  • Configuração: Um sistema de pêndulo com observações de alta dimensão e ruído. Comparou o Neural JEPA, regressão simbólica pós-hoc (ajuste de símbolos às coordenadas do Neural JEPA congelado) e SJEPA (aprendizado conjunto).
  • Descobertas:
    • Simplicidade: O SJEPA conjunto reduziu a complexidade simbólica média por um fator de ~5,6 em comparação com o ajuste pós-hoc (de 26,0 para 4,67).
    • Precisão: O SJEPA alcançou um erro de rollout de estado físico e divergência fora da distribuição (OOD) significativamente menores do que a regressão simbólica pós-hoc, embora o Neural JEPA flexível tenha permanecido o mais preciso na predição bruta.
    • Verificação de Colapso: Um diagnóstico de passo único sem restrições (removendo restrições de representação) resultou em incorporações quase constantes e um campo vetorial nulo, confirmando o atalho teórico de colapso.

Experimento 2: Dinâmica Híbrida sob Erro de Especificação de Gramática

  • Configuração: As dinâmicas reais incluíam arrasto quadrático (ppp|p|), mas a gramática simbólica foi intencionalmente restrita para excluir este termo.
  • Descobertas:
    • Efeito de Regularização: Com a regularização da correção, o componente simbólico reteve os termos representáveis (ex: sin(q)\sin(q)), e a correção neural focou no resíduo do arrasto. A razão de energia de correção normalizada foi baixa (0,06).
    • Sem Regularização: O híbrido não regularizado permitiu que a correção neural absorvesse as dinâmicas representáveis, encolhend su os coeficientes simbólicos e aumentando a razão de energia de correção para 0,55.
    • Conclusão: A regularização controla com sucesso a alocação, preservando o mecanismo simbólico para dinâmicas representáveis enquanto utiliza o componente neural para resíduos.

5. Significância e Alegações

O artigo afirma que o SJEPA oferece uma direção complementar dentro da família JEPA, distinta dos preditores neurais padrão ou do ajuste simbólico pós-hoc.

  • Troca Controlável: O SJEPA não reivindica superioridade universal em precisão preditiva bruta sobre redes neurais flexíveis. Em vez disso, oferece uma troca controlável entre fidelidade preditiva, qualidade de representação, parcimônia simbólica e alocação simbólico-neural.
  • Dinâmicas Elegantes: Demonstra que a compressão de operador pode selecionar coordenadas preditivas cujas dinâmicas induzidas são simples, porém adequadas, desde que as restrições de representação evitem o colapso.
  • Interpretabilidade: Os modelos resultantes oferecem leis governantes compactas e inspecionáveis (ex: acoplamento oscilatório do tipo oscilador) que podem ser diferenciadas, linearizadas e usadas para planejamento, ao contrário de preditores neurais opacos.
  • Modularidade: A estrutura é modular, suportando aprendizado alternado, codificadores congelados, incerteza Bayesiana e controle condicionado por ação.

O autor mantém-se modesto, observando que os experimentos são diagnósticos controlados em um sistema específico (pêndulo) e que a generalização para dados visuais de alta dimensão, conjuntos de dados científicos do mundo real e tarefas de controle complexas permanece como um trabalho futuro. A principal contribuição é a formalização do "aprender a dinâmica mais simples e adequada" como um problema de otimização com restrições que equilibra a compressão de operador e a integridade da representação.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →