Resumo Técnico: Descoberta de Equações Científicas Baseada em LLM via Otimização de Política com Regularização de Token Informada por Física
1. Declaração do Problema
A Regressão Simbólica (SR) visa destilar equações matemáticas interpretáveis a partir de dados observacionais, servindo como uma pedra angular para a descoberta de leis físicas. Embora abordagens recentes utilizem Grandes Modelos de Linguagem (LLMs) para gerar hipóteses de equações, capitalizando em conhecimentos científicos pré-treinados, os frameworks existentes sofrem de duas limitações críticas:
- Geração Estática: Os métodos atuais tratam os LLMs como geradores estáticos, dependendo de orientação em nível de prompt (aprendizado em contexto) para guiar a busca evolutiva. Esse paradigma falha em atualizar as representações internas do modelo com base no feedback da busca, impedindo que o modelo internalize sinais de avaliação ou adapte sua estratégia de geração para estruturas de problemas específicos.
- Busca Agnóstica à Física: Frameworks existentes frequentemente priorizam a correção sintática sobre a validade física. Sem restrições rigorosas, os LLMs frequentemente produzem equações que se ajustam aos dados numericamente, mas violam princípios físicos fundamentais (ex: homogeneidade dimensional) ou contêm estruturas matematicamente redundantes, levando ao overfitting e à inutilidade prática.
O desafio é transformar o LLM de um proponente estático em um gerador adaptativo que possa alinhar dinamicamente sua distribuição generativa com as características estruturais e físicas do sistema alvo.
2. Metodologia: PiT-PO
Os autores propõem o PiT-PO (Physics-informed Token-Regularized Policy Optimization), um framework unificado que une a exploração evolutiva impulsionada por LLM com verificação rigorosa. O framework opera através de um processo evolutivo de ciclo fechado impulsionado por dois mecanismos sinérgicos:
2.1 Evolução do LLM Durante a Busca
Ao contrário das abordagens padrão que mantêm o LLM congelado, o PiT-PO emprega a Otimização de Política Relativa de Grupo (GRPO) para atualizar os parâmetros do LLM durante a busca evolutiva.
- Mecanismo: O LLM é tratado como uma política πθ que gera sequências de tokens. O GRPO amostra um grupo de saídas, avalia-as e atualiza os parâmetros da política para maximizar uma perda substituta.
- Vantagem: Este ajuste fino "durante a busca" permite que o modelo consolide padrões simbólicos eficazes e guie a exploração subsequente de forma mais eficiente, transformando conhecimentos científicos gerais em expertise de domínio específico sobre a marcha.
2.2 Sinais de Aprendizado de Dupla Restrição
Para garantir que as equações geradas sejam cientificamente válidas e estruturalmente parcimoniosas, o PiT-PO introduz um mecanismo de dupla restrição que gera feedback refinado em nível de token.
A. Restrições Físicas Hierárquicas
Um sistema de recompensa impõe validade científica através de um filtro hierárquico:
- Restrições de Nível Geral: Penalidades para Homogeneidade Dimensional (Pdim) e Diferenciabilidade (Pdiff) para podar estruturas fisicamente impossíveis (ex: incompatibilidades de unidades).
- Restrições de Domínio Específico: O conhecimento especializado é injetado como vieses indutivos. Para modelagem de turbulência, isso inclui restrições de Realizabilidade (autovalores positivos da tensão de Reynolds), Consistência de Condição de Contorno (decaimento de tensão nas paredes), Escalonamento Assintótico (escalonamento cúbico em subcamadas viscosas) e Consistência de Energia.
- Ativação por Gatilho: As penalidades físicas são ativadas apenas após uma equação candidata atingir um limiar de precisão de ajuste basal, permitindo uma exploração "livre" nos estágios iniciais antes de impor conformidade estrita.
B. Restrições Matemáticas Guiadas por Teoremas
Para abordar a redundância matemática, os autores introduzem o Teorema de Exclusão de Suporte.
- Teoria: Este teorema fornece uma garantia teórica para identificar descobertas falsas (termos redundantes) com base na magnitude dos coeficientes ajustados em relação à interferência interna e externa de outras funções de base.
- Penalidade de Nível de Token: Se um termo é identificado como redundante (sua magnitude de coeficiente cai abaixo de um limiar derivado), uma penalidade de nível de token (Ptok) é aplicada aos tokens específicos que constituem esse termo. Esta penalidade é logarítmica, impondo penalidades mais fortes em termos com coeficientes menores.
2.3 Atualização de Política Consciente de Token
O GRPO padrão atribui uma vantagem uniforme a todos os tokens em uma sequência. O PiT-PO refina isso sintetizando a recompensa global com a penalidade de nível de token.
- Vantagem Consciente de Token (A^i,k): A vantagem para o k-ésimo token é calculada padronizando a recompensa global e subtraindo a penalidade local do token se o token pertencer a um termo redundante.
- Efeito: Isso cria um cenário de "dupla pressão" onde as recompensas globais guiam a política em direção a equações fisicamente consistentes, enquanto as penalidades locais excisam cirurgicamente termos redundantes, garantindo que a política aprenda a suprimir explicitamente estruturas teoricamente redundantes.
.4 Pipeline de Treinamento
O framework utiliza uma topologia de múltiplas ilhas para evitar a convergência prematura:
- Exploração Baseada em Ilhas: Múltiplas ilhas isoladas evoluem linhagens distintas de equações para manter a diversidade de busca.
- Evolução Durante a Busca: As trajetórias de todas as ilhas são agregadas para realizar a otimização de política usando LoRA (Low-Rank Adaptation) para eficiência.
- Seleção Hierárquica: Um mecanismo de sobrevivência do mais apto retém candidatos de alto desempenho e reinicia ilhas de baixo desempenho com sementes de alta aptidão.
3. Resultados Principais
3.1 Desempenho em Benchmarks
O PiT-PO foi avaliado no LLM-SR Suite e LLM-SRBench contra baselines de estado da arte (incluindo GPlearn, PySR, uDSR, RAG-SR e LLM-SR).
- Acurácia: O PiT-PO alcançou desempenho de estado da arte, recuperando o maior número de equações de verdade fundamental (ground-truth). No LLM-SR Suite, alcançou 100% de acurácia na Oscilação 1 e 99,99% na Oscilação 2 (usando o backbone 8B). Superou significativamente os baselines em E. coli Growth e alcançou resultados competitivos em Stress-Strain, embora não tenha superado o baseline 4o-mini neste último.
- Acurácia Simbólica: No LLM-SRBench (239 tarefas), o PiT-PO alcançou a maior Acurácia Simbólica (SA) em todas as categorias (Química, Biologia, Física, Ciência dos Materiais), demonstrando capacidade superior de recuperar a forma simbólica correta em vez de apenas ajustar numericamente.
- Eficiência: O PiT-PO demonstrou convergência mais rápida e a capacidade de escapar de regimes de estagnação onde métodos baseline (como LLM-SR) estagnaram em baixo MSE, mas com estruturas incorretas.
3.2 Empoderamento de Modelos Pequenos
Uma descoberta significativa é que o PiT-PO permite que modelos de pequena escala e código aberto rivalizem ou superem modelos grandes e de código fechado em contextos específicos.
- Usando um modelo Llama-3.2-1B quantizado, o PiT-PO alcançou desempenho competitivo ou superior ao LLM-SR usando Mixtral 8x7B e 4o-mini nas tarefas de Oscilação e E. coli Growth. No entanto, na tarefa de Stress-Strain, o modelo 1B (76,91% de acurácia) teve desempenho inferior ao baseline 4o-mini (85,33%), indicando que, embora o framework reduza significativamente a lacuna de capacidade, ele não supera universalmente todos os gigantes proprietários em cada métrica.
- Isso sugere que a otimização de política durante a busca melhora efetivamente modelos menores, democratizando o acesso a ferramentas de descoberta científica de alto desempenho em hardware de consumo, particularmente para tarefas onde a descoberta estrutural é primordial.
3.3 Aplicação no Mundo Real: Modelagem de Turbulência
O framework foi aplicado para descobrir relações constitutivas não lineares para a anisotropia da tensão de Reynolds em Fluxo sobre Colinas Periódicas.
- Desempenho: O modelo descoberto melhorou as abordagens RANS tradicionais (especificamente o modelo k−ω SST) ao produzir tensões de Reynolds anisotrópicas mais próximas das referências de Simulação Numérica Direta (DNS).
- Fidelidade Física: O modelo aprendido mostrou maior consistência física, reduzindo extremos não físicos e fornecendo previsões mais precisas de bolhas de separação de fluxo e coeficientes de fricção de pele comparado ao RANS padrão e outros métodos de SR.
3.4 Estudos de Ablação
Estudos de ablação confirmaram a necessidade de ambos os componentes:
- Remover as restrições físicas (sem Phy) levou a uma deterioração substancial no NMSE e na generalização.
- Remover a regularização de token (sem TokenReg) resultou na persistência de termos redundantes e em uma maior lacuna de generalização entre dados de Distribuição Interna (ID) e Fora de Distribuição (OOD).
4. Significância e Alegações
O artigo afirma que o PiT-PO altera fundamentalmente o papel dos LLMs na descoberta científica de proponentes estáticos para geradores adaptativos e conscientes da física.
- Consistência Científica: Ao integrar restrições físicas hierárquicas e regularização de token guiada por teoremas, o PiT-PO alinha a geração com o ajuste numérico, consistência científica e parcimônia simultaneamente.
- Democratização: A capacidade do PiT-PO de empoderar modelos pequenos (ex: 1 bilhão de parâmetros) para rivalizar com gigantes de código fechado em tarefas chave de descoberta estabelece uma metodologia prática para a descoberta científica automatizada que não depende de recursos massivos de computação ou APIs proprietárias, embora o desempenho varie conforme a complexidade da tarefa.
- Utilidade Prática: A aplicação bem-sucedida à modelagem de turbulência demonstra que as correções simbólicas descobertas possuem valor tangível em fluxos de trabalho de engenharia do mundo real, melhorando as previsões de campo de fluxo além do que é possível com modelos lineares padrão.
Os autores concluem que esta abordagem estabelece um novo estado da arte para benchmarks de SR e oferece um caminho robusto para integrar o conhecimento físico de domínio específico na dinâmica de aprendizado de LLMs.