← Últimos artigos
🤖 machine learning

Bayesian Symbolic Regression with Entropic Reinforcement Learning

Este artigo introduz o ERRLESS, um método de regressão simbólica bayesiana escalável que emprega aprendizagem por reforço com regularização de entropia para amostrar da distribuição posterior de expressões algébricas, permitendo, assim, uma quantificação de incerteza eficaz e produzindo resultados competitivos e interpretáveis em benchmarks como o Feynman.

Autores originais: Oussama Boussif, Mohammed Mahfoud, Younesse Kaddar, Moksh Jain, Sida Li, Damiano Fornasiere, Xiaoyin Chen, Yoshua Bengio, Esmeralda S. Whitammer

Publicado 2026-08-11
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Oussama Boussif, Mohammed Mahfoud, Younesse Kaddar, Moksh Jain, Sida Li, Damiano Fornasiere, Xiaoyin Chen, Yoshua Bengio, Esmeralda S. Whitammer

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é um detetive tentando resolver um mistério, mas em vez de encontrar uma pessoa desaparecida, você está tentando encontrar a regra matemática oculta que explica como o mundo funciona. Este é o trabalho da Regressão Simbólica. Enquanto as ferramentas matemáticas padrão são como um alfaiate que só consegue ajustar os botões de um terno que já existe (ajustando números em uma fórmula fixa), a regressão simbólica é como um mestre alfaiate que consegue inventar ternos inteiramente novos do zero, costurando diferentes tecidos (operações matemáticas como adição, seno ou raízes quadradas) para se ajustar perfeitamente aos dados.

No entanto, os dados do mundo real são bagunçados. Eles são ruidosos, como um sinal de rádio cheio de estática, e muitas vezes escassos, como tentar adivinhar a melodia de uma música ouvindo apenas três notas. Se você encontrar apenas uma "melhor" fórmula, pode ser enganado pela estática. É aqui que entra o pensamento Bayesiano. Em vez de apostar em uma única resposta, um detetive Bayesiano mantém toda uma biblioteca de teorias possíveis, atribuindo a cada uma uma probabilidade baseada em quão bem ela se ajusta às pistas. Isso permite que ele diga: "Estou quase certo de que é esta fórmula, mas há uma pequena chance de ser esta outra", o que é crucial quando os dados são escassos. O grande desafio sempre foi: como pesquisar eficientemente através da infinita biblioteca de fórmulas matemáticas possíveis para encontrar a mistura certa de probabilidades sem se perder?

Conheça o ERRLESS, uma nova abordagem introduzida por Oussama Boussif e colegas que trata essa busca como um videogame. Imagine um robô aprendendo a construir uma estrutura complexa de Lego, mas em vez de apenas tentar construir uma torre perfeita, ele aprende a construir muitas torres diferentes, entendendo quais delas são mais prováveis de serem a estrutura "verdadeira" dadas as pistas. Os pesquisadores chamam seu método de ERRLESS (Entropy-Regularized Reinforcement Learning for Expression Structure Sampling).

Eis como funciona no mundo real dos dados: A equipe ensinou uma rede neural (um tipo de IA) a agir como um construtor. Esse construtor não apenas adivinha; ele constrói expressões matemáticas passo a passo, como montar uma frase palavra por palavra. Mas há um detalhe: o construtor deve seguir regras estritas de física. Assim como você não pode somar "metros" a "segundos" para obter um resultado significativo, a IA é programada para rejeitar qualquer combinação matemática que quebre as leis das unidades físicas. Isso é feito usando uma abordagem "bottom-up" (de baixo para cima), onde a IA constrói pequenas peças válidas primeiro e depois as encaixa, garantindo que cada etapa faça sentido antes de prosseguir.

A IA aprende através de um processo de Aprendizado por Reforço (Reinforcement Learning), que é como treinar um cachorro com petiscos. Cada vez que a IA constrói uma fórmula que se ajusta bem aos dados, ela recebe um "petisco" (uma recompensa). Mas aqui está o toque inteligente: os pesquisadores não queriam apenas que a IA encontrasse a única melhor fórmula. Eles queriam que ela explorasse toda a "biblioteca" de possibilidades. Para fazer isso, eles usaram uma técnica chamada Aprendizado por Reforço de Entropia Máxima. Pense nisso como dizer à IA: "Não encontre apenas o melhor caminho; explore tantos caminhos diferentes quanto possível, mas certifique-se de visitar os caminhos mais promissores com mais frequência". Isso garante que a IA não fique presa em uma única ideia, mas aprenda o "mapa" completo das fórmulas prováveis.

Os resultados são bastante promissores. Ao serem testados no Feynman Symbolic Regression Database — uma famosa coleção de 100 fórmulas de física do lendário físico Richard Feynman — o ERRLESS apresentou um desempenho competitivo contra os melhores métodos existentes. Ele conseguiu encontrar fórmulas curtas e fáceis de ler que eram tão precisas quanto as fórmulas complexas encontradas por outros algoritmos. Mais importante ainda, como ele captura a incerteza (a perspectiva Bayesiana), ele lidou melhor com dados ruidosos. Em testes onde os dados eram escassos e cheios de ruído, o ERRLESS produziu uma "média preditiva posterior" (um tipo de média de todas as suas melhores suposições) que foi mais precisa do que um concorrente de destaque chamado PySIPS. Enquanto o PySIPS às vezes se confundia com suposições selvagens e improváveis que distorciam sua média, o ERRLESS manteve suas suposições fundamentadas, fornecendo uma previsão mais confiável.

O artigo também destaca que o ERRLESS é incrivelmente rápido. Diferente de outros métodos que precisam parar para ajustar finamente os números de uma fórmula repetidamente (um processo lento e computacionalmente caro), o ERRLESS aprende a adivinhar tanto a estrutura da fórmula quanto os números dentro dela de uma só vez. Isso o torna uma ordem de magnitude mais rápido do que muitos de seus rivais.

No entanto, os autores são cuidadosos ao não afirmar que isso é uma solução mágica para todos os problemas. Eles observam que, embora o ERRLESS seja excelente para modelar a distribuição de respostas possíveis, ele ainda pode ter dificuldades com expressões alvo extremamente complexas. Eles também apontam que seu método depende de um conjunto específico de operadores matemáticos e que trabalhos futuros poderiam envolver ensinar a IA a inventar seus próprios operadores ou aplicar essas ideias a equações diferenciais.

Em suma, este artigo sugere que, ao combinar as regras da física com um método de treinamento de IA inteligente e exploratório, podemos construir um sistema que não apenas encontra uma fórmula, mas entende o panorama de fórmulas possíveis. É um passo em direção a máquinas que não apenas processam números, mas que realmente compreendem a incerteza e a beleza das leis que governam o nosso universo.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →