← Últimos artigos
📊 statistics

Geometry-Constrained Kolmogorov-Arnold Networks: Learning Edge Geometry via Banach Duality

Este artigo introduz as Redes de Kolmogorov-Arnold com Restrição Geométrica (Banach-KANs), que substituem ativações de arestas fixas por funções aprendíveis derivadas de mapas de dualidade de Banach controladas por um expoente escalar pp, alcançando um desempenho superior ou competitivo em regressão simbólica e demonstrando maior robustez ao ruído e a amostras pequenas em comparação com as KANs tradicionais de base fixa.

Autores originais: K S Sesh Kumar

Publicado 2026-08-27
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: K S Sesh Kumar

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

No mundo das descobertas científicas, muitas leis naturais descrevem como uma quantidade muda em resposta a outra. O balanço de um pêndulo depende do seu ângulo; a velocidade de um carro depende da densidade do tráfego; o brilho de uma estrela depende da sua temperatura. Durante décadas, os cientistas usaram modelos matemáticos para capturar essas relações, mas uma abordagem mais recente surgiu, tratando o próprio modelo como uma entidade flexível e capaz de aprender. Esta abordagem, conhecida como Rede Kolmogorov–Arnold, funciona ao decompor um problema complexo em muitas partes pequenas e simples. Em vez de forçar todo o sistema a aprender uma regra única e rígida, ela constrói uma rede onde cada conexão entre dois pontos é governada por sua própria função única e aprendível. O desafio central para estas redes sempre foi decidir que forma essas funções deveriam assumir. Tradicionalmente, os pesquisadores tinham que escolher uma forma específica antecipadamente — como uma curva suave ou uma onda repetitiva — e manter o foco nela para todo o problema. Isso é um pouco como tentar consertar uma máquina quebrada usando apenas um tipo de chave de boca; funciona bem para alguns parafusos, mas falha miseravelmente em outros.

Um pesquisador do Imperial College London propôs uma maneira diferente de pensar este problema. Ele percebeu que a questão real não é a forma da função em si, mas a "geometria" subjacente ou o espaço no qual essa função vive. Na matemática, a geometria determina como as distâncias são medidas e quão aguda ou suave uma curva pode ser. O pesquisador desenvolveu um novo tipo de rede onde a geometria não é fixa antes do início do aprendizado. Em vez disso, a rede aprende a melhor geometria para cada conexão individual diretamente a partir dos dados. Ele alcançou isso introduzindo um único número ajustável para cada conexão na rede. Este número atua como um seletor que desloca o comportamento da conexão de algo agudo e de limiar para algo suave e linear, ou até mesmo plano e saturado. Ao deixar os dados decidirem onde ajustar esse seletor, a rede pode adaptar sua própria estrutura interna para corresponder às peculiaridades específicas do problema que está resolvendo.

O pesquisador testou esta ideia em cinquenta problemas matemáticos diferentes, variando de equações físicas padrão a desafios sintéticos projetados para testar o limite do sistema. Ele comparou suas novas redes adaptáveis à geometria contra modelos mais antigos que dependiam de formas fixas, como splines (que são como réguas flexíveis usadas para desenhar curvas suaves) ou polinômios. Os resultados mostraram que os modelos de forma fixa tiveram dificuldades quando os dados continham saltos repentinos ou cantos agudos, frequentemente produzindo resultados instáveis e imprecisos porque suas formas rígidas não consegravam dobrar o suficiente para se ajustar aos dados. Em contraste, as novas redes, que podiam ajustar sua própria geometria, igualaram ou superaram o desempenho de todas as linhas de base de forma fixa. Em um conjunto central de dezoito equações difíceis, o novo método alcançou o melhor ranking médio e, no conjunto completo de cinquenta, teve um desempenho tão bom quanto os métodos tradicionais mais fortes.

Talvez a descoberta mais significativa tenha sido como estas novas redes lidam com o ruído. No mundo real, as medições raramente são perfeitas; elas frequentemente contêm erros aleatórios ou "estática". Quando o pesquisador adicionou quantidades crescentes de ruído aos seus dados, os modelos tradicionais desmoronaram rapidamente. Suas taxas de erro aumentaram por um fator de vinte e um ou mais conforme o ruído aumentava. As redes adaptáveis à geometria foram muito mais robustas. Mesmo conforme o nível de ruído subia, suas taxas de erro aumentavam por um fator muito menor, frequentemente menos de quatro vezes o erro original. Isso sugere que, ao aprender a geometria correta, a rede pode ignorar a estática aleatória e focar no sinal verdadeiro, uma capacidade que os modelos de forma fixa não possuem.

O estudo também revelou que a rede não aprende apenas uma geometria única e uniforme para tudo. Em vez disso, diferentes conexões dentro da mesma rede aprenderam configurações diferentes para o seu seletor de geometria. Algumas conexões aprenderam a ser muito agudas para lidar com mudanças repentinas, enquanto outras aprenderam a ser suaves para tendências graduais. Essa especialização ocorreu consistentemente através de diferentes tipos de equações e dimensões de entrada. Por exemplo, quando o problema envolvia mais variáveis, a rede tendia a aprender geometrias mais agudas com mais frequência. Esse comportamento fornece um tipo de interpretabilidade: ao observar as configurações que a rede escolheu, os pesquisadores podem ver um sinal que reflete a estrutura subjacente do problema. A rede essencialmente nos diz: "Esta parte do problema precisa de uma borda aguda, enquanto aquela parte precisa de uma curva suave".

O pesquisador também explorou o que acontece quando há muito poucos dados disponíveis. Nestes cenários de amostra pequena, as novas redes novamente superaram os modelos de forma fixa, que tipicamente exigem grandes quantidades de dados para aprender de forma eficaz. A capacidade de adaptar a geometria permitiu que as novas redes aproximassem as respostas corretas com muito menos exemplos. No entanto, o estudo também observou limites para esta abordagem. Embora o novo método se destaque em problemas de baixa a média dimensão, ele não é um substitinte para as redes neurais profundas e massivas usadas em tarefas como reconhecimento de imagem. De fato, ao serem testados em conjuntos de dados de imagem, o novo método apenas igualou o desempenho das redes padrão se recebesse vinte a trinta vezes mais parâmetros, sugerindo que sua força reside na eficiência e adaptabilidade para tipos específicos de problemas de regressão, e não na escala bruta.

Em última análise, este trabalho desloca o foco de escolher a ferramenta certa para construir uma ferramenta que possa mudar sua própria forma. O pesquisador demonstrou que a chave para resolver problemas complexos de regressão não é a base matemática específica usada para representar os dados, mas o espaço geométrico no qual essa representação vive. Ao tornar esse espaço um parâmetro aprendível, ele criou um sistema que é mais robusto ao ruído, mais eficiente com pequenos conjuntos de dados e mais capaz de capturar a verdadeira natureza das relações que tenta modelar. As descobertas sugerem que, no futuro, os modelos mais eficazes podem não ser aqueles com as arquiteturas fixas mais complexas, mas aqueles que podem aprender a própria geometria do problema que estão resolvendo.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →