← Últimos artigos
🤖 machine learning

Evolving Executable Pipeline Programs for AutoML with Language Models

LACE é um novo framework de AutoML que emprega um loop evolutivo guiado por um grande modelo de linguagem para gerar e evoluir programas de pipeline Python executáveis, alcançando uma precisão competitiva em 68 tarefas do OpenML ao mesmo tempo em que oferece transparência, editabilidade e flexibilidade de espaço de busca superiores em comparação aos sistemas tradicionais.

Autores originais: Sofoklis Kitharidis, Cor J. Veenman, Jan N. van Rijn, Thomas Bäck, Niki van Stein

Publicado 2026-08-18
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Sofoklis Kitharidis, Cor J. Veenman, Jan N. van Rijn, Thomas Bäck, Niki van Stein

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

No mundo da ciência de dados moderna, as máquinas são cada vez mais solicitadas a dar sentido a informações desordenadas do mundo real: prever se um solicitante de empréstimo irá pagar, diagnosticar uma doença a partir de uma planilha de sintomas ou prever vendas com base em tendências passadas. Para fazer isso, pesquisadores constroem "pipelines", que são instruções passo a passo que limpam os dados, escolhem um modelo matemático e ajustam esse modelo até que ele tenha um bom desempenho. Durante anos, as ferramentas mais poderosas para este trabalho foram sistemas automatizados que atuam como um mestre cuca com um conjunto fixo de ingredientes. Esses sistemas podem misturar e combinar etapas de pré-processamento conhecidas e algoritmos de aprendizado, ajustando as quantidades para encontrar o melhor sabor. No entanto, eles são estritamente limitados à despensa que lhes foi dada; eles não podem inventar um novo ingrediente ou uma nova técnica de cozimento que esteja fora de sua lista predefinida. Essa limitação significa que, se a melhor solução exigir uma estrutura que o sistema nunca viu antes, ela permanecerá undiscoberta.

Uma equipe de pesquisadores da Universidade de Leiden introduziu agora uma abordagem diferente, uma que trata a criação desses pipelines de dados não como uma seleção de um menu, mas como a escrita de uma nova receita do zero. Eles desenvolveram um sistema chamado LACE, que utiliza um grande modelo de linguagem — uma inteligência artificial treinada em vastas quantidades de texto e código — para atuar como um motor evolutivo. Em vez de escolher de uma lista fixa de ferramentas, o LACE pede à IA que escreva programas de computador completos e executáveis que definam como processar dados e fazer previsões. O sistema então testa esses programas, aprende com seus erros e pede à IA que escreva versões melhoradas, repetindo esse ciclo até encontrar uma solução altamente eficaz. O resultado é um sistema que não apenas ajusta ferramentas existentes, mas pode compor estruturas inteiramente novas, produzindo código que especialistas humanos podem ler, entender e modificar diretamente.

Os pesquisadores testaram este método em 68 diferentes tarefas de classificação de dados, variando de pequenos conjuntos de dados com algumas centenas de entradas a coleções massivas com quase cinco milhões de linhas. Eles compararam o LACE contra vários sistemas automatizados estabelecidos e um conjunto de modelos pré-treinados fixos. Os resultados mostraram que o LACE, quando impulsionado por um modelo de linguagem específico, teve um desempenho tão bom quanto os sistemas automatizados mais fortes existentes e significativamente melhor do que métodos mais antigos. Crucialmente, embora alguns dos novos modelos pré-treinados fossem ligeiramente mais precisos nas tarefas específicas que conseguiam lidar, eles falharam em funcionar em muitos dos conjuntos de dados maiores ou mais complexos do conjunto de testes. O LACE, por outro contraste, gerou com sucesso uma solução funcional para cada tarefa que lhe foi dada.

O que torna essa conquista particularmente notável é a natureza do output. Os sistemas automatizados tradicionais frequentemente retornam uma "caixa preta" — um objeto complexo e ajustado que funciona bem, mas é difícil para um humano inspecionar ou alterar sem um conhecimento técnico profundo da estrutura de software. O LACE retorna código Python comum. Isso significa que um cientista de dados pode olhar para o programa final, ver exatamente como os dados foram limpos, quais modelos foram escolhidos e como eles foram combinados, e então editar o código para melhorá-lo ainda mais ou adaptá-lo para um novo propósito. Os pesquisadores descobriram que a IA não apenas copiou padrões existentes; ela evoluiu soluções diversas, frequentemente combinando diferentes tipos de modelos de maneiras inovadoras e escrevendo lógica personalizada para misturar suas previsões. Em muitos casos, a IA escreveu seu próprio código para misturar as saídas de múltiplos modelos, um nível de flexibilidade que sistemas fixos não conseguem replicar facilmente.

O estudo também abordou uma preocupação comum na pesquisa de inteligência artificial: a de que a IA poderia estar simplesmente memorizando as respostas das perguntas do teste porque já as viu durante seu treinamento. Para evitar isso, os pesquisadores esconderam os nomes e detalhes específicos dos conjuntos de dados, dando à IA apenas uma descrição geral do tamanho e tipo dos dados. Apesar dessa falta de conhecimento específico, o sistema ainda encontrou soluções de alto desempenho, sugerindo que estava genuinamente aprendendo como construir pipelines eficazes, em vez de apenas recordar respostas. Os pesquisadores verificaram ainda que a IA seguiu regras estritas, como não usar buscas internas ocultas para ajustar suas próprias configurações, garantindo que as melhorias viessem do próprio processo de busca evolutiva.

Uma das descobertas mais impressionantes foi a rapidez com que o sistema melhorou. O primeiro programa gerado pela IA era frequentemente falho ou incompleto, mas conforme o sistema iterava, ele aprendia a corrigir esses erros e refinar a lógica. Quando o processo terminava, os programas finais não eram apenas válidos, mas significativamente mais precisos do que as tentativas iniciais. Os pesquisadores observaram que o sistema tendia a favorecer certos tipos de modelos, como ensembles baseados em árvores, mas não ficava preso em um único padrão; ele explorava uma ampla variedade de combinações estruturais. Essa diversidade sugere que o sistema é capaz de descobrir soluções que um humano poderia não pensar em tentar, ou que um sistema rígido jamais consideraria.

O trabalho demonstra que tratar o aprendizado de máquina automatizado como um processo de escrita e evolução de código abre uma nova fronteira. Ele vai além da restrição de uma biblioteca fixa de ferramentas, permitindo que o sistema adapte sua estrutura ao problema específico em questão. Embora o custo computacional de executar esses experimentos tenha sido alto, exigindo um tempo significativo para gerar e testar milhares de programas candidatos, os resultados sugerem que a capacidade de produzir código transparente, editável e altamente eficaz é uma troca valiosa. Os pesquisadores concluem que esta abordagem oferece um caminho promissor, onde a busca pelo melhor pipeline de dados é definida pela criatividade do próprio código, em vez pelas limitações de um conjunto pré-selecionado de componentes.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →