← Últimos artigos
🤖 machine learning

TopoFE: topology-aware LLM-guided Automated Feature Engineering

TOPOFE é um framework evolutivo de múltiplas ilhas consciente de topologia que aprimora a engenharia de atributos automatizada guiada por LLM ao integrar exploração especializada por família, memória de prompt adaptativa e transferência de conhecimento guiada por topologia para superar as limitações de geração sem estado e busca homogênea, descobrindo, assim, programas de atributos diversos e de alto desempenho em 29 conjuntos de dados tabulares.

Autores originais: Sha Li, Naren Ramakrishnan

Publicado 2026-07-28
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Sha Li, Naren Ramakrishnan

Artigo original dedicado ao domínio público sob CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você esteja tentando ensinar um computador a tomar decisões inteligentes, como prever se um solicitante de empréstimo pagará o dinheiro de volta ou se um paciente tem uma doença específica. O computador não começa com as respostas; ele precisa olhar para uma planilha de dados brutos — números, categorias e datas — e descobrir quais padrões importam. Esse processo é chamado de aprendizado de máquina (machine learning). Mas aqui está a parte difícil: os dados brutos são frequentemente bagunçados e difíceis de entender. Assim como um chef não pode fazer uma ótima sopa apenas com vegetais crus e não picados, um computador muitas vezes não consegue encontrar os melhores padrões a menos que os dados sejam transformados primeiro. Essa etapa de transformação é chamada de engenharia de atributos (feature engineering). É a arte de pegar números brutos e misturá-los para criar novas pistas mais inteligentes que ajudem o computador a enxergar a verdade. Por muito tempo, os humanos tiveram que fazer isso manualmente, adivinhando quais combinações de números poderiam ser úteis. Recentemente, começamos a usar programas de computador superinteligentes chamados Modelos de Linguagem de Grande Escala (LLMs) para ajudar. Pense nesses LLMs como assistentes brilhantes e bem informados que sabem muito sobre matemática e ciência e podem sugerir novas maneiras de misturar os dados. No entanto, mesmo esses assistentes brilhantes têm um problema: às vezes eles ficam presos em um ciclo, sugerindo os mesmos tipos de misturas repetidamente, ou esquecem o que tentaram antes, desperdiçando tempo em becos sem saída.

É aqui que entra um novo framework chamado TOPOFE. Os pesquisadores Sha Li e Naren Ramakrishnan, da Virginia Tech, perceberam que o espaço de possíveis misturas de dados é tão vasto e variado que uma única estratégia de busca uniforme não é suficiente. Eles propuseram um sistema que trata a busca pelos melhores pistas de dados como uma equipe de exploradores especializados trabalhando em diferentes territórios, em vez de uma única multidão gigante.

Em vez de ter um grande grupo de programas de computador todos tentando resolver o problema ao mesmo tempo, o TOPOFE divide o trabalho em cinco "ilhas" distintas. Cada ilha é uma equipe de especialistas focada em um tipo específico de truque matemático. Uma ilha foca apenas em aritmética simples, como adição ou multiplicação de números. Outra foca em estatística, como médias e contagens. Uma terceira observa padrões temporais, como a mudança nas vendas ao longo da última semana. Outra lida com relacionamentos entre diferentes grupos, e a última lida com formas curvas e não lineares. Ao manter esses especialistas separados, o sistema garante que nenhum tipo de truque matemático domine e bloqueie a descoberta dos outros.

Mas a verdadeira magia acontece quando essas ilhas conversam entre si. Em sistemas antigos, se uma equipe ficasse travada, ela poderia simplesmente trocar ideias aleatoriamente com outra equipe, o que muitas vezes não ajudava. O TOPOFE é mais inteligente. Ele utiliza um "grafo de topologia", que é como um mapa dinâmico que aprende quais equipes são melhores em ajudar umas às outras. Se a ilha do "Tempo" ficar travada, o sistema verifica seu mapa e vê que a ilha da "Aritmética" tem as melhores ideias para ajudá-la. Ele então aciona um evento especial onde as duas equipes combinam suas melhores ideias para criar algo totalmente novo — um atributo "híbrido" que nenhuma das duas equipes teria inventado sozinha. Por exemplo, pode combinar uma média baseada no tempo com uma operação de divisão para criar uma nova pista altamente preditiva.

O sistema também possui uma "memória" que aprende com seus próprios erros. Se um certo tipo de truque matemático continua falhando em um conjunto de dados específico, o sistema lembra disso e para de sugerir esse truque, enquanto reforça os truques que estão funcionando. Isso acontece sem a necessidade de retreinar o cérebro principal do computador, tornando a busca incrivelmente eficiente.

Os pesquisadores testaram essa ideia em 29 conjuntos de dados do mundo real, variando desde a previsão de doenças cardíacas até a previsão de aluguel de bicicletas. Eles descobriram que o TOPOFE consistentemente superou os melhores métodos existentes. Ele não apenas encontrou respostas melhores; ele encontrou respostas mais diversas. Enquanto outros métodos frequentemente terminavam com um amontoado de pistas muito semelhantes (redundância), as ilhas especializadas e o trabalho em equipe inteligente do TOPOFE produziram um conjunto de pistas que cobriam mais terreno e funcionavam bem com diferentes tipos de modelos de previsão. O estudo sugere que, ao organizar a busca em grupos especializados e comunicativos e permitir que aprendam quando trocar ideias, podemos desbloquear maneiras muito mais poderosas de ensinar computadores a entender nossos dados. Os resultados mostram que essa abordagem é robusta, funcionando bem mesmo quando o "cérebro" subjacente do computador muda, provando que o ingrediente secreto está na estrutura da busca em si, e não apenas na inteligência do modelo.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →