← Últimos artigos
🤖 AI

Algorithm Discovery With LLMs: Evolutionary Search Meets Reinforcement Learning

Este artigo propõe uma estrutura inovadora que aprimora a busca evolutiva baseada em LLM para descoberta de algoritmos, refinando continuamente o operador de busca do LLM por meio de ajuste fino com aprendizado por reforço, acelerando assim a identificação de soluções superiores em tarefas de otimização combinatória.

Autores originais: Anja Surina, Amin Mansouri, Lars Quaedvlieg, Amal Seddas, Maryna Viazovska, Emmanuel Abbe, Caglar Gulcehre

Publicado 2026-05-26
📖 4 min de leitura☕ Leitura rápida

Autores originais: Anja Surina, Amin Mansouri, Lars Quaedvlieg, Amal Seddas, Maryna Viazovska, Emmanuel Abbe, Caglar Gulcehre

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando inventar uma nova receita super eficiente para assar o bolo perfeito. Você tem um chef muito talentoso (o Modelo de Linguagem de Grande Escala, ou LLM) que pode escrever receitas.

O Jeito Antigo: O "Chef Estático"
Nos métodos anteriores (como o chamado "FunSearch"), você pediria ao chef para escrever uma receita. Você a assaria, provaria e veria se é boa. Se estiver aceitável, você a mantém. Se for excelente, você pede ao chef para olhar aquela receita excelente e tentar escrever uma ligeiramente melhor com base nela. Você repete isso milhares de vezes.

O problema? O chef nunca realmente aprende com o processo. Ele é como um gênio que esquece tudo após cada tentativa. Ele continua adivinhando com base em seu treinamento original, esperando tropeçar em uma receita melhor pela pura sorte. Ele não atualiza seu conhecimento interno sobre o que faz um bolo bom.

O Jeito Novo: "EvoTune" (O Chef que Aprende)
Os autores deste artigo propõem um novo método chamado EvoTune. É como contratar aquele mesmo chef talentoso, mas desta vez, você lhe dá um ciclo de treinamento especial:

  1. O Teste de Prova (Busca Evolutiva): Assim como antes, o chef escreve muitas receitas. Você as assa, prova e as pontua. Você mantém as melhores e descarta as ruins.
  2. A Lição (Aprendizado por Reforço): Este é o passo mágico. Em vez de apenas descartar as receitas ruins, você mostra ao chef os "vencedores" e os "perdedores" e diz: "Olhe a diferença! O vencedor fez isso, o perdedor fez aquilo."
  3. A Atualização: Você então dá ao chef um rápido "curso de reciclagem" (ajuste fino) baseado nessas lições. O cérebro do chef realmente muda para entender por que a receita vencedora funcionou.
  4. Repetir: Agora, quando você pede ao chef para escrever o próximo lote de receitas, ele não está apenas adivinhando mais. Ele está usando seu conhecimento recém-atualizado para mirar nos pontos bons muito mais rápido.

Por que isso é melhor?
Pense nisso como procurar um tesouro escondido em uma floresta gigante.

  • O Jeito Antigo: Você envia um batedor que tem um mapa, mas nenhuma memória. Eles vagueiam, encontram um local, verificam se há tesouro e depois esquecem tudo. Eles têm que vaguear aleatoriamente novamente para encontrar o próximo local.
  • EvoTune: O batedor encontra um local, percebe "Oh, as árvores aqui são mais densas, então o tesouro provavelmente está por perto" e atualiza seu mapa interno. Da próxima vez que saírem, eles não vagueiam aleatoriamente; caminham diretamente em direção às áreas promissoras.

O que eles testaram?
Os pesquisadores testaram isso em três difíceis "jogos de quebra-cabeça" onde computadores precisam encontrar a melhor maneira de organizar coisas:

  1. Empacotamento em Binários (Bin Packing): Tentar encaixar caixas de tamanhos diferentes no menor número possível de caminhões.
  2. Vendedor Viajante: Encontrar a rota mais curta para visitar uma lista de cidades sem repetir passos.
  3. Flatpack: Encaixar blocos de formato estranho em uma grade sem que eles se sobreponham (como um Tetris complexo).

Os Resultados
Eles descobriram que o "chef que aprende" (EvoTune) encontrou soluções melhores muito mais rápido do que o "chef estático" (o método antigo).

  • Melhores Pontuações: As receitas (algoritmos) encontradas pelo EvoTune foram mais eficientes.
  • Mais Variedade: O chef que aprende não encontrou apenas uma boa receita e parou; ele encontrou uma variedade mais ampla de soluções únicas e de alta qualidade.
  • Vitórias no Mundo Real: Em um desafio específico (competição Hash Code do Google sobre colocar servidores em um data center), o EvoTune encontrou uma solução que foi realmente melhor do que a melhor solução encontrada por equipes humanas na competição.

O Segredo
O artigo também menciona um truque específico que usaram para manter o chef criativo. Às vezes, quando você ensina muito a um modelo, ele fica "preso" e só escreve a mesma coisa repetidamente. Para evitar isso, eles usaram uma regra matemática especial (chamada "KL Direta" ou "Forward KL") que força o chef a continuar explorando novas ideias enquanto ainda aprende com os vencedores.

Em Resumo
O EvoTune é um sistema que combina busca (tentar muitas coisas) com aprendizado (atualizar o cérebro da IA com base no que funcionou). Ele transforma uma ferramenta estática em um parceiro de autoaperfeiçoamento que fica mais inteligente quanto mais tenta resolver um problema.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →