← Últimos artigos
🤖 AI

What Do Evolutionary Coding Agents Evolve?

Este artigo apresenta o EvoTrace, um conjunto de dados de traços de codificação evolutiva, e o EvoReplay, uma metodologia baseada em replay, para revelar que os ganhos de desempenho em agentes de codificação evolutiva frequentemente derivam de mecanismos diversos, como o reajuste ou a reutilização de conhecimento existente, em vez de inovação algorítmica genuína, evidenciados pelo ciclo determinístico frequente de linhas de código.

Autores originais: Nico Pelleriti, Sree Harsha Nelaturu, Zhanke Zhou, Zongze Li, Max Zimmer, Bo Han, Sebastian Pokutta

Publicado 2026-05-20
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Nico Pelleriti, Sree Harsha Nelaturu, Zhanke Zhou, Zongze Li, Max Zimmer, Bo Han, Sebastian Pokutta

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine uma equipe de programadores de IA tentando resolver um quebra-cabeça complexo, como projetar uma nova maneira de empacotar círculos em uma caixa ou escrever um motor de videogame mais rápido. Em vez de uma pessoa trabalhando sozinha, eles usam um sistema chamado Codificação Evolutiva.

Veja como funciona: a IA gera um trecho de código, testa-o e vê quão bem ele pontua. Em seguida, faz pequenas alterações (mutações) nesse código, testa a nova versão e mantém aquelas que se saem melhor. Repete isso milhares de vezes, "evoluindo" o código ao longo do tempo, muito como a natureza evolui animais.

Por um tempo, todos assumiram que esses agentes de IA estavam descobrindo maneiras brilhantes e totalmente novas de pensar para resolver problemas. Mas este artigo faz uma pergunta simples e cética: "O que eles estão realmente evoluindo?"

Para responder a isso, os pesquisadores construíram um enorme "gravador de caixa preta" chamado EvoTrace. Pense nele como uma caixa preta de voo para esses experimentos de IA. Ele não registra apenas a pontuação final; registra cada passo individual, cada linha de código adicionada ou excluída, cada prompt que a IA viu e cada erro que cometeu. Eles também criaram uma ferramenta chamada EvoReplay, que permite pausar o experimento, rebobiná-lo e perguntar: "E se mudássemos apenas uma coisa?"

Aqui estão as quatro principais descobertas, explicadas com analogias do cotidiano:

1. O "Ajustador" vs. O "Arquiteto"

Quando a IA obtém uma pontuação melhor, o que realmente mudou?

  • A Realidade: Na maioria das vezes, a IA não está inventando uma nova estratégia. Ela está apenas ajustando os botões.
  • A Analogia: Imagine que você tem um rádio. A IA passa 90% do tempo aumentando e diminuindo o volume, ou ajustando ligeiramente o dial de sintonia (mudando um número de 1,85 para 1,90). Raramente decide construir um rádio completamente novo do zero.
  • A Descoberta: As mudanças que realmente levam a grandes saltos na pontuação (como adicionar uma nova biblioteca ou reescrever completamente uma seção de código) são raras. A IA gasta a maior parte de sua energia em ajustes minúsculos e chatos.

2. O "Jardineiro Esquecido" (Ciclagem)

Esta foi a descoberta mais surpreendente.

  • A Realidade: A IA continua apagando linhas de código, apenas para adicioná-las de volta alguns passos depois.
  • A Analogia: Imagine um jardineiro que arranca um mato, vai embora e volta cinco minutos depois para plantar exatamente o mesmo mato no mesmo lugar. Ele faz isso repetidamente.
  • A Descoberta: Cerca de 30% do novo código que a IA adiciona é, na verdade, código que ela havia excluído anteriormente. É como se a IA tivesse uma memória curta, esquecendo o que acabou de descartar e desperdiçando tempo "re-evoluindo" as mesmas ideias. Isso acontece em quase todas as execuções, independentemente do modelo de IA utilizado.

3. O "Fantasma na Máquina" (Reprodutibilidade)

Se você pedir à IA para resolver o problema novamente usando exatamente as mesmas instruções, ela obterá o mesmo resultado?

  • A Realidade: Não.
  • A Analogia: Imagine um chef que prepara uma sopa perfeita. Se você pedir a ele para fazê-la novamente usando exatamente a mesma receita e os mesmos ingredientes, ele fará uma sopa diferente. Ela não parecerá a mesma, e os ingredientes podem estar em uma ordem diferente.
  • A Descoberta: No entanto, embora o código pareça diferente, a sopa tem o mesmo sabor. A IA pode reproduzir a pontuação alta usando um trecho de código completamente diferente. Isso significa que a "pontuação" é real, mas a solução específica é apenas um sorteio afortunado de um chapéu, não uma obra-prima única.

4. O "Sintonizador Simples" (A Lacuna de Sintonização)

Quanto do sucesso da IA é realmente apenas encontrar os números certos, em vez de encontrar um novo algoritmo?

  • A Realidade: Uma grande parte da melhoria vem de uma sintonização matemática simples.
  • A Analogia: Imagine uma corrida de carros. A IA passa semanas construindo um novo motor sofisticado (a estrutura). Mas os pesquisadores descobriram que, se apenas pegassem um motor mediano e passassem algumas horas ajustando a mistura de combustível e a pressão dos pneus (os hiperparâmetros), poderiam obter quase a mesma velocidade.
  • A Descoberta: Em muitas tarefas matemáticas, um simples programa de computador que apenas ajusta os números de uma solução "mediana" pode igualar ou até superar a pontuação final da busca evolutiva complexa. A IA não necessariamente descobriu uma nova maneira de resolver o problema; ela apenas encontrou as configurações perfeitas para uma maneira antiga.

O Quadro Geral

O artigo conclui que, quando vemos esses agentes de IA obtendo melhores pontuações, não devemos assumir automaticamente que eles estão "descobrindo nova ciência".

Muitas vezes, eles estão apenas:

  1. Ajustando números (Ajuste de hiperparâmetros).
  2. Esquecendo e lembrando o mesmo código (Ciclagem).
  3. Sobreajustando ao teste (memorizando as respostas do teste em vez de aprender a lição).

Os autores argumentam que, para entender verdadeiramente se esses agentes são inteligentes, precisamos olhar para a jornada (o rastro), e não apenas para o destino (a pontuação final). Precisamos saber se eles estão construindo uma nova casa ou apenas rearranjando os móveis na antiga.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →