AI-Generated Code Is Not Reproducible (Yet): An Empirical Study of Dependency Gaps in LLM-Based Coding Agents
Este estudo empírico revela que o código gerado por agentes de LLMs (Claude Code, OpenAI Codex e Gemini) frequentemente falha na reprodutibilidade em ambientes limpos, com apenas 68,3% dos projetos executando corretamente e uma discrepância média de 13,5 vezes entre as dependências declaradas e as reais, variando significativamente conforme a linguagem de programação.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você pediu a um chef de cozinha de inteligência artificial (IA) para preparar um prato complexo, como um "Bolo de Chocolate com Frutas".
O chef entrega a receita pronta: lista os ingredientes principais (farinha, ovos, chocolate) e diz exatamente como misturá-los. Parece perfeito, certo?
Mas, quando você tenta fazer o bolo na sua cozinha, usando apenas o que o chef escreveu, o bolo não cresce. A massa fica dura ou queima. Por quê?
- O chef esqueceu de dizer que você precisa de fermento (um ingrediente que ele usou, mas não listou).
- O chef esqueceu de mencionar que o chocolate que ele usou já vem com leite em pó e cacau embutidos, e que você precisa de uma batedeira elétrica específica para funcionar.
- Em alguns casos, o próprio texto da receita estava escrito de um jeito que você não conseguia entender (erros de sintaxe).
Este é exatamente o problema que o estudo "AI-Generated Code Is Not Reproducible" descobriu.
Os pesquisadores pegaram três "chefs" de IA famosos (Claude, Gemini e o Codex da OpenAI) e pediram para eles criarem 300 projetos de software completos (como sites, aplicativos e ferramentas de dados). Depois, eles tentaram rodar esses projetos em uma "cozinha limpa" (um computador novo, sem nada instalado), usando apenas o que a IA disse que era necessário.
Aqui está o que eles descobriram, traduzido para uma linguagem simples:
1. A Ilusão da "Prontidão" (O Bolo que Não Sobe)
A grande promessa da IA é: "Peça e eu faço, pronto para usar".
- A Realidade: Apenas 68% dos projetos funcionaram de primeira, sem que ninguém precisasse mexer em nada.
- O Problema: Em quase 32% dos casos, o código falhou imediatamente. Era como se o chef tivesse entregue a receita, mas esquecido metade dos ingredientes ou escrito as instruções de forma confusa.
2. O Efeito "Iceberg" dos Ingredientes (Dependências Ocultas)
Este é o ponto mais curioso. Quando a IA diz: "Você precisa apenas de 3 pacotes para rodar este programa", ela está mentindo (sem querer).
- A Analogia: É como se a IA dissesse: "Para fazer o bolo, você só precisa de farinha". Mas, na verdade, para usar essa farinha, você precisa de um saco de plástico, de um caminhão que trouxe o trigo, de um forno que usa gás específico, etc.
- O Dado: Em média, para cada 1 pacote que a IA diz que você precisa, na verdade são instalados 13,5 pacotes no seu computador!
- Se você pede um projeto em Java, a IA diz que precisa de 2 coisas, mas o computador instala 20 coisas. É um efeito cascata gigante.
- Em Python, é um pouco melhor (cerca de 3 para 37), mas ainda é um caos oculto.
3. Nem Todos os "Chefs" São Iguais
O estudo mostrou que cada IA tem seus "talentos secretos" e suas fraquezas, dependendo da linguagem de programação:
- Gemini: É um gênio em Python (100% de sucesso, o bolo sempre sobe), mas é péssimo em Java (só 28% de sucesso). É como se ele fosse um mestre em confeitaria, mas não soubesse cozinhar carnes.
- Claude: É o mais equilibrado. Ele é muito bom em Java (onde os outros falham), mas um pouco menos perfeito em Python.
- Codex: É forte em Python, mas comete muitos erros de lógica no código em si.
4. O Verdadeiro Vilão não é só o Ingrediente Faltando
Muitas pessoas acham que o problema é apenas a IA esquecer de listar um pacote (como esquecer o fermento).
- A Descoberta: Na verdade, apenas 10% das falhas foram por falta de ingredientes.
- O Verdadeiro Problema: 52% das falhas foram porque a IA escreveu o código errado! Ela misturou os ingredientes de um jeito que não faz sentido (erros de sintaxe, caminhos de arquivos errados, variáveis que não existem). É como se o chef escrevesse "adicione 2 xícaras de sal" em vez de "açúcar".
5. Por que isso importa para você?
Se você é um cientista, um desenvolvedor ou um estudante:
- O Custo Oculto: Quando a IA entrega um código que não funciona, você perde tempo (em média 15 minutos por projeto) tentando descobrir o que deu errado. Isso transforma uma ferramenta que deveria "economizar tempo" em uma que "gasta tempo".
- A Ciência em Risco: Se um pesquisador usa uma IA para criar um experimento e o código não roda na máquina do colega, a ciência não pode ser verificada. A descoberta fica presa na "caixa preta" da IA.
Conclusão: A Lição do Dia
A IA hoje é como um assistente de digitação superinteligente, mas ainda não é um engenheiro de software completo. Ela escreve o código, mas não entende o "ecossistema" inteiro necessário para que ele funcione na vida real.
Para que a IA seja realmente útil, ela precisa aprender a não apenas escrever a receita, mas também a listar todos os ingredientes ocultos, garantir que a receita faça sentido lógico e testar se o bolo realmente cresce antes de entregar para você.
Resumo em uma frase: A IA está criando códigos que parecem completos, mas na prática, são como quebra-cabeças com peças faltando e instruções confusas, exigindo que humanos façam o trabalho pesado de consertá-los.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.