← Últimos artigos
🤖 AI

AI-Generated Code Is Not Reproducible (Yet): An Empirical Study of Dependency Gaps in LLM-Based Coding Agents

Este estudo empírico revela que o código gerado por agentes de LLMs (Claude Code, OpenAI Codex e Gemini) frequentemente falha na reprodutibilidade em ambientes limpos, com apenas 68,3% dos projetos executando corretamente e uma discrepância média de 13,5 vezes entre as dependências declaradas e as reais, variando significativamente conforme a linguagem de programação.

Autores originais: Bhanu Prakash Vangala, Ali Adibifar, Ashish Gehani, Tanu Malik

Publicado 2026-03-25
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Bhanu Prakash Vangala, Ali Adibifar, Ashish Gehani, Tanu Malik

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você pediu a um chef de cozinha de inteligência artificial (IA) para preparar um prato complexo, como um "Bolo de Chocolate com Frutas".

O chef entrega a receita pronta: lista os ingredientes principais (farinha, ovos, chocolate) e diz exatamente como misturá-los. Parece perfeito, certo?

Mas, quando você tenta fazer o bolo na sua cozinha, usando apenas o que o chef escreveu, o bolo não cresce. A massa fica dura ou queima. Por quê?

  1. O chef esqueceu de dizer que você precisa de fermento (um ingrediente que ele usou, mas não listou).
  2. O chef esqueceu de mencionar que o chocolate que ele usou já vem com leite em pó e cacau embutidos, e que você precisa de uma batedeira elétrica específica para funcionar.
  3. Em alguns casos, o próprio texto da receita estava escrito de um jeito que você não conseguia entender (erros de sintaxe).

Este é exatamente o problema que o estudo "AI-Generated Code Is Not Reproducible" descobriu.

Os pesquisadores pegaram três "chefs" de IA famosos (Claude, Gemini e o Codex da OpenAI) e pediram para eles criarem 300 projetos de software completos (como sites, aplicativos e ferramentas de dados). Depois, eles tentaram rodar esses projetos em uma "cozinha limpa" (um computador novo, sem nada instalado), usando apenas o que a IA disse que era necessário.

Aqui está o que eles descobriram, traduzido para uma linguagem simples:

1. A Ilusão da "Prontidão" (O Bolo que Não Sobe)

A grande promessa da IA é: "Peça e eu faço, pronto para usar".

  • A Realidade: Apenas 68% dos projetos funcionaram de primeira, sem que ninguém precisasse mexer em nada.
  • O Problema: Em quase 32% dos casos, o código falhou imediatamente. Era como se o chef tivesse entregue a receita, mas esquecido metade dos ingredientes ou escrito as instruções de forma confusa.

2. O Efeito "Iceberg" dos Ingredientes (Dependências Ocultas)

Este é o ponto mais curioso. Quando a IA diz: "Você precisa apenas de 3 pacotes para rodar este programa", ela está mentindo (sem querer).

  • A Analogia: É como se a IA dissesse: "Para fazer o bolo, você só precisa de farinha". Mas, na verdade, para usar essa farinha, você precisa de um saco de plástico, de um caminhão que trouxe o trigo, de um forno que usa gás específico, etc.
  • O Dado: Em média, para cada 1 pacote que a IA diz que você precisa, na verdade são instalados 13,5 pacotes no seu computador!
    • Se você pede um projeto em Java, a IA diz que precisa de 2 coisas, mas o computador instala 20 coisas. É um efeito cascata gigante.
    • Em Python, é um pouco melhor (cerca de 3 para 37), mas ainda é um caos oculto.

3. Nem Todos os "Chefs" São Iguais

O estudo mostrou que cada IA tem seus "talentos secretos" e suas fraquezas, dependendo da linguagem de programação:

  • Gemini: É um gênio em Python (100% de sucesso, o bolo sempre sobe), mas é péssimo em Java (só 28% de sucesso). É como se ele fosse um mestre em confeitaria, mas não soubesse cozinhar carnes.
  • Claude: É o mais equilibrado. Ele é muito bom em Java (onde os outros falham), mas um pouco menos perfeito em Python.
  • Codex: É forte em Python, mas comete muitos erros de lógica no código em si.

4. O Verdadeiro Vilão não é só o Ingrediente Faltando

Muitas pessoas acham que o problema é apenas a IA esquecer de listar um pacote (como esquecer o fermento).

  • A Descoberta: Na verdade, apenas 10% das falhas foram por falta de ingredientes.
  • O Verdadeiro Problema: 52% das falhas foram porque a IA escreveu o código errado! Ela misturou os ingredientes de um jeito que não faz sentido (erros de sintaxe, caminhos de arquivos errados, variáveis que não existem). É como se o chef escrevesse "adicione 2 xícaras de sal" em vez de "açúcar".

5. Por que isso importa para você?

Se você é um cientista, um desenvolvedor ou um estudante:

  • O Custo Oculto: Quando a IA entrega um código que não funciona, você perde tempo (em média 15 minutos por projeto) tentando descobrir o que deu errado. Isso transforma uma ferramenta que deveria "economizar tempo" em uma que "gasta tempo".
  • A Ciência em Risco: Se um pesquisador usa uma IA para criar um experimento e o código não roda na máquina do colega, a ciência não pode ser verificada. A descoberta fica presa na "caixa preta" da IA.

Conclusão: A Lição do Dia

A IA hoje é como um assistente de digitação superinteligente, mas ainda não é um engenheiro de software completo. Ela escreve o código, mas não entende o "ecossistema" inteiro necessário para que ele funcione na vida real.

Para que a IA seja realmente útil, ela precisa aprender a não apenas escrever a receita, mas também a listar todos os ingredientes ocultos, garantir que a receita faça sentido lógico e testar se o bolo realmente cresce antes de entregar para você.

Resumo em uma frase: A IA está criando códigos que parecem completos, mas na prática, são como quebra-cabeças com peças faltando e instruções confusas, exigindo que humanos façam o trabalho pesado de consertá-los.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →