RepoZero: Can LLMs Generate a Code Repository from Scratch?
Este artigo apresenta o RepoZero, o primeiro benchmark para verificação totalmente automatizada e baseada em execução de LLMs que geram repositórios de software completos do zero por meio de especificações de API, juntamente com o framework Agentic Code-Test Evolution (ACE), revelando que mesmo agentes de última geração lutam para alcançar altas taxas de sucesso nessa tarefa complexa.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
A Grande Ideia: Um IA Pode Construir uma Casa a Partir de um Projeto?
Imagine que você tem um assistente robótico muito inteligente (uma IA) que é excelente em consertar uma torneira que pinga ou pintar uma única parede. Mas agora, você faz a ele uma pergunta muito mais difícil: "Você pode construir uma casa inteira do zero, usando apenas uma lista de instruções, sem olhar para os projetos originais ou para a casa pronta?"
Este artigo, RepoZero, faz exatamente essa pergunta, mas, em vez de casas, trata de repositórios de código de software (uma coleção de arquivos que compõem um programa de software).
O Problema: A Armadilha de "Fingir até Conseguir"
Anteriormente, pesquisadores tentavam testar esses robôs de IA pedindo que eles corrigissem pequenos erros ou escrevessem arquivos únicos. Mas, quando se trata de construir um programa inteiro do zero, é difícil dizer se a IA realmente entendeu como construí-lo ou se ela apenas decorou a resposta a partir de seus dados de treinamento (como um aluno que decorou as respostas do livro didático em vez de aprender a matemática).
A maioria dos testes existentes depende de humanos ou de outras IAs para ler o código e dizer: "Parece bom!". Isso é como um professor corrigir uma prova de matemática apenas lançando um olhar sobre o número final, sem verificar o trabalho. É fácil trapacear e não é muito confiável.
A Solução: O Desafio "RepoZero"
Os autores criaram um novo teste super-rigoroso chamado RepoZero. Veja como funciona, usando uma Analogia de Cozinha:
- O Prato Original (A Fonte): Imagine que um chef famoso tem uma receita secreta para um bolo complexo. Sabemos exatamente como ele tem gosto e como se comporta.
- O Desafio: Damos ao robô de IA uma lista de ingredientes e uma descrição do que o bolo deve fazer (por exemplo: "Ele deve crescer quando aquecido", "Ele deve ter gosto doce").
- O Twist (Cross-Language): O robô não tem permissão para usar a receita original. Pior ainda, ele precisa cozinhar o bolo em uma cozinha completamente diferente com ferramentas distintas.
- Se o bolo original foi feito em uma cozinha de Python, o robô deve construí-lo em uma cozinha de JavaScript.
- Se o original foi em C++, o robô deve construí-lo em Rust.
- Por quê? Isso impede que o robô apenas copie a receita. Isso força o robô a entender verdadeiramente a lógica e reconstruí-la do zero.
- O Teste de Gosto (A Verificação): O robô constrói seu próprio bolo. Em seguida, provamos ambos os bolos lado a lado. Se o bolo do robô se comportar exatamente da mesma maneira que o original (mesmo crescimento, mesmo gosto, mesma textura), ele passa. Se for ligeiramente diferente, ele falha.
A Framework "ACE": O Loop de Auto-correção do Robô
O artigo também introduz uma nova maneira para o robô aprender enquanto trabalha, chamada ACE (Agentic Code-Test Evolution).
Pense nisso como uma sessão de treino antes de uma grande partida:
- Em vez de apenas tentar construir a casa uma vez e torcer para o melhor, o robô constrói uma pequena parte e, imediatamente, testa ela.
- Se o teste falhar (por exemplo: "A porta não abre"), o robô vê o erro, conserta a porta e testa novamente.
- Ele repete esse ciclo: Construir -> Testar -> Consertar -> Construir.
- O artigo descobriu que os robôs que usavam esse "loop de treino" ficaram muito melhores em construir o produto final do que aqueles que apenas tentavam construí-lo de uma só vez.
O Que Eles Encontraram?
Os resultados foram surpreendentes e um pouco desanimadores:
- Até os Robôs "Mais Inteligentes" Têm Dificuldade: Os modelos de IA mais avançados disponíveis hoje (como Claude, DeepSeek e Kimi) conseguiram construir com sucesso a "casa" completa de software apenas cerca de 30% a 55% das vezes.
- O Abismo é Grande: Embora essas IAs sejam incríveis em escrever linhas individuais de código, elas ainda estão longe de poder construir, de forma autônoma, sistemas de software complexos e funcionais do zero.
- A Auto-verificação é Fundamental: Os robôs que usaram o loop "ACE" (testando e consertando seu próprio trabalho) tiveram desempenho significativamente melhor. Isso sugere que, para a IA se tornar um verdadeiro engenheiro de software, ela precisa ficar melhor em verificar seu próprio trabalho em vez de apenas chutar.
Resumo
RepoZero é uma nova academia rigorosa para robôs de IA. Ele os força a reconstruir software complexo em uma linguagem diferente para provar que não estão apenas trapaceando decorando respostas. O teste mostra que, embora a IA esteja ficando boa em tarefas pequenas, ainda há um longo caminho a percorrer antes que ela possa construir projetos de software inteiros de forma independente. O artigo sugere que a chave para chegar lá é ensinar a IA a testar e corrigir seus próprios erros enquanto constrói.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.