← Últimos artigos
🤖 AI

RoadmapBench: Evaluating Long-Horizon Agentic Software Development Across Version Upgrades

RoadmapBench apresenta um conjunto de avaliação com 115 tarefas complexas de codificação de longo horizonte baseadas em atualizações reais de versões de código aberto, demonstrando que os agentes de IA de ponta atuais enfrentam dificuldades significativas no desenvolvimento de software em grande escala e com múltiplos alvos, resolvendo menos de 40% das tarefas mesmo com os modelos mais avançados.

Autores originais: Xinbo Xu, Ruihan Yang, Haiyang Shen, Wendong Xu, Bofei Gao, Ruoyu Wu, Kean Shi, Weichu Xie, Xuanzhong Chen, Ming Wu, Jason Zeng, Michael Heinrich, Elvis Zhang, Liang Chen, Kuan Li, Baobao Chang

Publicado 2026-05-18
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Xinbo Xu, Ruihan Yang, Haiyang Shen, Wendong Xu, Bofei Gao, Ruoyu Wu, Kean Shi, Weichu Xie, Xuanzhong Chen, Ming Wu, Jason Zeng, Michael Heinrich, Elvis Zhang, Liang Chen, Kuan Li, Baobao Chang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está contratando uma equipe de desenvolvedores júnior superinteligentes e impulsionados por IA. Você quer saber se eles conseguem lidar com um trabalho real: não apenas corrigir um único erro de digitação em uma receita, mas reescrever completamente um livro de receitas massivo de 500 páginas, adicionando novos capítulos, alterando como os ingredientes são medidos e consertando fornos quebrados — tudo isso mantendo as receitas antigas funcionando para quem ainda usa a versão antiga.

É exatamente sobre isso que trata o artigo ROADMAPBENCH.

Aqui está a análise do artigo em termos simples:

1. O Problema: O "Erro de Digitação" vs. A "Reforma"

Por muito tempo, testamos assistentes de codificação de IA em tarefas pequenas e fáceis. É como perguntar: "Você consegue corrigir esta única frase neste parágrafo?" A IA geralmente diz: "Sim!" e tira um A+.

Mas, no mundo real, o desenvolvimento de software não trata de corrigir uma única frase. Trata-se de reformar um arranha-céu. Você precisa mudar o encanamento, a fiação elétrica e os sistemas de elevador em 50 andares diferentes, tudo ao mesmo tempo, sem que o prédio desabe.

Os autores perceberam que os testes existentes eram fáceis demais. Eram como pedir a um arquiteto que consertasse uma torneira pingando, quando o trabalho real é projetar uma nova ala para um hospital. Então, eles criaram um novo teste, muito mais difícil, chamado ROADMAPBENCH.

2. O Novo Teste: O Desafio da "Atualização de Versão"

Em vez de pedir à IA para corrigir um bug, o ROADMAPBENCH lhe entrega um roteiro.

  • A Configuração: A IA é lançada em uma oficina digital com uma versão antiga de um projeto de software real (como uma ferramenta de código aberto popular).
  • A Missão: A IA recebe um documento de "roteiro". Este documento diz: "Na próxima versão deste software, precisamos adicionar estes 5 novos recursos, alterar como estas 3 coisas funcionam e corrigir estes 2 bugs."
  • A Escala: Isso não é uma mudança pequena. Em média, a IA precisa reescrever 3.700 linhas de código em 51 arquivos diferentes. É como pedir à IA para reescrever todo o roteiro de um filme, mudar os figurinos e refilmar as cenas, tudo de uma só vez.
  • As Regras: A IA não pode espiar a "chave de respostas" (a nova versão do software). Ela precisa descobrir tudo apenas com as instruções.

3. Os Resultados: A IA Ainda é "Júnior"

Os pesquisadores testaram 13 dos modelos de IA mais inteligentes disponíveis (incluindo as versões mais recentes de empresas como Anthropic, OpenAI e Google). Eles submeteram esses modelos ao teste ROADMAPBENCH.

O resultado foi sóbrio:

  • Mesmo a IA mais inteligente (Claude-Opus-4.7) teve sucesso em apenas 39,1% das tarefas.
  • A IA mais fraca teve sucesso em apenas 5,2% das tarefas.

A Metáfora:
Se você pedisse a um desenvolvedor júnior humano para reformar uma casa e ele concluísse o trabalho corretamente apenas 4 vezes em 10, você diria: "Eles ainda estão aprendendo". O artigo mostra que mesmo nossa IA mais avançada ainda está na fase de "aprendizado" quando se trata de projetos de software complexos e de longo prazo.

4. Onde Eles Falham?

O artigo não apenas contou as falhas; ele analisou por que elas ocorreram. Eles encontraram um padrão baseado no quão "inteligente" a IA era:

  • Os Modelos Mais Fortes: Geralmente conseguiam compilar (construir) o código e escrever a maioria dos recursos. Mas falhavam nos detalhes. É como se eles construíssem uma casa perfeita, mas a maçaneta da porta estivesse do lado errado, ou o interruptor de luz não acendesse realmente a luz. Eles entendiam o quadro geral, mas perdiam a lógica minúscula e precisa.
  • Os Modelos Mais Fracos: Muitas vezes nem conseguiam construir a casa. Esqueciam de instalar o telhado, ou tentavam colocar a cozinha no porão. Falhavam no nível básico de construção.

5. Por Que Isso Importa (Segundo o Artigo)

Os autores argumentam que precisamos parar de testar a IA em "correções de erro de digitação", pois isso nos dá uma falsa sensação de segurança. Apenas porque uma IA consegue corrigir um bug não significa que ela consegue construir um novo recurso.

O ROADMAPBENCH é uma nova régua honesta. Ele nos diz que, embora a IA esteja melhorando, a capacidade de lidar com projetos de software longos, complexos e com múltiplos passos ainda é um enorme desafio não resolvido. A IA atualmente é como um aprendiz muito talentoso que consegue seguir instruções bem por alguns passos, mas fica confusa quando o projeto fica grande e complexo demais.

Resumo

  • Testes Antigos: "Você consegue corrigir esta única palavra quebrada?" (IA: Sim!)
  • ROADMAPBENCH: "Aqui está um plano para atualizar todo um sistema de software. Você consegue fazer isso?" (IA: Posso tentar, mas provavelmente vou errar nos detalhes ou esquecer um passo.)
  • Conclusão: Ainda não chegamos lá. A IA é inteligente, mas ainda não está pronta para ser a engenheira-chefe em um grande projeto de software.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →