← Últimos artigos
💻 computer science

Comparing AI Coding Agents: A Task-Stratified Analysis of Pull Request Acceptance

Este estudo empírico analisa 7.156 solicitações de pull para revelar que, embora o Devin apresente uma tendência temporal positiva única na aceitação, o tipo de tarefa é o fator dominante que influencia as taxas de sucesso, com o OpenAI Codex demonstrando o desempenho alto mais consistente em diversas categorias, apesar de nenhum agente único se destacar em todos os tipos de tarefa.

Autores originais: Giovanni Pinna, Jingzhi Gong, David Williams, Federica Sarro

Publicado 2026-05-08
📖 4 min de leitura☕ Leitura rápida

Autores originais: Giovanni Pinna, Jingzhi Gong, David Williams, Federica Sarro

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é o gerente de um canteiro de obras movimentado. Em vez de trabalhadores humanos, você tem cinco robôs de IA diferentes (OpenAI Codex, GitHub Copilot, Devin, Cursor e Claude Code) que podem escrever código, corrigir bugs e redigir documentação. Seu objetivo é ver qual robô é o melhor em obter a aprovação de seus trabalhos pelos inspetores do canteiro (a "Taxa de Aceitação de Pull Request").

Este artigo é como um boletim detalhado comparando esses cinco robôs ao longo de vários meses. Aqui está o que eles descobriram, explicado de forma simples:

1. O "Tipo de Trabalho" Importa Mais Do Que o Robô

A maior surpresa não foi qual robô foi o mais rápido, mas que tipo de trabalho eles estavam fazendo.

  • A Analogia: Imagine pedir a um robô para "escrever um poema" versus "construir uma ponte". Escrever um poema geralmente é mais fácil de aprovar do que construir uma ponte.
  • A Descoberta: O artigo descobriu que o tipo de tarefa é o fator mais importante.
    • Quando os robôs foram solicitados a fazer documentação (como escrever manuais ou comentários), eles foram aprovados em 82% das vezes.
    • Quando foram solicitados a criar novos recursos (como adicionar um novo cômodo a uma casa), foram aprovados apenas 66% das vezes.
  • A Lição: Se você julgar um robô apenas pela sua pontuação geral, pode ser enganado. Um robô que faz principalmente tarefas fáceis de "escrever poemas" parecerá uma estrela, mesmo que seja terrível em "construir pontes".

2. Nenhum Robô Único Vence Todas as Categorias

Não há um "melhor robô" para tudo. Cada um tem uma superpotência específica.

  • OpenAI Codex: Este é o generalista confiável. Desempenhou-se consistentemente bem em quase todos os tipos de trabalho, nunca caindo abaixo de uma pontuação decente.
  • Claude Code: Este é o Especialista em Documentação. Foi o melhor em escrever manuais e criar novos recursos, mas devemos ter cuidado porque não realizou muitas outras tarefas neste estudo.
  • Cursor: Este é o Corretor de Bugs. Quando se tratava de consertar coisas quebradas, foi o melhor desempenho.
  • Devin: Este robô começou devagar, mas melhorou com o tempo. Foi o único que mostrou uma tendência clara de melhoria semana após semana, subindo de cerca de 60% de aprovação para 80%.

3. O Tempo Muda as Coisas (Mas Não Para Todos)

Os pesquisadores observaram esses robôs por meses para ver se eles aprendiam ou melhoravam.

  • A Analogia: Pense nisso como um aluno fazendo uma prova toda semana.
    • Devin é como o aluno que estuda muito e continua obtendo notas mais altas toda semana.
    • Os outros são como alunos que já são inteligentes; começam com notas altas e permanecem altas, mas não mostram muita melhoria ao longo do tempo. Eles apenas mantêm a consistência.

4. Por Que a "Pontuação Global" é Enganosa

O artigo alerta contra olhar para uma única "pontuação média" para um robô.

  • A Analogia: Imagine dois chefs. O Chef A cozinha apenas saladas simples (que todos adoram). O Chef B cozinha apenas ensopados complexos e apimentados (que são mais difíceis de acertar). Se você olhar apenas para a "avaliação média do cliente", o Chef A pode parecer melhor. Mas isso não significa que o Chef A seja um chef melhor; significa apenas que recebeu ingredientes mais fáceis.
  • A Descoberta: Os pesquisadores tiveram que separar os robôs pelo tipo de trabalho que realizaram para obter uma comparação justa. Assim que fizeram isso, descobriram que o robô "melhor" mudava dependendo se o trabalho era corrigir um bug, escrever um teste ou atualizar um documento.

Resumo

Se você deseja contratar um assistente de codificação de IA, não pergunte apenas: "Quem é o melhor?"

  • Se você precisa de correções de bugs, olhe para o Cursor ou o OpenAI Codex.
  • Se você precisa de novos recursos ou documentação, o Claude Code ou o OpenAI Codex podem ser sua melhor opção.
  • Se você quer um robô que pareça estar aprendendo e melhorando com o tempo, o Devin é o que vale a pena observar.

A principal conclusão é que o contexto é o rei. Você não pode julgar uma ferramenta sem saber exatamente qual trabalho está sendo solicitado a ela.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →