← Últimos artigos
🤖 AI

Can Vibe Coding Beat Graduate CS Students? An LLM vs. Human Coding Tournament on Market-driven Strategic Planning

Este artigo apresenta um benchmark baseado em torneios avaliando Grandes Modelos de Linguagem contra estudantes de pós-graduação em um problema logístico complexo e orientado pelo mercado, revelando que agentes codificados por humanos superam significativamente as soluções geradas por LLMs, com a maioria dos agentes de LLM falhando em ultrapassar baselines simples e até mesmo degradando estratégias humanas ótimas quando instados a melhorá-las.

Autores originais: Panayiotis Danassis, Naman Goel

Publicado 2026-06-05
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Panayiotis Danassis, Naman Goel

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Grande Pergunta: O "Vibe Coding" Pode Vencer um Estudante de Pós-Graduação?

Imagine que você tem um assistente robô superinteligente (um Grande Modelo de Linguagem, ou LLM) que pode escrever código apenas com você falando com ele. Você diz: "Construa um aplicativo de entregas", e ele digita o código em segundos. Isso é chamado de "Vibe Coding".

A grande pergunta que este artigo faz é: Este robô é realmente inteligente o suficiente para resolver problemas de negócios reais, complexos e de alto risco, ou ele é apenas bom em escrever códigos que parecem corretos, mas falham quando as coisas ficam complicadas?

Para descobrir, os pesquisadores organizaram um torneio de programação gigante.

A Arena: O Jogo de "Leilão, Coleta e Entrega"

Em vez de pedir aos robôs para resolverem problemas matemáticos simples (como "quanto é 2+2?"), eles os colocaram em uma simulação complexa chamada Problema de Leilão, Coleta e Entrega (APDP).

Pense nisso como um jogo de Xadrez Logístico de alto nível:

  1. O Leilão: Diversas empresas (agentes) estão dando lances em trabalhos de entrega. Os trabalhos são vendidos um por um. Você precisa adivinhar quanto deve oferecer. Se você der um lance muito alto, perde dinheiro. Se der um lance muito baixo, pode ganhar o trabalho, mas ter prejuízo na entrega. Você precisa adivinhar o que seus concorrentes farão.
  2. O Planejamento: Uma vez que você ganha um trabalho, precisa decidir a melhor rota para seus caminhões coletarem e entregarem as encomendas. Você tem espaço limitado nos caminhões e não pode quebrar as regras.
  3. O Objetivo: O vencedor é a empresa que obtém o maior lucro (Dinheiro ganho com os lances menos o custo de dirigir).

Isso não é apenas sobre escrever um código que não trave; é sobre escrever um código que pense estrategicamente, preveja o futuro e supere os oponentes.

Os Competidores

Os pesquisadores colocaram dois times um contra o outro:

  • Time Humano: 17 agentes escritos por estudantes de pós-graduação de uma universidade (EPFL) antes da existência das ferramentas de codificação por IA. Esses estudantes passaram semanas pensando, planejando e programando manualmente.
  • Time IA: 40 agentes escritos pelos modelos de IA mais avançados do mundo (como GPT-5, Claude, Gemini) usando "Vibe Coding". Os pesquisadores deram à IA exatamente as mesmas instruções que os estudantes receberam.

Os Resultados: Os Humanos Vencem, de Lavada

Os resultados foram surpreendentes e claros:

  1. O Top 5 é Humano: Em todos os torneios, as cinco primeiras posições foram ocupadas pelos estudantes humanos. Os agentes de IA não conseguiram chegar ao top 5.
  2. IA vs. O Baseline "Sem Cérebro": Os pesquisadores criaram um agente de IA muito simples e burro (basicamente um adivinhador aleatório). 33 dos 40 agentes de IA perderam para esse agente simples. A IA foi tão ruim em estratégia que uma calculadora básica a venceu.
  3. O Desastre do "Conserto": Em um teste final, os pesquisadores pegaram o código vencedor dos humanos e pediram para a melhor IA "melhorá-lo". A IA tentou ajustar o código, mas em vez de torná-lo melhor, ela o tornou pior. A versão "melhorada" caiu do 1º para o 10º lugar.

Por Que a IA Falhou?

O artigo explica que, embora a IA seja ótima em sintaxe (escrever código sem erros de ortografia), ela tem dificuldades com o raciocínio (entender o "porquê" e o "como" de estratégias complexas).

  • A Falha da "Heurística Admissível": Em um teste mais simples, a IA foi instruída a usar um truque matemático específico (busca A*) para encontrar o melhor caminho. A IA continuava esquecendo a regra mais básica desse truque, mesmo quando os pesquisadores diziam isso explicitamente. É como pedir a um chef para assar um bolo, mas ele esquecer que ovos são um ingrediente essencial, mesmo após ser avisado.
  • O Bug do "Tempo Limite": Os agentes de IA frequentemente ficavam presos em loops ou demoravam demais para pensar, fazendo com que perdessem o leilão por falta de tempo. O código humano não fazia isso.
  • Falta de Estratégia: Os agentes de IA frequentemente davam lances cegamente ou planejavam rotas que desperdiçavam combustível. Eles não conseguiam "ler o ambiente" ou prever o que seus concorrentes estavam fazendo.

A Conclusão

O artigo conclui que os LLMs ainda não são "Programadores de Nível de Pós-Graduação".

Eles são excelentes em escrever códigos que funcionam (não têm erros de sintaxe), mas atualmente são péssimos em escrever códigos que competem em cenários complexos do mundo real que exigem planejamento de longo prazo e estratégia.

A Analogia:
Imagine que você tem um robô que pode escrever uma receita perfeita para um bolo. Ele sabe exatamente quantas xícaras de farinha usar. Mas se você pedir para ele administrar uma padaria em uma cidade onde os preços mudam a cada minuto, competidores estão tentando roubar seus clientes e você tem um orçamento limitado, o robô provavelmente irá à falência. Ele consegue escrever a receita, mas não consegue administrar o negócio.

Os pesquisadores dizem que é hora de parar de apenas verificar se o código "funciona" (passa em um teste) e começar a verificar se o código consegue realmente vencer no mundo real.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →