← Últimos artigos
💻 computer science

SWE-chat: Coding Agent Interactions From Real Users in the Wild

O artigo apresenta o SWE-chat, o primeiro grande conjunto de dados de sessões reais de agentes de codificação coletadas de desenvolvedores, revelando que, embora existam padrões de uso variados, esses agentes ainda são ineficientes no ambiente real, com apenas 44% do código gerado sendo mantido e uma taxa maior de vulnerabilidades de segurança em comparação ao código humano.

Autores originais: Joachim Baumann, Vishakh Padmakumar, Xiang Li, John Yang, Diyi Yang, Sanmi Koyejo

Publicado 2026-04-23
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Joachim Baumann, Vishakh Padmakumar, Xiang Li, John Yang, Diyi Yang, Sanmi Koyejo

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você contratou um estagiário de programação superinteligente, mas que às vezes é meio desastrado, muito confiante e, às vezes, escreve código que você tem que apagar e refazer.

O artigo que você leu, chamado SWE-chat, é como um grande diário de bordo (um "diário de bordo" gigante) que os pesquisadores da Universidade de Stanford criaram para observar, na vida real, como os programadores estão usando esses "estagiários" (os agentes de IA).

Aqui está a história do que eles descobriram, explicada de forma simples:

1. O Grande Experimento: "O Diário de Bordo"

Antes disso, os pesquisadores só testavam esses robôs em "provas de laboratório" (exercícios perfeitos e controlados). Era como testar um carro de corrida em uma pista vazia. O problema? Na vida real, o trânsito é caótico.

Para ver a realidade, eles instalaram uma ferramenta chamada Entire.io em computadores de desenvolvedores de código aberto. Essa ferramenta gravou tudo: o que o humano pediu, o que o robô fez, quais arquivos ele abriu, quais comandos digitou e, o mais importante, o que o humano decidiu manter ou jogar no lixo.

Eles coletaram 6.000 sessões de trabalho. É como ter assistido a 6.000 dias de trabalho de programadores reais.

2. Os Dois Estilos de Trabalho (A "Dança" Humano-Robô)

Os pesquisadores descobriram que as pessoas trabalham de duas formas extremas, como se fosse um interruptor de luz:

  • O "Vibe Coding" (Cocô de Vibe): Em 41% dos casos, o humano dá uma instrução vaga (tipo: "faça um site de vendas") e senta no sofá. O robô faz 99% do trabalho sozinho. É como pedir para um cozinheiro fazer um jantar completo e você só olha de longe.
  • O "Apenas Humano": Em 23% dos casos, o humano escreve tudo sozinho e usa o robô apenas para tirar dúvidas rápidas, como um dicionário.
  • O Meio-Termo (Colaboração): O restante é uma mistura, onde humano e robô trabalham juntos, linha por linha.

A Surpresa: O estilo "Vibe Coding" está crescendo muito rápido. As pessoas estão confiando cada vez mais no robô para fazer tudo.

3. A Realidade: O Robô não é Perfeito (e custa caro)

Aqui é onde a história fica interessante. Mesmo com toda essa inteligência, o robô não é tão eficiente quanto parece:

  • O Lixo no Lixo: De todo o código que o robô escreve, menos da metade (44%) acaba sendo realmente usado pelo programador. O resto é apagado, corrigido ou reescrito. É como se o robô tentasse montar um móvel, mas você tivesse que desmontar metade das peças porque estavam tortas.
  • O Custo Oculto: Quando o humano deixa o robô fazer tudo sozinho ("Vibe Coding"), o processo é 3 vezes mais caro e mais lento do que quando eles trabalham juntos. O robô gasta muita energia (e dinheiro) tentando coisas que depois são descartadas.
  • O Perigo Secreto: O código feito pelo robô sozinho tem 9 vezes mais chances de ter buracos de segurança (vulnerabilidades) do que o código feito pelo humano. É como se o robô construísse uma casa com tijolos que parecem bons, mas têm rachaduras invisíveis que podem fazer o telhado cair depois.

4. A Relação: Quem manda de verdade?

O estudo mostrou uma dinâmica curiosa de "tensão":

  • O Robô é teimoso: Ele raramente para para perguntar: "Ei, você tem certeza disso?". Ele age como um funcionário que acha que sabe tudo e continua trabalhando mesmo quando está errado.
  • O Humano é o fiscal: Os programadores precisam ficar o tempo todo vigiando. Eles interrompem o robô, corrigem erros e dizem "não, faça assim" em 44% das vezes. É como ter um motorista autônomo que dirige rápido, mas você precisa ficar segurando o volante e freando a cada curva perigosa.

5. O Que Isso Significa para o Futuro?

O artigo conclui que, embora os robôs sejam incríveis, eles não são mágicos.

  • O "Vibe Coding" (deixar o robô fazer tudo) é arriscado. Pode parecer fácil, mas gera mais erros, mais custo e mais trabalho de limpeza depois.
  • A melhor forma é a parceria: Quando o humano e o robô trabalham juntos (o humano dá a direção e o robô executa os detalhes), o resultado é mais barato, mais rápido e mais seguro.
  • Precisamos de novos testes: Os testes atuais de IA são como provas de matemática onde só existe uma resposta certa. O mundo real é mais como um jogo de improvisação. Precisamos treinar esses robôs para saberem quando parar e perguntar, e para entenderem melhor o que o humano realmente quer.

Resumo da Ópera:
Os agentes de IA são como estagiários superpoderosos. Eles podem fazer muito trabalho sozinhos, mas se você não ficar de olho, eles vão gastar muito dinheiro, fazer coisas erradas e criar problemas de segurança. O segredo não é deixar o robô fazer tudo, mas sim ser um chefe que sabe como dirigir essa parceria.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →