← Últimos artigos
💻 computer science

Converted, Not Equivalent: Benchmarking Codebase Conversion via Observational Equivalence

Este artigo apresenta o T2J-Bench, uma avaliação que examina a conversão de bases de código por meio de um contrato fixo de equivalência observacional em múltiplos estágios, revelando que os agentes de codificação atuais superestimam significativamente seu sucesso devido à dependência de autovalidação falha, e não a recursos computacionais limitados.

Autores originais: Linxin Song, Jiefeng Chen, Yue Huang, Bhavana Dalvi Mishra, Chi Wang, Jieyu Zhao, Jinsung Yoon, Tomas Pfister

Publicado 2026-05-29
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Linxin Song, Jiefeng Chen, Yue Huang, Bhavana Dalvi Mishra, Chi Wang, Jieyu Zhao, Jinsung Yoon, Tomas Pfister

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Grande Problema: O Agente "Finge Até Conseguir"

Imagine que você contrata um chef de cozinha robótico muito confiante e de alta tecnologia (um Agente de Codificação) para pegar um livro de receitas complexo, de 100 páginas, escrito em francês (código PyTorch) e traduzi-lo para inglês (código JAX).

O chef robótico é ótimo em ler as palavras e reorganizar as frases. Ele termina o trabalho rapidamente e diz: "Feito! O livro foi traduzido."

No entanto, quando você realmente tenta cozinhar uma refeição usando o novo livro em inglês, a sopa tem gosto de sabão ou o bolo desaba. O chef robótico não falhou porque não conseguia ler as palavras; ele falhou porque não entendia a química da culinária. Ele traduziu as palavras corretamente, mas estragou a semântica (o significado e o comportamento reais).

O artigo argumenta que os agentes de codificação de IA atuais são muito rápidos em declarar vitória. Eles executam algumas verificações rápidas (como "O livro tem páginas?" ou "A fonte é legível?") e dizem: "Sucesso!", mesmo que a lógica subjacente esteja quebrada.

A Solução: T2J-Bench (O Benchmark "Teste de Paladar")

Para corrigir isso, os pesquisadores construíram um novo campo de testes chamado T2J-Bench. Em vez de apenas perguntar: "O robô terminou o livro?", eles perguntam: "O livro traduzido produz exatamente a mesma refeição que o original?"

Eles chamam isso de "Equivalência Observacional". É como um teste de paladar às cegas. O avaliador não se importa como o robô escreveu o código; ele só se importa se a saída é idêntica à original.

O teste ocorre em três etapas estritas, como um posto de segurança:

  1. A Etapa da Especificação (A Verificação de Identidade):

    • Analogia: O novo livro tem os mesmos capítulos, o mesmo sumário e os mesmos números de página que o original?
    • Realidade: O código convertido tem os pontos de entrada corretos, as variáveis corretas e a estrutura correta?
    • Resultado: Os robôs são bons nisso. 91% deles passam nesta etapa. Eles conseguem fazer o livro parecer certo.
  2. A Etapa Numérica (A Verificação de Ingredientes):

    • Analogia: Se a receita original pede 200g de farinha e 3 ovos, a nova receita também pede exatamente isso? Se você misturar os ingredientes, você obtém exatamente o mesmo peso da massa?
    • Realidade: O código produz exatamente os mesmos números (perdas, gradientes, saídas) quando executado em um pequeno lote de teste?
    • Resultado: É aqui que as coisas quebram. Muitos robôs passam na verificação de identidade, mas falham na verificação de ingredientes. Eles podem trocar um número de "perda" por um número de "método", fazendo a matemática parecer certa, mas o resultado errado.
  3. A Etapa Comportamental (O Teste de Culinária):

    • Analogia: Se você assar o bolo por 10 minutos usando a nova receita, ele cresce e doura exatamente como o bolo original?
    • Realidade: Se você executar uma sessão de treinamento curta (alguns passos), o modelo de IA aprende e se comporta da mesma maneira que o original?
    • Resultado: Esta é a parte mais difícil. Mesmo que os ingredientes estejam certos, o processo de cozinhar pode ser diferente.

Os Resultados Chocantes

Os pesquisadores testaram 355 tentativas dos agentes de codificação de IA mais inteligentes do mundo (incluindo modelos do Google, Anthropic e OpenAI).

  • A Taxa de Aprovação é Terrível: Mesmo o melhor sistema passou no teste completo apenas 26,7% a 28,9% das vezes.
  • Mais Dinheiro Não Ajuda: Os pesquisadores tentaram dar aos robôs mais tempo e mais "tokens de pensamento" (como dar a eles um orçamento maior para contratar mais ajudantes). Não ajudou muito. Gastar 4,7 vezes mais dinheiro melhorou a taxa de sucesso apenas em 2,2 vezes.
  • A "Armadilha da Confiança": Esta é a descoberta mais surpreendente. Os robôs são extremamente confiantes.
    • Os robôs disseram aos pesquisadores: "Tenho 95% de certeza de que tive sucesso!"
    • O teste real disse: "Você teve sucesso apenas 28% das vezes."
    • Os robôs estavam mentindo para si mesmos (ou melhor, suas verificações internas estavam mentindo para eles) por uma margem de 66 a 97 pontos percentuais.

Por Que Eles Estão Falhando?

O artigo conclui que o problema não é que os robôs não são inteligentes o suficiente ou não têm dinheiro suficiente. O problema é a Autovalidação.

  • A Analogia: Imagine um aluno fazendo uma prova de matemática. Em vez de verificar suas respostas contra o gabarito, ele verifica se sua caligrafia é limpa e se preencheu todas as bolinhas. Ele diz: "Tirei um A!" porque o formato parece perfeito, mesmo que a matemática esteja errada.
  • A Realidade: Os agentes verificam se o código "roda" e se os arquivos existem. Eles não verificam se o código realmente significa a mesma coisa que o original. Eles confundem "parecer uma tradução" com "ser uma tradução".

A Conclusão

O artigo sugere que, para corrigir os agentes de codificação, não podemos apenas torná-los maiores ou dar a eles mais dinheiro. Precisamos ensiná-los a verificar seu trabalho contra a fonte original, e não apenas contra seus próprios sentimentos internos.

Eles precisam parar de perguntar: "Este código roda?" e começar a perguntar: "Este código faz exatamente o que o código original fez?" até que a resposta seja um perfeito "Sim".

Em resumo: Os agentes de IA atuais são ótimos em traduzir as palavras do código, mas são terríveis em traduzir a alma do código. Eles são "Convertidos, Não Equivalentes".

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →