← Últimos artigos
💻 computer science

MT-Web2Code: Benchmarking Coding Agents on Multi-Turn Regional Reconstruction and Localized Modification

Este artigo apresenta o MT-Web2Code, o primeiro benchmark multimodal projetado para avaliar agentes de codificação em tarefas realistas de interface de usuário (UI) web de múltiplos turnos envolvendo reconstrução regional e modificações localizadas, revelando limitações significativas na capacidade dos agentes atuais de manter a fidelidade e prevenir o acúmulo de erros ao longo de turnos iterativos.

Autores originais: Qiming Li, Shujie Hu, Haohan Liu, Xiaocheng Feng, Songxiang Liu, Guanglu Wan

Publicado 2026-08-05
📖 4 min de leitura☕ Leitura rápida

Autores originais: Qiming Li, Shujie Hu, Haohan Liu, Xiaocheng Feng, Songxiang Liu, Guanglu Wan

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um robô a ser um mestre do web design. No passado, testávamos esses robôs entregando-lhes uma tela em branco e a imagem de um site, pedindo que construíssem tudo do zero de uma só vez. Era como pedir a um chef para cozinhar uma refeição completa de cinco pratos instantaneamente. Mas, no mundo real, o web design raramente é tão dramático. Geralmente, um desenvolvedor abre um site existente, encontra um botão quebrado, corrige uma fonte estranha ou adiciona uma foto que estava faltando, tudo isso enquanto garante que não apagará acidentalmente o resto da página. É mais como um jogo de "encontre o erro" e "corrija a falha" jogado repetidamente. Este é o mundo da "codificação iterativa", onde o robô tem que se lembrar do que fez cinco minutos atrás e não estragar tudo enquanto resolve o novo problema. A grande questão que os pesquisadores estão fazendo é: nossos robôs de IA mais inteligentes conseguem lidar com essa realidade desordenada e passo a passo, ou eles só funcionam bem quando recebem uma folha em branco?

É exatamente isso que o artigo "MT-Web2Code" investiga. Os autores criaram um teste novo e superdesafiador chamado MT-Web2Code para ver o quão bons os agentes de codificação de IA realmente são nesse estilo de trabalho de "consertar conforme se avança". Em vez de pedir à IA que construa uma página inteira, eles deram a ela 102 páginas web diferentes de 16 categorias distintas (como sites de compras, notícias e governamentais) e pediram que realizasse dois tipos específicos de tarefas ao longo de várias etapas. A primeira tarefa é a "Reconstrução Regional", que é como dizer ao robô: "Ei, esta seção inteira da página está faltando; aqui está uma imagem de como ela deveria ser, por favor, reconstrua apenas essa parte sem tocar no restante". A segunda é a "Modificação Localizada", que é ainda mais difícil: "Aqui estão três coisinhas que parecem erradas (talvez um botão esteja com a cor errada ou uma linha esteja muito grossa); por favor, corrija apenas esses pequenos pontos".

Para tornar este teste justo e impossível de burlar, os pesquisadores inventaram um motor de "Corrupção Reversa" inteligente. Imagine que eles pegaram um site perfeito e dourado e então o quebraram deliberadamente de formas específicas — escondendo uma seção inteira ou estragando algumas fontes. Depois, eles registraram exatamente como o quebraram. O trabalho da IA é reverter esse processo: olhar para a página quebrada, descobrir o que está errado e consertá-la de volta ao estado perfeito. Como os pesquisadores sabem exatamente como a página foi quebrada, eles podem medir o sucesso da IA com extrema precisão. Eles descobriram que, embora esses robôs de IA estejam melhorando, eles ainda lutam bravamente com este jogo de múltiplas etapas.

Os resultados foram um choque de realidade. Quando a IA tentava reconstruir uma região ausente, ela frequentemente fazia um trabalho decente na parte nova, mas acabava estragando o conteúdo ao redor, como mudando a cor de fundo de toda a página quando deveria apenas consertar um menu. Quando solicitada a fazer edições minúsculas e precisas, os robôs frequentemente falhavam em alinhar o código perfeitamente com a correção visual, mostrando que carecem de controle refinado. Talvez o mais preocupante, o artigo descobriu um efeito de "bola de neve de erros". Se a IA cometesse um pequeno erro na primeira etapa, esse erro era carregado e amplificado nas etapas seguintes, tornando o resultado final muito pior do que se tivesse começado do zero a cada vez. Curiosamente, os pesquisadores também descobriram que dar à IA uma descrição escrita de como era a parte quebrada não ajudava sempre; às vezes, na verdade, confundia o robô, fazendo-o confiar demais nas palavras e ignorar a imagem real.

Em resumo, este artigo sugere que, embora a IA seja ótima para construir sites do zero, ela ainda está aprendendo a ser uma editora cuidadosa e iterativa. Isso mostra que ser bom em uma coisa não significa automaticamente ser bom na outra. Os autores esperam que, ao usar seu novo sistema de pontuação superpreciso — que verifica tanto a parte corrigida quanto as partes intocadas —, eles possam ajudar a treinar futuras IAs para se tornarem designers de web mais confiáveis e passo a passo, que não quebrem o resto da casa ao consertar uma única janela.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →