← Últimos artigos
💻 computer science

VISTA: An End-to-End Benchmark for Visual Spec-to-Web-App Coding Agents

O artigo apresenta o VISTA, um benchmark abrangente projetado para avaliar agentes baseados em LLMs na geração de aplicações web de ponta a ponta a partir de especificações visuais, definindo condições de prompt diversas e empregando um framework de avaliação multifacetado que combina correspondência de DOM, testes comportamentais e similaridade visual para superar as limitações das ferramentas tradicionais baseadas em scripts.

Autores originais: JunJia Guo (Joe), Yuhang Yao (Joe), Jiawei (Joe), Zhou, Jingdi Chen

Publicado 2026-05-27
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: JunJia Guo (Joe), Yuhang Yao (Joe), Jiawei (Joe), Zhou, Jingdi Chen

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está contratando uma equipe de arquitetos robôs para construir uma casa personalizada com base em um esboço que você desenhou em um guardanapo. Alguns arquitetos são excelentes em desenhar a casa para parecer exatamente como seu esboço, mas as portas não abrem. Outros constroem uma casa que funciona perfeitamente (as luzes acendem, as portas trancam), mas não se parece em nada com seu desenho.

VISTA é um novo "test drive" projetado para avaliar o quão bem agentes de IA de codificação podem construir essas casas digitais (sites) do zero, não apenas escrever uma única linha de código.

Aqui está uma análise do artigo usando analogias simples:

1. O Problema: A Lacuna do "Esboço no Guardanapo"

Testes anteriores para codificadores de IA eram como pedir que eles resolvessem problemas de matemática ou consertassem uma única peça quebrada de um motor. Mas construir um site real é diferente. Você pode dar a uma IA uma descrição em texto, uma foto de um site que você gosta ou um arquivo de design detalhado (como uma planta baixa).

  • A Lacuna: Testes atuais não verificavam se a IA conseguia lidar com a realidade bagunçada de construir um aplicativo inteiro, escolher as ferramentas certas (como escolher entre diferentes materiais de construção) ou corrigir erros quando o processo de construção dava errado.

2. A Solução: O Teste VISTA

Os autores criaram o VISTA (Visual Spec-To-App Benchmark). Pense nisso como um desafio de construção rigoroso com 10 tipos diferentes de edifícios para construir (como um site de reservas de viagens, um player de música ou um quadro de empregos).

Eles testaram a IA sob cinco níveis diferentes de "ajuda" para ver quanta informação a IA precisa para ter sucesso:

  • Nível 1 (O Guardanapo): Apenas uma descrição em texto. A IA tem que adivinhar as ferramentas e a aparência.
  • Nível 2 (A Foto + Ferramentas Fixas): Uma descrição em texto + uma foto do alvo, mas a IA deve usar ferramentas de construção específicas (por exemplo, "Você deve usar React").
  • Nível 3 (A Foto + Ferramentas Livres): Uma descrição em texto + uma foto, mas a IA pode escolher suas próprias ferramentas.
  • Nível 4 (A Planta Baixa + Ferramentas Fixas): Texto + Foto + uma planta baixa digital detalhada (Figma), mas a IA deve usar ferramentas específicas.
  • Nível 5 (A Planta Baixa + Ferramentas Livres): O pacote completo: Texto + Foto + Planta Baixa, e a IA pode escolher suas próprias ferramentas.

3. O Sistema de Notas: Como Sabemos que Eles Fizeram um Bom Trabalho?

Esta é a parte mais criativa do artigo. Os autores perceberam que testes padrão de computador (como verificar se um botão clica) frequentemente falham porque são muito rígidos. Então, eles criaram um sistema de notas "Humano no Loop":

  • Os "Anotadores Humanos": Pessoas reais analisaram os designs e marcaram exatamente onde botões, links e menus deveriam estar. Eles também escolheram "marcos" (como uma barra de pesquisa ou um botão de checkout) para atuar como pontos de referência.
  • O "Avaliador Fundamentado no DOM": Este é um juiz robô inteligente. Ele não olha apenas para uma imagem; ele olha dentro do código do site (o DOM).
    • Etapa 1 (Localização): Ele verifica: "O botão 'Pesquisar' está realmente lá e está no lugar certo?"
    • Etapa 2 (Comportamento): Ele verifica: "Se eu clicar nesse botão, ele realmente pesquisa?"
    • Etapa 3 (Visuals): Ele usa uma ferramenta de "similaridade visual" (como um olho superinteligente) para ver se o edifício final se parece com a planta baixa original, mesmo que os pixels não sejam idênticos.

4. O Que Eles Encontraram: O Dilema "Aparência vs. Funcionamento"

Quando testaram quatro sistemas diferentes de IA, encontraram algumas coisas surpreendentes:

  • O Dilema "Bonito mas Quebrado" vs. "Feio mas Funcionando":

    • Uma IA (GPT-5.5) foi incrível em fazer o site parecer exatamente com a foto (alta pontuação visual), mas os botões frequentemente não funcionavam (baixa pontuação funcional).
    • Outra IA (Claude Opus) construiu sites que funcionavam perfeitamente (alta pontuação funcional), mas não se pareciam tanto com a foto original.
    • A Lição: Fazer um site parecer bom e fazê-lo funcionar são duas habilidades diferentes. Uma IA pode ser excelente em uma e ruim na outra.
  • A Liberdade é Fundamental:

    • A IA teve o melhor desempenho quando foi permitida escolher suas próprias ferramentas (as condições de "Pilha Livre"). Quando o teste forçou a IA a usar ferramentas específicas, potencialmente difíceis, a qualidade caiu. É como forçar um carpinteiro a construir uma casa usando apenas um martelo quando ele realmente precisa de uma serra.
  • O Estilo "Cirúrgico" vs. "Demolição":

    • Os pesquisadores rastrearam como a IA editou o código.
    • Algumas IAs eram "Cirurgiões": Faziam cortes e remendos minúsculos e precisos para corrigir problemas.
    • Outras eram "Equipes de Demolição": Apagavam grandes pedaços de código e reescreviam todo o arquivo do zero.
    • O Twist: Ser um "Cirurgião" não significava necessariamente que a IA construía uma casa melhor. A "Equipe de Demolição" (Claude Opus) na verdade construiu os aplicativos mais funcionais, mesmo reescrevendo arquivos constantemente. Não havia ligação direta entre "ser cuidadoso com as edições" e "construir um bom aplicativo".

5. Por Que Isso Importa

O VISTA não é apenas um teste; é um novo padrão. Ele prova que, para testar verdadeiramente codificadores de IA, não podemos apenas pedir que eles escrevam código. Temos que ver se eles conseguem:

  1. Entender um design visual.
  2. Escolher as ferramentas certas.
  3. Construir um produto funcional.
  4. Corrigir seus próprios erros.

O artigo conclui que precisamos parar de tratar a IA como um gerador simples de código e começar a tratá-la como um engenheiro de software completo que precisa gerenciar todo o processo de construção, desde a planta baixa até a inspeção final.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →