← Últimos artigos
🤖 AI

LongWebBench: Evaluating Structural and Functional Webpage Generation in Long-Horizon Settings

Este artigo apresenta o LongWebBench, um benchmark abrangente projetado para avaliar a fidelidade estrutural e a executabilidade funcional da geração de páginas web de longo horizonte por modelos de visão-linguagem, revelando que os sistemas atuais de estado da arte lutam com coerência de longo alcance e capacidades interativas, apesar da plausibilidade visual.

Autores originais: Yi Zhao, Zhen Yang, Mengpan Chen, Mingde Xu, Shanghui Gong, Xijun Liu, Jibing Gong, Jie Tang

Publicado 2026-06-17
📖 3 min de leitura☕ Leitura rápida

Autores originais: Yi Zhao, Zhen Yang, Mengpan Chen, Mingde Xu, Shanghui Gong, Xijun Liu, Jibing Gong, Jie Tang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está contratando um arquiteto talentoso para construir uma casa baseada em uma única e enorme fotografia de uma mansão.

O Problema:
Até agora, a maioria dos testes para "arquitetos" de IA (chamados de Modelos de Linguagem-Visão) apenas pedia que eles construíssem pequenas cabanas de um único cômodo. Os testes verificavam se a porta da frente parecia correta ou se a cor da tinta combinava. Mas sites reais são como mansões enormes com dezenas de cômodos, múltiplos andares e fiações complexas. Se você pedir a uma IA para construir uma mansão inteira a partir de uma foto, ela pode acertar a porta da frente, mas esquecer como conectar a escada ao segundo andar, ou construir uma cozinha que parece real, mas não tem uma pia funcionando.

A Solução: LongWebBench
Os autores deste artigo criaram um novo teste mais rigoroso chamado LongWebBench. Em vez de apenas verificar se a casa parece com a foto, eles verificam duas coisas:

  1. A Planta Baixa (Estrutura): O edifício inteiro faz sentido? Os cômodos estão na ordem correta? O telhado está conectado às paredes?
  2. O Encanamento e a Eletricidade (Funcionalidade): Se você abrir a torneira, a água sai? Se você apertar o interruptor, a luz acende?

Como Eles Construíram o Teste:
Eles reuniram duas grandes coleções de "fotos de mansões" do mundo real (páginas web longas):

  • 490 Testes de "Semelhança Visual": Eles pegaram fotos de sites muito longos (alguns tão longos que você teria que rolar por 30 telas para ver o final) e pediram aos modelos de IA que recriassem o código dessas páginas. O teste verificava se a IA conseguia manter a consistência do layout do topo da página até o final.
  • 507 Testes de "Execução": Eles escolheram 129 sites e deram tarefas específicas à IA, como "Encontrar um voo para Tóquio", "Adicionar um item ao carrinho" ou "Filtrar os resultados da busca". A IA tinha que escrever um código que realmente fizesse essas coisas em um navegador real, não apenas fingir que as fazia.

Os Resultados: O "Abismo da Realidade"
Quando rodaram os melhores modelos de IA através deste novo teste, descobriram coisas surpreendentes:

  • O Problema da "Rolagem Longa": À medida que os sites ficavam mais longos, a capacidade da IA de manter a estrutura correta piorava. É como um arquiteto que consegue projetar um primeiro andar perfeito, mas esquece como o segundo andar se conecta a ele.
  • O Problema da "Casa de Mentira": Muitas IAs construíram sites que pareciam bonitos e realistas (como um cenário de filme), mas quando você tentava clicar em um botão ou preencher um formulário, nada acontecia. O "encanamento" estava quebrado.
  • O Problema da Entrada: Mesmo quando os pesquisadores dividiam a foto longa em pedaços menores para facilitar a visualização pela IA, a IA ainda tinha dificuldade em juntar as peças em um todo funcional.

A Conclusão
O artigo conclui que não podemos julgar a IA apenas pelo quão bonitos são seus desenhos. Para ser verdadeiramente útil, uma IA precisa ser capaz de construir sites longos e complexos que realmente funcionem quando você interage com eles. O LongWebBench é a nova régua que eles estão usando para medir isso, mostrando-nos que, embora a IA esteja ficando boa em desenhar, ela ainda tem um longo caminho a percorrer antes de conseguir construir uma casa digital totalmente funcional.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →