← Últimos artículos
🤖 AI

LongWebBench: Evaluating Structural and Functional Webpage Generation in Long-Horizon Settings

Este artículo presenta LongWebBench, un benchmark exhaustivo diseñado para evaluar la fidelidad estructural y la ejecutabilidad funcional de la generación de páginas web de largo alcance por parte de modelos de lenguaje-visión, revelando que los sistemas actuales de vanguardia tienen dificultades con la coherencia de largo alcance y las capacidades interactivas a pesar de su plausibilidad visual.

Autores originales: Yi Zhao, Zhen Yang, Mengpan Chen, Mingde Xu, Shanghui Gong, Xijun Liu, Jibing Gong, Jie Tang

Publicado 2026-06-17
📖 3 min de lectura☕ Lectura para el café

Autores originales: Yi Zhao, Zhen Yang, Mengpan Chen, Mingde Xu, Shanghui Gong, Xijun Liu, Jibing Gong, Jie Tang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás contratando a un arquitecto talentoso para construir una casa basada en una única y masiva fotografía de una mansión.

El Problema:
Hasta ahora, la mayoría de las pruebas para los "arquitectos" de IA (llamados Modelos de Lenguaje-Visión) solo les pedían construir pequeñas cabañas de una sola habitación. Estas pruebas verificaban si la puerta principal se veía bien o si el color de la pintura coincidía. Pero los sitios web reales son como mansiones masivas con docenas de habitaciones, múltiples pisos y un cableado complejo. Si le pides a una IA que construya una mansión entera a partir de una sola foto, podría lograr que la puerta principal se vea bien, pero olvidaría cómo conectar las escaleras con el segundo piso, o construiría una cocina que parece real pero que no tiene un fregadero funcional.

La Solución: LongWebBench
Los autores de este artículo crearon una nueva y más difícil prueba llamada LongWebBench. En lugar de solo verificar si la casa se parece a la foto, verifican dos cosas:

  1. El Plano (Estructura): ¿Tiene todo el edificio sentido? ¿Están las habitaciones en el orden correcto? ¿Está el techo conectado a las paredes?
  2. La Fontanería y la Electricidad (Función): Si abres el grifo, ¿sale agua? Si accionas el interruptor de la luz, ¿se enciende la luz?

Cómo Construyeron la Prueba:
Reunieron dos enormes colecciones de "fotos de mansiones" del mundo real (páginas web largas):

  • 490 Pruebas de "Parecido Visual": Tomaron fotos de sitios web muy largos (algunos tan largos que tendrías que desplazarte por 30 pantallas para ver el final). Les pidieron a los modelos de IA que recrearan el código de estas páginas. La prueba verificaba si la IA podía mantener la consistencia del diseño desde la parte superior de la página hasta el mismísimo fondo.
  • 507 Pruebas de "Hacerlo": Seleccionaron 129 sitios web y le dieron a la IA tareas específicas, como "Buscar un vuelo a Tokio", "Añadir un artículo al carrito" o "Filtrar los resultados de búsqueda". La IA tenía que escribir código que realmente hiciera estas cosas en un navegador web real, no solo fingir que las hacía.

Los Resultados: La "Brecha de Realidad"
Cuando sometieron a los mejores modelos de IA a esta nueva prueba, encontraron cosas sorprendentes:

  • El Problema del "Desplazamiento Largo": A medida que los sitios web se hacían más largos, la capacidad de la IA para mantener la estructura correcta empeoraba. Es como un arquitecto que puede diseñar una primera planta perfecta, pero olvida cómo se conecta con la segunda planta.
  • El Problema de la "Casa Falsa": Muchas IA construyeron sitios web que se veían hermosos y realistas (como un set de filmación), pero cuando intentabas hacer clic en un botón o llenar un formulario, nada sucedía. La "fontanería" estaba rota.
  • El Problema de la Entrada: Incluso cuando los investigadores dividieron la foto larga en piezas más pequeñas para que fuera más fácil de ver para la IA, la IA seguía teniendo dificultades para unir las piezas en un todo funcional.

La Conclusión
El artículo concluye que no podemos juzgar a la IA solo por lo bonitos que son sus dibujos. Para ser verdaderamente útil, una IA debe ser capaz de construir sitios web largos y complejos que realmente funcionen cuando interactúas con ellos. LongWebBench es la nueva regla que están utilizando para medir esto, demostrándonos que, aunque la IA se está volviendo buena dibujando, aún tiene un largo camino por recorrer antes de poder construir una casa digital totalmente funcional.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →