LongWebBench: Evaluating Structural and Functional Webpage Generation in Long-Horizon Settings
Cet article introduit LongWebBench, un benchmark complet conçu pour évaluer la fidélité structurelle et l'exécutabilité fonctionnelle de la génération de pages web à long horizon par les modèles vision-langage, révélant que les systèmes de pointe actuels peinent avec la cohérence à longue portée et les capacités interactives malgré une plausibilité visuelle.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous embauchiez un architecte talentueux pour construire une maison à partir d'une seule et immense photographie de manoir.
Le Problème :
Jusqu'à présent, la plupart des tests destinés aux « architectes » IA (appelés modèles Vision-Langage) ne demandaient qu'à construire de petites cabanes d'une seule pièce. Ces tests vérifiaient si la porte d'entrée semblait correcte ou si la couleur de la peinture correspondait. Mais les vrais sites web sont comme de grands manoirs avec des dizaines de pièces, plusieurs étages et un câblage complexe. Si vous demandez à une IA de construire tout un manoir à partir d'une seule photo, elle pourrait réussir la porte d'entrée, mais oublier comment relier l'escalier au deuxième étage, ou construire une cuisine qui semble réelle mais qui n'a pas de robinet fonctionnel.
La Solution : LongWebBench
Les auteurs de ce document ont créé un nouveau test plus exigeant appelé LongWebBench. Au lieu de simplement vérifier si la maison ressemble à la photo, ils vérifient deux choses :
- Le Plan (Structure) : Est-ce que l'ensemble du bâtiment est cohérent ? Les pièces sont-elles dans le bon ordre ? Le toit est-il bien relié aux murs ?
- La Plomberie et l'Électricité (Fonctionnalité) : Si vous ouvrez le robinet, est-ce que l'eau coule ? Si vous actionnez l'interrupteur, est-ce que la lumière s'allume ?
Comment ils ont construit le test :
Ils ont rassemblé deux énormes collections de véritables « photos de manoirs » (de longues pages web) :
- 490 Tests de « Ressemblance » : Ils ont pris des photos de sites web très longs (certains si longs qu'il faudrait faire défiler 30 écrans pour voir le bas) et ont demandé aux modèles d'IA de recréer le code de ces pages. Le test vérifiait si l'IA pouvait maintenir la cohérence de la mise en page du haut de la page jusqu'au bas de la page.
- 507 Tests de « Réalisation » : Ils ont choisi 129 sites web et ont donné des tâches spécifiques à l'IA, comme « Trouver un vol pour Tokyo », « Ajouter un article au panier » ou « Filtrer les résultats de recherche ». L'IA devait écrire du code qui accomplissait réellement ces actions dans un véritable navigateur web, et non pas simplement faire semblant de le faire.
Les Résultats : Le « Fossé de Réalité »
Lorsqu'ils ont soumis les meilleurs modèles d'IA à ce nouveau test, ils ont découvert des choses surprenantes :
- Le Problème du « Défilement Long » : À mesure que les sites web devenaient plus longs, la capacité de l'IA à maintenir une structure correcte diminuait. C'est comme un architecte qui peut concevoir un premier étage parfait, mais qui oublie comment le second étage s'y connecte.
- Le Problème de la « Maison Factice » : De nombreuses IA ont construit des sites web qui semblaient magnifiques et réalistes (comme un décor de cinéma), mais quand on essayait de cliquer sur un bouton ou de remplir un formulaire, rien ne se passait. La « plomberie » était cassée.
- Le Problème de l'Entrée : Même lorsque les chercheurs ont découpé la longue photo en morceaux plus petits pour faciliter la vision par l'IA, celle-ci avait toujours du mal à assembler les morceaux en un tout fonctionnel.
L'Essentiel à Retenir
Le document conclut que nous ne pouvons pas juger l'IA uniquement sur la beauté de ses dessins. Pour être véritablement utile, une IA doit être capable de construire des sites web longs et complexes qui fonctionnent réellement lorsqu'on interagit avec eux. LongWebBench est la nouvelle règle qu'ils utilisent pour mesurer cela, nous montrant que si l'IA devient douée pour le dessin, elle a encore un long chemin à parcourir avant de pouvoir construire une maison numérique pleinement fonctionnelle.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.