← Derniers articles
💻 computer science

MT-Web2Code: Benchmarking Coding Agents on Multi-Turn Regional Reconstruction and Localized Modification

Cet article présente MT-Web2Code, le premier benchmark multimodal conçu pour évaluer les agents de codage sur des tâches réalistes d'interface utilisateur web à plusieurs tours impliquant la reconstruction régionale et des modifications localisées, révélant des limitations significatives dans la capacité des agents actuels à maintenir la fidélité et à prévenir l'accumulation d'erreurs au fil des tours itératifs.

Auteurs originaux : Qiming Li, Shujie Hu, Haohan Liu, Xiaocheng Feng, Songxiang Liu, Guanglu Wan

Publié 2026-08-05
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Qiming Li, Shujie Hu, Haohan Liu, Xiaocheng Feng, Songxiang Liu, Guanglu Wan

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous enseigniez à un robot comment devenir un maître du web design. Par le passé, nous testions ces robots en leur tendant une toile vierge et l'image d'un site web, en leur demandant de construire tout l'ensemble à partir de zéro en une seule fois. C'était comme demander à un chef de cuisiner instantanément un repas complet de cinq services. Mais dans le monde réel, le web design est rarement aussi dramatique. Généralement, un développeur ouvre un site web existant, trouve un bouton cassé, corrige une police étrange ou ajoute une photo manquante, tout en s'assurant de ne pas supprimer accidentellement le reste de la page. C'est plutôt un jeu de « trouver les différences » et de « corriger le bug » joué encore et encore. C'est le monde du « codage itératif », où le robot doit se souvenir de ce qu'il a fait il y a cinq minutes et ne pas tout gâcher en réparant le nouveau problème. La grande question que les chercheurs se posent est la suivante : nos robots d'IA les plus intelligents peuvent-ils gérer cette réalité désordonnée et étape par étape, ou fonctionnent-ils bien uniquement lorsqu'on leur donne une page blanche ?

C'est exactement ce que l'article « MT-Web2Code » étudie. Les auteurs ont créé un nouveau test extrêmement exigeant, appelé MT-Web2Code, pour voir à quel point les agents de codage IA sont réellement doués pour ce style de travail de type « réparation au fur et à mesure ». Au lieu de demander à l'IA de construire une page entière, ils lui ont donné 102 pages web différentes issues de 16 catégories distinctes (comme des sites de shopping, d'actualités et des sites gouvernementaux) et lui ont demandé d'accomplir deux types de tâches spécifiques sur plusieurs tours. La première tâche est la « Reconstruction Régionale », qui revient à dire au robot : « Hé, toute cette section de la page est manquante ; voici une image de ce à quoi elle devrait ressembler, s'il te plaît, reconstruis juste cette partie sans toucher au reste. » La seconde est la « Modification Localisée », ce qui est encore plus délicat : « Voici trois petites choses qui semblent incorrectes (peut-être qu'un bouton a la mauvaise couleur ou qu'une ligne est trop épaisse) ; s'il te plaît, corrige seulement ces minuscules points. »

Pour rendre ce test équitable et impossible à contourner, les chercheurs ont inventé un ingénieux moteur de « Corruption Inversée ». Imaginez qu'ils aient pris un site web parfait, doré, puis l'aient délibérément cassé de manières spécifiques — en cachant une section entière ou en déréglant quelques polices. Ensuite, ils ont enregistré exactement comment ils l'avaient cassé. Le travail de l'IA est d'inverser ce processus : regarder la page cassée, comprendre ce qui ne va pas, et la réparer pour qu'elle revienne à son état parfait. Comme les chercheurs savent exactement comment la page a été cassée, ils peuvent mesurer le succès de l'IA avec une précision extrême. Ils ont découvert que, bien que ces robots d'IA s'améliorent, ils luttent encore durement avec ce jeu multi-tours.

Les résultats ont été un certain rappel à la réalité. Lorsque l'IA tentait de reconstruire une région manquante, elle réussissait souvent un travail décent sur la nouvelle partie, mais déréglait accidentellement le contenu environnant, comme en changeant la couleur de fond de toute la page alors qu'elle ne devait réparer qu'un menu. Lorsqu'on lui demandait d'effectuer des modifications infimes et précises, les robots échouaient souvent à aligner parfaitement le code avec la correction visuelle, montrant qu'ils manquent de contrôle granulaire. Plus inquiétant encore, l'article a révélé un effet de « boule de neige d'erreurs ». Si l'IA commettait une petite erreur lors du premier tour, cette erreur était reportée et amplifiée lors des tours suivants, rendant le résultat final bien pire que s'il avait commencé à zéro à chaque fois. Curieusement, les chercheurs ont découvert que donner à l'IA une description écrite de ce à quoi ressemblait la partie cassée n'aidait pas toujours ; parfois, cela la confondait même, la poussant à se fier trop aux mots et à ignorer l'image réelle.

En bref, cet article suggère que si l'IA est excellente pour construire des sites web de zéro, elle est encore en train d'apprendre à être un éditeur prudent et itératif. Il montre qu'être bon dans l'un ne signifie pas automatiquement être bon dans l'autre. Les auteurs espèrent qu'en utilisant leur nouveau système de notation super précis — qui vérifie à la fois la partie réparée et les parties intactes — ils pourront aider à entraîner les futures IA à devenir des concepteurs web par étapes plus fiables, qui ne cassent pas le reste de la maison en réparant une simple fenêtre.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →