MT-Web2Code: Benchmarking Coding Agents on Multi-Turn Regional Reconstruction and Localized Modification
Este artículo presenta MT-Web2Code, el primer benchmark multimodal diseñado para evaluar agentes de codificación en tareas realistas de interfaz de usuario web de múltiples turnos que involucran la reconstrucción regional y modificaciones localizadas, revelando limitaciones significativas en la capacidad de los agentes actuales para mantener la fidelidad y prevenir la acumulación de errores a través de turnos iterativos.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que le estás enseñando a un robot a ser un maestro del diseño web. En el pasado, probábamos estos robots entregándoles un lienzo en blanco y la imagen de un sitio web, pidiéndoles que construyeran todo desde cero de una sola vez. Era como pedirle a un chef que cocine un menú completo de cinco platos instantáneamente. Pero en el mundo real, el diseño web rara vez es tan dramático. Por lo general, un desarrollador abre un sitio web existente, encuentra un botón roto, arregla una fuente extraña o añade una foto faltante, todo mientras se asegura de no borrar accidentalmente el resto de la página. Es más como un juego de "encuentra las diferencias" y "arregla el fallo" jugado una y otra vez. Este es el mundo de la "codificación iterativa", donde el robot tiene que recordar lo que hizo hace cinco minutos y no arruinarlo mientras arregla el nuevo problema. La gran pregunta que los investigadores se plantean es: ¿Pueden nuestros robots de IA más inteligentes manejar esta realidad desordenada y paso a paso, o solo funcionan bien cuando se les da un lienzo limpio?
Esto es exactamente lo que investiga el artículo "MT-Web2Code". Los autores crearon una prueba nueva y superdesafiante llamada MT-Web2Code para ver qué tan buenos son realmente los agentes de codificación de IA en este estilo de trabajo de "arreglar sobre la marcha". En lugar de pedirle a la IA que construya una página entera, le dieron 102 páginas web diferentes de 16 categorías distintas (como sitios de compras, noticias y gubernamentales) y le pidieron que realizara dos tipos específicos de tareas a lo largo de múltiples turnos. La primera tarea es la "Reconstrucción Regional", que es como decirle al robot: "Oye, toda esta sección de la página falta; aquí tienes una imagen de cómo debería verse, por favor reconstruye solo esa parte sin tocar el resto". La segunda es la "Modificación Localizada", que es aún más difícil: "Aquí hay tres cositas que se ven mal (tal vez un botón tiene el color equivocado o una línea es demasiado gruesa); por favor, arregla solo esos pequeños puntos".
Para hacer que esta prueba sea justa e imposible de eludir, los investigadores inventaron un ingenioso motor de "Corrupción Inversa". Imagina que tomaron un sitio web perfecto y dorado y luego lo rompieron deliberadamente de formas específicas: ocultando una sección completa o alterando algunas fuentes. Luego, registraron exactamente cómo lo rompieron. El trabajo de la IA es revertir ese proceso: mirar la página rota, averiguar qué está mal y arreglarla para que vuelva al estado perfecto. Debido a que los investigadores saben exactamente cómo se rompió la página, pueden medir el éxito de la IA con extrema precisión. Descubrieron que, si bien estos robots de IA están mejorando, todavía luchan enormemente con este juego de múltiples turnos.
Los resultados fueron un golpe de realidad. Cuando la IA intentaba reconstruir una región faltante, a menudo hacía un trabajo decente en la parte nueva, pero alteraba accidentalmente el contenido circundante, como cambiar el color de fondo de toda la página cuando solo se suponía que debía arreglar un menú. Cuando se le pedía realizar ediciones diminutas y precisas, los robots a menudo fallaban al alinear el código perfectamente con la corrección visual, lo que demuestra que carecen de un control detallado. Quizás lo más preocupante es que el artículo encontró un efecto de "bola de nieve de errores". Si la IA cometía un pequeño error en el primer turno, ese error se transfería y se amplificaba en los turnos siguientes, haciendo que el resultado final fuera mucho peor que si hubiera comenzado de cero cada vez. Curiosamente, los investigadores también descubrieron que darle a la IA una descripción escrita de cómo se veía la parte rota no siempre ayudaba; a veces, incluso confundía al robot, haciendo que dependiera demasiado de las palabras e ignorara la imagen real.
En resumen, este artículo sugiere que, si bien la IA es excelente construyendo sitios web desde cero, todavía está aprendiendo a ser un editor cuidadoso e iterativo. Demuestra que ser bueno en una cosa no significa automáticamente ser bueno en la otra. Los autores esperan que, al utilizar su nuevo sistema de puntuación superpreciso —que verifica tanto la parte arreglada como las partes no tocadas—, puedan ayudar a entrenar a las futuras IA para que se conviertan en diseñadores web paso a paso más fiables, que no rompan el resto de la casa mientras arreglan una sola ventana.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.