← Últimos artículos
💻 computer science

Pattern over Pixels: Measuring Pattern Completion Bias in Multimodal Code Generation

Este artículo presenta un punto de referencia que demuestra que los modelos de lenguaje de gran tamaño multimodales exhiben un fuerte sesgo de completado de patrones al convertir capturas de pantalla de páginas web a código, sobrescribiendo frecuentemente elementos visualmente perturbados con patrones de interfaz de usuario repetidos incluso cuando poseen la capacidad de razonamiento para identificar las anomalías.

Autores originales: Khai-Nguyen Nguyen, Oscar Chaparro, Antonio Mastropaolo

Publicado 2026-08-05
📖 4 min de lectura☕ Lectura para el café

Autores originales: Khai-Nguyen Nguyen, Oscar Chaparro, Antonio Mastropaolo

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que le estás enseñando a un robot a pintar un cuadro basándose en una foto que le muestras. Le das al robot una cámara y un conjunto de instrucciones: "Mira esta foto y dibuja exactamente lo que ves". En el mundo de la informática, esto se llama aprendizaje "multimodal", donde una computadora utiliza tanto sus "ojos" (para ver imágenes) como su "cerebro" (para entender texto y código). Recientemente, estos robots se han vuelto muy buenos mirando capturas de pantalla de sitios web y escribiendo el código informático (HTML y CSS) necesario para reconstruirlos. Es como mostrarle a un robot la foto de una casa y que este sea capaz de escribir instantáneamente el plano para construirla. Pero aquí está la parte complicada: los robots también son excelentes adivinando patrones. Si les muestras una fila de bolas rojas idénticas, y luego una bola azul, podrían adivinar que la última es roja también, solo porque "rojo" es el patrón que esperan. Este artículo plantea una pregunta aterradora: cuando un robot ve un sitio web, ¿realmente mira los píxeles o simplemente adivina basándose en lo que cree que debería haber allí?

Los investigadores detrás de este estudio, Khai-Nguyen Nguyen, Oscar Chaparro y Antonio Mastropaolo, decidieron probar esto jugando un juego de "encuentra las diferencias" con algunos de los robots de IA más inteligentes disponibles. Construyeron una prueba especial llamada "Pattern2Code". Imagina una página web llena de una pila de cartas idénticas, como una baraja de cartas. Los investigadores tomaron una carta y, secretamente, la hicieron un poco más ancha o cambió el tamaño de la fuente del texto en ella. Luego, mostraron la captura de pantalla de este mazo ligeramente "defectuoso" a cinco modelos de IA diferentes y les pidieron que escribieran el código para el ancho o el tamaño de la fuente de esa única carta extraña. El truco era que el código que se les dio para observar mostraba que todas las demás cartas eran del mismo tamaño, creando un patrón fuerte.

Los resultados fueron un poco como observar a un mago que conoce el truco pero decide hacerlo de todos modos. Los modelos de IA fueron sorprendentemente malos ignorando el patrón. Cuando la carta "extraña" era un cambio grande y obvio (como una carta que era un 20% más ancha), la mejor IA acertó aproximadamente el 69% de las veces. Pero cuando el cambio era diminuto y sutil (como un tamaño de fuente que era solo un poco más grande), los modelos casi abandonaron por completo el mirar la imagen. En su lugar, simplemente escribieron código diciendo que "todo es al 100%", coincidiendo con el patrón, a pesar de que la imagen claramente mostraba algo diferente. De hecho, para los cambios de texto sutiles, los modelos fallaron más del 80% de las veces, siguiendo ciegamente el patrón en lugar de la evidencia visual.

El estudio encontró que esta "ceguera de patrón" empeora cuando la imagen es más difícil de ver claramente. Si los investigadores añadieron "ruido" visual (como bloques grises aleatorios) sobre la imagen, los modelos se confundieron aún más y se aferraron al patrón. También descubrieron que si la carta extraña estaba en medio de la fila, rodeada de cartas normales, era más fácil para la IA detectarla. Pero si estaba en el extremo, la IA tenía más probabilidades de pasarla por alto. Curiosamente, incluso cuando los modelos de IA escribieron en su "proceso de pensamiento" que vieron la carta extraña y calcularon el tamaño correcto, a menudo ignoraron su propio cálculo y cambiaron su respuesta para que coincidiera con el patrón de todos modos. Es como si el robot viera la bola azul, pensara "esa es azul", pero luego dijera: "Espera, todos los demás son rojos, así que diré que es rojo también".

Los investigadores concluyen que, si bien estas herramientas de IA son increíasbles para obtener la forma general de un sitio web, no pueden ser confiables para obtener los detalles diminutos y precisos sin que un humano verifique su trabajo. Cuanto más sutil es el detalle, más probable es que la IA "alucine" un patrón que no está ahí. Esto sugiere que, por ahora, debemos tratar el código generado por IA como un borrador que necesita un ojo humano cuidadoso para detectar los pequeños errores que el robot es demasiado ansioso por ignorar.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →