← Últimos artículos
💬 NLP

VisEditBench: Can Vision-Language Models Edit Visualization Code from Multimodal Feedback?

Este artículo presenta VisEditBench, un banco de pruebas exhaustivo de 1.395 tareas anotadas por humanos diseñado para evaluar la capacidad de los modelos de visión y lenguaje para editar código de visualización basado en retroalimentación multimodal, revelando brechas de rendimiento significativas en los modelos actuales y proponiendo VisEditAgent, un marco fundamentado en la renderización que mejora sustancialmente la precisión de la edición.

Autores originales: Mizanur Rahman, Arshia Azimlu, Shadikur Rahman, Md Tahmid Rahman Laskar, Amran Bhuiyan, Shafiq Joty, Enamul Hoque Prince

Publicado 2026-08-12
📖 3 min de lectura☕ Lectura para el café

Autores originales: Mizanur Rahman, Arshia Azimlu, Shadikur Rahman, Md Tahmid Rahman Laskar, Amran Bhuiyan, Shafiq Joty, Enamul Hoque Prince

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un chef que acaba de aprender a cocinar una tortilla perfecta de un libro de recetas. Puedes seguir las instrucciones, romper los huevos y voltear la sartén. Pero, ¿qué sucede cuando tu amigo le da un bocado, hace una mueca y dice: "Está demasiado salada y el queso está quemado en el fondo"? O, ¿qué pasa si te entrega la foto de una tortilla diferente y dice: "Quiero la mía exactamente como esta"? De repente, tu trabajo no es solo seguir una receta; se trata de corregir un error o copiar un estilo mientras mantienes los huevos y el calor en su punto justo. Este es el mundo de la visualización de datos, donde las computadoras intentan convertir números en imágenes como diagramas y gráficos.

Durante un tiempo, los científicos han enseñado a las computadoras cómo escribir las "recetas" (código) para crear estas imágenes desde cero. Pero en el mundo real, rara vez queremos solo una imagen nueva; usualmente tenemos una ya existente que se ve un poco extraña, o queremos cambiar su estilo para que coincida con un informe. Esto se llama retroalimentación multimodal: usar una mezcla de instrucciones de texto, la imagen real del gráfico y el código que lo creó para decirle a la computadora qué debe arreglar. La gran pregunta es: ¿Pueden estas computadoras inteligentes realmente "ver" qué está mal en un gráfico y arreglarlo sin romper los datos subyacentes?

Este artículo, titulado VisEditBench, introduce un nuevo patio de juegos para probar exactamente eso. Los investigadores construyeron una enorme colección de 1,395 desafíos de edición del mundo real, como un "examen de conducir" para los creadores de gráficos por IA. Descubrieron que, aunque los mejores modelos de IA están mejorando en la escritura de código, todavía son bastante torpes al corregir gráficos basados en retroalimentación visual. El modelo superior, Claude-4.6-Sonnet, logró pasar aproximadamente el 74.46% de las pruebas, pero la mayoría de los modelos de código abierto tuvieron dificultades, manteniéndose por debajo del 50%. ¿La parte más difícil? Cambiar el estilo de un gráfico para que coincida con una imagen de referencia; incluso el mejor modelo solo acertó el 55.71% de las veces.

Para ayudar a que estos modelos mejoren, los autores crearon una nueva herramienta llamada VisEditAgent. Piensa en esto como darle a la IA un ciclo de "intentar, fallar y corregir". En lugar de adivinar la respuesta una sola vez, el agente escribe varias versiones diferentes del código, realmente dibuja los gráficos, verifica si se ven bien y luego los ajusta hasta que son perfectos. Cuando usaron este método con un modelo fuerte, la tasa de éxito saltó del 55.75% al 67.99%. Esto sugiere que el secreto para arreglar gráficos no es solo ser inteligente; es ser capaz de mirar tu propio trabajo, darse cuenta de que está mal y volver a intentarlo. El artículo concluye que, si bien estamos progresando, enseñar a las computadoras a editar visualizaciones con el mismo cuidado que un diseñador humano es todavía un trabajo en progreso.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →