← Últimos artículos
💬 NLP

Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining

El artículo presenta Video2GUI, un marco automatizado que sintetiza un conjunto de datos a gran escala de 12 millones de trayectorias de interacción con interfaces gráficas a partir de videos de internet sin etiquetar para superar la escasez de datos y mejorar significativamente el rendimiento de generalización de los agentes multimodales de GUI.

Autores originales: Weimin Xiong, Shuhao Gu, Bowen Ye, Zihao Yue, Lei Li, Feifan Song, Sujian Li, Hao Tian

Publicado 2026-05-15
📖 4 min de lectura☕ Lectura para el café

Autores originales: Weimin Xiong, Shuhao Gu, Bowen Ye, Zihao Yue, Lei Li, Feifan Song, Sujian Li, Hao Tian

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que quieres enseñar a un robot cómo usar una computadora, un teléfono o un sitio web. Para hacer esto, necesitas mostrarle millones de ejemplos de personas haciendo clic en botones, escribiendo texto y desplazándose por páginas.

El problema es que encontrar estos ejemplos es increíblemente difícil. Por lo general, los investigadores tienen que contratar personas para grabar y etiquetar manualmente cada clic individual, lo cual es lento, costoso y los limita a solo unos pocos tipos de aplicaciones. Es como intentar aprender un idioma leyendo solo unas pocas páginas de un diccionario.

Video2GUI es un nuevo sistema que resuelve esto convirtiendo todo el internet en un aula gigante y gratuita. Así es como funciona, usando algunas metáforas simples:

1. El Gran Filtro (Encontrando los Videos Correctos)

El internet está lleno de videos, pero la mayoría son inútiles para enseñar a un robot (como programas de cocina o videos de gatos). Los investigadores comenzaron con 500 millones de videos de YouTube.

  • El Tamizado Rudo: Primero, usaron una IA inteligente para escanear los títulos y descripciones. Esto es como un bibliotecario revisando rápidamente los lomos de los libros para ver si tratan sobre "computadoras" antes de abrirlos siquiera. Esto redujo la pila a 20 millones.
  • El Tamizado Fino: Luego, usaron una IA más avanzada para realmente "ver" el primer minuto de esos videos. Verificó: ¿La pantalla está clara? ¿La voz explica los pasos bien? ¿Realmente muestra cómo usar el software? Esto es como un profesor estricto calificando los videos para asegurar que sean tutoriales de alta calidad.
  • El Resultado: Terminaron con 4.2 millones de videos tutoriales de alta calidad.

2. El Traductor (Convirtiendo Video en Instrucciones)

Ahora tenían los videos, pero un robot no puede simplemente "ver" un video y entenderlo como lo hace un humano. El video necesita ser traducido a una lista estructurada de instrucciones.

  • El Proceso: Usaron una IA poderosa (como un traductor superinteligente) para ver los videos y descomponerlos. Identificó el objetivo (por ejemplo, "Comprar zapatos"), los pasos dados y el momento exacto en que ocurrió cada clic.
  • La Magia: La IA no solo adivinó; miró los fotogramas del video para encontrar las coordenadas exactas de los botones que se hacían clic. Convirtió un video de 10 minutos de alguien comprando en línea en un mapa preciso, paso a paso: "A los 0:05, haz clic en la barra de búsqueda. A los 0:10, escribe 'zapatillas'."

3. La Biblioteca (WildGUI)

Todas estas instrucciones traducidas se recopilaron en una nueva biblioteca masiva llamada WildGUI.

  • La Escala: Esta biblioteca contiene 12 millones de trayectorias de interacción que cubren más de 1,500 aplicaciones y sitios web diferentes.
  • La Variedad: Incluye todo, desde escritorios de Windows hasta teléfonos Android y computadoras Mac. Es como tener una biblioteca que contiene cada forma posible en que un humano ha usado alguna vez una computadora, todo organizado y listo para que un robot lo estudie.

4. El Entrenamiento (Enseñando al Robot)

Los investigadores tomaron dos modelos de IA existentes (Qwen2.5-VL y Mimo-VL) y los "alimentaron" con esta nueva biblioteca.

  • El Resultado: Después de estudiar este conjunto de datos masivo, los robots mejoraron significativamente. Mejoraron entre un 5% y un 20% en varias pruebas.
  • La Prueba: Ahora podían encontrar botones, hacer clic en las cosas correctas y navegar sitios web complejos mucho mejor que antes, igualando o superando a los mejores robots existentes actualmente.

La Conclusión

El artículo afirma que al automatizar el proceso de convertir videos de internet en datos de entrenamiento, crearon un conjunto de datos masivo y diverso que hace que los agentes de IA sean mucho más inteligentes al usar computadoras. No inventaron un nuevo tipo de robot; simplemente le dieron a los existentes un libro de texto mucho mejor, más grande y más diverso para estudiar.

Han liberado este conjunto de datos y las herramientas utilizadas para construirlo para que otros investigadores puedan usarlos y crear agentes de IA aún mejores en el futuro.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →