← Últimos artículos
🤖 AI

DragOn: A Benchmark and Dataset for Drag-Based GUI Interactions

El artículo presenta DragOn, un benchmark y conjunto de datos exhaustivo que comprende 286 mil capturas de pantalla y 3.5 millones de tareas a través de cuatro dominios para abordar la escasez de datos de interacción de GUI basados en arrastre, demostrando que el ajuste fino en este conjunto de datos mejora significativamente el rendimiento de los modelos de lenguaje visual de vanguardia en tareas complejas de uso de la computadora.

Autores originales: Nathan Bout, Maxime Langevin, Ronan Riochet

Publicado 2026-06-05
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Nathan Bout, Maxime Langevin, Ronan Riochet

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que le estás enseñando a un robot a usar una computadora. Hasta ahora, hemos sido muy buenos enseñando a los robots a hacer clic en un botón. Es como enseñarle a un niño a señalar una imagen y decir: "¡Toca eso!". Tenemos millones de ejemplos de esto, y los robots se están volviendo bastante buenos en ello.

Pero hay una habilidad mucho más difícil: arrastrar.

Piensa en arrastrar como levantar una caja pesada y moverla a un nuevo lugar, o deslizar tu dedo para desplazarte hacia abajo en una página, o agarrar la esquina de una foto para hacerla más grande. Estas acciones requieren que el robot no solo entienda dónde tocar, sino cómo moverse del punto A al punto B. Actualmente, los robots son terribles en esto. Son como niños pequeños que pueden señalar un juguete pero no pueden descubrir cómo recogerlo y llevarlo al otro lado de la habitación.

El artículo presenta una nueva herramienta llamada DragOn para solucionar este problema. Así es como funciona, desglosado de forma sencilla:

1. El Problema: Una Falta de Práctica de "Arrastre"

Los autores notaron que, si bien tenemos enormes bibliotecas de datos para enseñar a los robots a hacer clic, los datos para enseñarles a arrastrar son diminutos —unas 10 a 100 veces más pequeños. Debido a esto, incluso los modelos de IA más inteligentes (como los de OpenAI o Anthropic) tienen dificultades con tareas como resaltar texto, cambiar el tamaño de las ventanas o mover controles deslizantes. Se confunden y suelen fallar.

2. La Solución: "Renderizado como Supervisión"

Para construir una biblioteca masiva de ejemplos de arrastre sin tener que contratar a miles de humanos para que hagan clic y arrastren manualmente, los autores inventaron un truco ingenioso que llaman "Rendering-as-Supervision" (Renderizado como Supervisión).

  • La Forma Antigua: Imagina a un humano mirando una pantalla, dibujando un cuadro alrededor de una palabra y escribiendo sus coordenadas. Esto es lento y costoso.
  • La Forma de DragOn: Imagina que tienes un plano mágico de un documento (como un PDF o una hoja de cálculo). La computadora sabe exactamente dónde está cada letra y celda porque ella misma construyó el documento. En lugar de mirar la imagen y adivinar, la computadora simplemente le pregunta al plano: "¿Dónde está la palabra 'Hola'?". El plano dice: "Está en estas coordenadas exactas".

La computadora luego "renderiza" (dibuja) la imagen y etiqueta automáticamente los puntos de inicio y fin de la acción de arrastre basándose en ese plano. Es como tener un GPS que conoce la ubicación exacta de cada señal de tráfico antes de que siquiera comiences a conducir por la carretera. Esto les permitió crear 3.5 millones de tareas de entrenamiento de forma muy rápida y económica.

3. El Conjunto de Datos: Cuatro Nuevos Escenarios de Juego

No crearon solo un tipo de tarea de arrastre; construyeron cuatro "escenarios de juego" diferentes para que los robots practiquen:

  • Resaltado de Texto: Arrastrar sobre una oración para seleccionarla (como resaltar una palabra en un libro de texto).
  • Selección de Celdas: Arrastrar sobre una cuadrícula en una hoja de cálculo para seleccionar un bloque de números.
  • Cambio de Tamaño de Elementos: Agarrar la esquina de una foto o ventana y tirar de ella para hacerla más grande o más pequeña.
  • Manipulación de Deslizadores: Agarrar una barra de control deslizante (como un control de volumen) y deslizarla hacia la izquierda o hacia la derecha.

En total, crearon 286,000 capturas de pantalla para que los robots las estudien.

4. Los Resultados: La Práctica Hace al Maestro

Los autores probaron este nuevo conjunto de datos en los modelos de IA más inteligentes del mundo.

  • La Línea Base: Los mejores modelos de IA "estándar" (como GPT y Claude) puntuaron por debajo del 30% en estas tareas. Básicamente, estaban fallando más de lo que tenían éxito.
  • El Gran Avance: Los autores tomaron un modelo de IA de código abierto y lo entrenaron específicamente con su nuevo conjunto de datos DragOn.
  • El Resultado: Este modelo entrenado saltó al 35.3% de precisión. Aunque esa cifra pueda no parecer un número enorme, fue una mejora masiva respecto al modelo base (que estaba en un 2.3%) y de hecho superó a los modelos comerciales más caros en tres de los cuatro escenarios.

La Conclusión

El artículo afirma que, al proporcionar a los modelos de IA una biblioteca masiva y de alta calidad de ejemplos de "arrastre" —creada mediante un método de plano automatizado e inteligente— podemos enseñar a los modelos a manejar tareas informáticas complejas mucho mejor. Esto demuestra que los datos son la clave: incluso un modelo estándar de código abierto puede superar a los modelos comerciales más caros si se entrena con el tipo de datos de práctica adecuados.

Los autores esperan que este nuevo benchmark y conjunto de datos ayuden a que los futuros robots se conviertan en "usuarios de computadora" confiables que puedan hacer más que solo hacer clic; finalmente pueden aprender a arrastrar, soltar, cambiar el tamaño y deslizar tal como lo hace un humano.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →