← Últimos artículos
🤖 AI

SCALECUA: Scaling Computer Use Agents with Verifiable Task Synthesis and Efficient Online RL

ScaleCUA es un marco unificado que lleva a los agentes de uso de computadora de código abierto al rendimiento de vanguardia mediante el abordaje de la escasez de datos y la ineficiencia de entrenamiento a través de VeriGen para la síntesis de tareas verificables, Frontier Sampling para la asignación optimizada de muestras y Segmentación de Contexto Visual para la aceleración del entrenamiento.

Autores originales: Bowen Lv, Xiao Liu, Yanyu Ren, Hanyu Lai, Bohao Jing, Hanchen Zhang, Yanxiao Zhao, Shuntian Yao, Jie Tang, Yuxiao Dong

Publicado 2026-07-14
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Bowen Lv, Xiao Liu, Yanyu Ren, Hanyu Lai, Bohao Jing, Hanchen Zhang, Yanxiao Zhao, Shuntian Yao, Jie Tang, Yuxiao Dong

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot a usar una computadora tal como lo hace un humano. El robot tiene que mirar la pantalla, hacer clic en botones, escribir en terminales y descubrir cómo instalar software u organizar archivos. Este es el mundo de los Agentes de Uso de Computadora (CUAs, por sus siglas en inglés).

Durante mucho tiempo, enseñar a estos robots ha sido como intentar aprender un nuevo videojuego sin un marcador de puntos. Puedes jugar, pero no sabes si realmente ganaste hasta que un humano observa todo el proceso y dice: "¡Buen trabajo!" o "Inténtalo de nuevo". Esto hace que el aprendizaje sea súper lento y costoso porque no puedes simplemente ejecutar miles de juegos a la vez si necesitas que un humano califique cada uno de ellos.

Presentamos SCALECUA, un nuevo marco de trabajo que actúa como un campamento de entrenamiento supercargado y autocorrectivo para estos agentes robóticos. Resuelve dos grandes problemas: encontrar suficientes tareas de práctica que tengan una condición clara de "victoria" y hacer que el proceso de entrenamiento sea lo suficientemente rápido como para que realmente funcione.

El problema del marcador: Entra VERIGEN

El primer obstáculo era que la mayoría de las tareas de computadora no tienen una señal integrada de "Fin del juego, has ganado". Para solucionar esto, los investigadores construyeron VERIGEN.

Imagina a VERIGEN como un equipo de tres entrenadores robóticos trabajando en un patio de juegos virtual gigante e infinito (contenedores Docker).

  1. El Proponente sugiere una tarea, como "Instala este tema específico para tu computadora".
  2. El Juez verifica si las instrucciones tienen sentido y si la "condición de victoria" es lógica.
  3. El Verificador intenta realizar la tarea en la computadora virtual para ver si es posible y si la "condición de victoria" realmente se activa.

Si la tarea falla en cualquiera de estas comprobaciones, se descarta. Si pasa, se convierte en una tarea de entrenamiento verificada. ¿Lo más genial? Este equipo de entrenadores trabaja en paralelo. Pueden ejecutar más de 100 de estos entrenadores al mismo tiempo, interactuando con más de 100 computadoras virtuales simultáneamente.

El resultado: generaron más de 24,000 tareas verificadas y casi 3,000 tareas de alta calidad específicamente para el entrenamiento. Este es un salto masivo en comparación con métodos anteriores, que a menudo dependían de listas de tareas diminutas y escritas manualmente.

La estrategia de entrenamiento: Muestreo de la Frontera

Una vez que tienes una montaña de tareas, ¿cómo eliges cuáles practicar? Un error común es elegir tareas al azar. Pero imagina que estás aprendiendo a montar en bicicleta:

  • Si eliges una tarea que es demasiado fácil (montar en terreno plano), no aprendes nada.
  • Si eliges una tarea que es demasiado difícil (montar bajando un acantilado empinado), te estrellas y te desanimas.
  • El punto ideal es la "frontera de aprendizaje": las tareas que apenas estás empezando a comprender.

SCALECUA utiliza una estrategia inteligente llamada Muestreo de la Frontera (Frontier Sampling). Mantiene un registro de qué tan bien lo está haciendo el robot en cada una de las tareas. Luego, enfoca su tiempo de práctica en las tareas donde el robot se encuentra justo alrededor de una tasa de éxito del 50%. Esto asegura que el robot siempre esté desafiando sus límites sin quedarse estancado en desafíos imposibles o aburrido por tareas fáciles.

El truco de velocidad: Segmentación de Contexto Visual

Aquí está la parte difícil: las tareas de computadora pueden tomar mucho tiempo. Una sola tarea puede involucrar 47 pasos (como el ejemplo en el artículo donde el robot instala un tema). Si intentas recordar cada captura de pantalla desde el paso 1 hasta el paso 47, tu cerebro (o la memoria de la computadora) se abrumará y el entrenamiento se volverá extremadamente lento.

Los investigadores resolvieron esto con la Segmentación de Contexto Visual. Imagina que estás leyendo una historia larga, pero en lugar de tener todo el libro abierto, solo mantienes las últimas páginas visibles en tu escritorio. Recuerdas la trama de las páginas anteriores como un resumen, pero solo miras las páginas recientes para tomar tu siguiente decisión.

Esta técnica mantiene una "ventana deslizante" de las capturas de pantalla más recientes (unas 5 a 8 imágenes) mientras resume las anteriores como texto. Esto mantiene la memoria del robot fresca y rápida. El artículo encontró que esto hizo que el proceso de entrenamiento fuera 2.83 veces más rápido que el método antiguo de intentar recordar cada paso a la vez, sin hacer que el robot olvide cómo resolver el problema.

Los resultados: ¿Funcionó?

El equipo probó este nuevo sistema en un modelo llamado Qwen3.5-9B (un modelo de lenguaje visual de 9 mil millones de parámetros).

  • En OSWorld (un benchmark para tareas generales de escritorio), el robot logró una tasa de éxito del 68.7%.
  • En ScienceBoard (un benchmark para software científico complejo), alcanzó un 54.0%.

Estas cifras son significativas. El artículo señala que este modelo de 9 mil millones de parámetros superó a otros modelos de código abierto que son cuatro veces más grandes (como el EvoCUA de 32 mil millones de parámetros). También superó a algunos modelos propietarios, lo que sugiere que el método de entrenamiento importa tanto como el tamaño del cerebro del robot.

Lo que esto NO hace

Es importante saber qué no afirma este artículo.

  • No es una varita mágica para todas las computadoras todavía. Las pruebas se realizaron en escritorios basados en Ubuntu (un tipo específico de computadora Linux). Los autores admiten que aún no han probado esto en Windows o macOS, por lo que no sabemos si funciona allí.
  • Tiene un límite de tiempo. Los episodios de entrenamiento se limitaron a 50 turnos de interacción. Aunque esto cubre la mayoría de las tareas, los autores sugieren que podría no ser suficiente para flujos de trabajo ultra largos y complejos que requieren cientos de pasos.
  • No es un problema resuelto. El artículo presenta esto como un nuevo marco de trabajo que establece un "estado del arte" entre los agentes de código abierto, pero reconoce que la generalización a otros sistemas y escalas sigue siendo un trabajo futuro.

En resumen, SCALECUA es una receta ingeniosa para enseñar a los robots a usar computadoras mediante la generación de sus propios exámenes de práctica, enfocándose en el nivel de dificultad "justo" y recordando lo suficiente del pasado para mantenerse rápido. Demuestra que, con las herramientas de entrenamiento adecuadas, incluso un cerebro robótico más pequeño puede superar a otros mucho más grandes.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →