Qwen-CUA: Native Computer Use for (almost) Everything
El artículo presenta Qwen-CUA, un agente nativo de uso de computadora construido sobre una base de mezcla de expertos de 397B que opera únicamente a través de capturas de pantalla y eventos de entrada sin depender de árboles DOM, logrando un rendimiento de vanguardia en evaluaciones de uso de computadora mediante el despliegue en la nube a gran escala, la optimización de recompensa verificable y una arquitectura escalable.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina un mundo donde tu computadora no solo espera a que hagas clic en botones, sino que realmente observa lo que haces y aprende a hacerlo por ti. Este es el emocionante horizonte de los "agentes de IA", una rama de la ciencia donde se enseña a las computadoras a actuar como humanos en el mundo digital. Durante mucho tiempo, estos agentes fueron como estudiantes brillantes que solo podían leer libros de texto (código) o seguir manuales de instrucciones estrictos (APIs). Eran excelentes en matemáticas y lógica, pero si les pedías que usaran un programa viejo y desordenado o un sitio web que cambia cada vez que lo actualizas, se perdían. No podían "ver" la pantalla de la misma manera que un humano; necesitaban planos especiales de la estructura del sitio web para saber dónde estaban los botones. Pero la mayor parte de nuestras vidas digitales ocurre en pantallas que no tienen esos planos. Este artículo aborda el desafío de enseñar a una IA a ser un verdadero aprendiz digital: uno que mira una pantalla, descubre qué hacer y hace clic o escribe tal como lo haría una persona, sin necesidad de ningún atajo especial o mapas ocultos.
El equipo detrás de esta investigación presenta Qwen-CUA, un nuevo tipo de agente de IA diseñado para ser un usuario de computadora "nativo". Piensa en esto como enseñar a un robot a conducir un coche. En lugar de darle al robot un mapa digital perfecto de cada carretera y semáforo (que no existe para muchos programas de software antiguos o complejos), le enseñaron al robot a mirar por la ventana, ver la carretera y girar el volante basándose en lo que ve. Qwen-CUA solo "ve" capturas de pantalla de la pantalla de la computadora y solo "actúa" enviando comandos de teclado y ratón. No echa un vistazo bajo el capó del código ni le pide ayuda al software; simplemente observa y aprende.
Para que este robot sea lo suficientemente inteligente como para manejar tareas de la vida real, los investigadores tuvieron que construir un enorme gimnasio de entrenamiento. Crearon una flota en la nube con casi 100,000 CPUs virtuales (imagina una ciudad de miles de computadoras trabajando a la vez) y configuraron alrededor de 40,000 tareas diferentes para que la IA practicara. Estas tareas variaban desde cosas simples como organizar archivos hasta flujos de trabajo complejos y de múltiples pasos en software profesional. La IA no solo recibía un "buen trabajo" o un "inténtalo de nuevo" al final; el sistema fue diseñado para verificar si la tarea se había realizado correctamente, permitiendo que la IA aprendiera de sus errores una y otra vez.
Los resultados son impresionantes. En pruebas realizadas en ocho bancos de pruebas diferentes, Qwen-CUA superó consistentemente a su versión anterior, Qwen3.7, e incluso se mantuvo a la par de algunos de los sistemas de IA más potentes y costosos disponibles hoy en día. Por ejemplo, en una prueba llamada OSWorld-Verified, que mide qué tan bien puede una IA manejar tareas cotidianas de escritorio, Qwen-CUA obtuvo una puntuación de 86.2, mientras que el modelo anterior obtuvo 73.3. Cuando escalaron esto a un modelo aún más grande llamado Qwen-CUA-Max (con más de un billón de parámetros), la puntuación subió a 87.6.
Una de las cosas más geniales de este artículo es cómo maneja las tareas largas y complicadas. Imagina intentar recordar una historia que leíste hace una semana mientras escribes un capítulo nuevo. La IA tenía que recordar cómo se veía la pantalla hace muchos pasos para saber en qué parte de su tarea se encontraba. Los investigadores resolvieron esto dándole a la IA una "memoria visual" que retiene las últimas 20 capturas de pantalla y "pliega" inteligentemente las más antiguas en un resumen, para que no se sienta abrumada. Esto permitió que la IA mantuviera la calma durante flujos de trabajo largos sin olvidar el principio de la historia.
El artículo también analizó la seguridad. Probaron la IA contra "RedTeamCUA", un desafío donde la IA es engañada por instrucciones falsas ocultas en la pantalla. El nuevo modelo fue mucho mejor ignorando estos trucos, reduciendo la tasa de éxito de los ataques de un 36.6% a un 16.4%, mientras seguía realizando sus propias tareas.
Finalmente, los investigadores exploraron un enfoque "híbrido". Descubrieron que si permitían que la IA utilizara una herramienta de línea de comandos (como una varita mágica basada en texto para operaciones de archivos) junto con sus habilidades de ratón y teclado, podía completar las tareas más rápido. Sin embargo, la IA a veces cambiaba de herramientas en el momento equivamente, por lo que, aunque era más rápida, aún no era perfecta. Los autores sugieren que, con más entrenamiento, esta mezcla de observación visual y comandos basados en texto podría ser la clave para hacer que los agentes de IA sean verdaderamente eficientes.
En resumen, este artículo demuestra que no necesitamos puentes especiales para conectar la IA con nuestras computadoras. Al enseñar a la IA a simplemente mirar la pantalla y actuar como un humano, podemos construir agentes que estén listos para abordar casi cualquier software, desde las aplicaciones más recientes hasta los programas más antiguos, todo mientras aprenden de una enorme cantidad de práctica en el mundo real.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.