← Últimos artículos
💬 NLP

Scaling Agents for Computer Use

El artículo presenta Behavior Judge (BJudge), un marco que mejora la fiabilidad de los agentes de uso de computadoras mediante la evaluación y selección entre múltiples ejecuciones de despliegue utilizando narrativas de comportamiento, logrando un rendimiento de vanguardia en OSWorld que supera las capacidades de nivel humano.

Autores originales: Gonzalo Gonzalez-Pumariega, Vincent Tu, Chih-Lun Lee, Jiachen Yang, Ang Li, Xin Eric Wang

Publicado 2026-02-05
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Gonzalo Gonzalez-Pumariega, Vincent Tu, Chih-Lun Lee, Jiachen Yang, Ang Li, Xin Eric Wang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot a lavar tu ropa, cocinar la cena y pagar tus cuentas observando una pantalla de computadora. Esto es lo que se supone que deben hacer los "Agentes de Uso de Computadora" (CUA, por sus siglas en inglés). Son programas de IA que pueden hacer clic en botones, escribir texto y navegar por software tal como lo hace un humano.

Sin embargo, hay un gran problema: estos robots son frágiles. Si cometen un error minúsculo al principio —como hacer clic en la ventana equivocada o no ver una ventana emergente— ese error se convierte en una bola de nieve. Para cuando llegan al paso 50, están completamente perdidos. Es como intentar construir una casa de naipes en una habitación con mucho viento; un pequeño tambaleo arruina todo el proceso.

La forma antigua: "Uno y listo"

Anteriormente, los investigadores intentaron solucionar esto diciéndole al robot que "pensara más profundamente" antes de realizar un solo movimiento. Le pedían a la IA que generara cinco ideas diferentes para el siguiente clic y eligiera la mejor. Pero esto es como pedirle a una sola persona que piense en cinco rutas diferentes para ir a la tienda, elija la mejor y luego la recorra. Si esa persona se confunde en la primera intersección, todo el viaje falla.

La nueva idea: "La carrera" (Escalamiento Ancho)

Los autores de este artículo proponen una estrategia diferente llamada Escalamiento Ancho (Wide Scaling). En lugar de confiar en un solo robot para que lo haga bien, envían a diez robots diferentes al mismo tiempo para que intenten la misma tarea.

Piénsalo como una carrera con diez corredores. Incluso si el Corredor #3 tropieza y el Corredor #7 se pierde, tal vez el Corredor #5 encuentre un atajo y gane. El objetivo es tener diez intentos diferentes ejecutándose en paralelo y luego elegir al ganador.

El cuello de botella: ¿Cómo eliges al ganador?

Aquí está la parte difícil: ¿Cómo sabes cuál de los diez robots tuvo éxito realmente?

  • El Problema: Ver diez videos de una hora de un robot intentando realizar una tarea es abrumador. La mayor parte del video es aburrido o irrelevante (como el robot mirando fijamente una pantalla en blanco). Además, muchas tareas tienen más de una forma "correcta" de terminarse. Un simple guion no puede determinar fácilmente si un robot tuvo éxito o falló solo con mirar las grabaciones de pantalla puras.
  • La Analogía: Imagina que intentas juzgar un concurso de cocina viendo diez películas de 3 horas de chefs cocinando. Te cansarías y perderías los momentos importantes. Necesitas una forma de resumir la acción.

La solución: "El Juez de Comportamiento" (BJudge)

Los autores presentan un nuevo sistema llamado Juez de Comportamiento (BJudge). Así es como funciona, paso a paso:

  1. La carrera: Ejecutan la tarea diez veces simultáneamente con diferentes modelos de IA.
  2. El Traductor (Generador de Narrativa de Comportamiento): En lugar de mostrarle al juez el video puro de la pantalla, este sistema actúa como un traductor. Observa el intento de cada robot y escribe una historia corta y clara (una "narrativa") de lo que sucedió.
    • En lugar de: "El robot movió el ratón a los píxeles 400, 200, hizo clic, la pantalla se actualizó, se abrió una nueva ventana..."
    • Escribe: "El robot hizo clic en 'Guardar' y el documento se guardó exitosamente en la carpeta".
    • Filtra el ruido y se enfoca solo en la causa y efecto: "Hice X, y sucedió Y".
  3. El Juez (Evaluador Comparativo): Ahora, en lugar de ver diez horas de video, el Juez lee diez historias cortas. Las compara lado a lado. "La Historia A dice que el archivo fue guardado. La Historia B dice que el archivo fue eliminado. La Historia A gana".

Los Resultados

Cuando lo probaron en un benchmark llamado OSWorld (una colección de tareas informáticas del mundo real):

  • Lo mejor de lo anterior: El mejor método anterior logró correctamente aproximadamente el 63.4% de las tareas.
  • Nivel Humano: Los humanos logran aproximadamente el 72.36% correctamente.
  • El Nuevo Método (BJudge): Su sistema alcanzó el 72.6%.

No solo superaron a los robots anteriores; superaron a los humanos.

Por qué esto importa

El artículo demuestra que la clave para hacer que los agentes de IA sean confiables no es solo hacerlos más inteligentes individualmente, sino ejecutar muchos de ellos a la vez y tener un sistema inteligente para elegir el mejor resultado.

También probaron esto en diferentes sistemas operativos (Windows y Android) y descubrieron que funcionaba bien allí también, demostrando que esta estrategia de "carrera y juicio" es una forma universal de hacer que la IA que usa computadoras sea más robusta.

En resumen: Para solucionar la naturaleza "frágil" de las computadoras con IA, no intentes crear un robot perfecto. Crea diez, deja que compitan, traduce sus intentos desordenados en historias simples y deja que un juez inteligente elija al ganador. Este simple cambio les permitió superar el rendimiento humano en tareas digitales complejas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →