← Últimos artículos
🤖 AI

AliyunConsoleAgent: Training Web Agents in Real-World Cloud Environments via Distillation and Reinforcement Learning

El artículo presenta AliyunConsoleAgent, un marco de trabajo para agentes web de bajo costo que logra un rendimiento cercano al estado del arte en la verificación de la documentación de consolas en la nube mediante un paradigma de entrenamiento de dos etapas que combina el ajuste fino supervisado sobre trayectorias destiladas y el aprendizaje por refuerzo con un sistema de recompensa robusto en entornos del mundo real.

Autores originales: Bojie Rong, Zheyu Shen, Qiaoping Wang, Pengfei Kang, Yang Xu, Yawen Wei, Hanyu Wu, Zhi Zhao, Leihao Pei, Linquan Jiang

Publicado 2026-06-09
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Bojie Rong, Zheyu Shen, Qiaoping Wang, Pengfei Kang, Yang Xu, Yawen Wei, Hanyu Wu, Zhi Zhao, Leihao Pei, Linquan Jiang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres el gerente de un parque temático masivo y en constante cambio (la Consola de la Nube). Cada día, el parque añade nuevas atracciones, cambia las taquillas de los boletos y actualiza las reglas de seguridad. Mientras tanto, los libros de guía (la Documentación) son escritos por un equipo diferente que los actualiza lentamente a mano.

El Problema:
Debido a que el parque cambia tan rápido, los libros de guía se quedan obsoletos rápidamente. Un paso en el libro podría decir: "Haga clic en el botón azul", pero en el parque real, ese botón ahora es rojo, o ha sido reemplido por una pantalla táctil.
Revisar cada una de las instrucciones del libro de guía contra el parque real es una pesadilla. Le tomaría a un equipo humano millones de horas al año hacerlo, y actualmente solo revisan el 1% de las instrucciones. Si no lo hacen, los clientes se pierden y se frustran.

La Solución Antigua (y por qué falló):
La empresa intentó contratar "robots superinteligentes" (Modelos Propietarios de Frontera). Estos robots son increíblemente inteligentes y pueden leer los libros de guía y navegar por el parque perfectamente. Sin embargo, son caros (es como contratar a un equipo de doctores en PhD para cada revisión) y riesgosos (tienes que mostrarles tus mapas privados del parque, lo cual viola las reglas de seguridad). No puedes permitirte usarlos para las millones de revisiones necesarias.

La Nueva Solución: AliyunConsoleAgent
Los autores construyeron su propio "robot entrenable" (un modelo de IA de 32 mil millones de parámetros) que es más barato y seguro de ejecutar en sus propios servidores. Pero un robot estándar no es lo suficientemente inteligente para manejar un parque temático caótico y cambiante. Por ello, utilizaron un método de entrenamiento de dos pasos:

1. La Fase de "Sombreo" (Ajuste Fino Supervisado)

Primero, tomaron a los robots superinteligentes e hicieron que el nuevo robot los sombra (seguirlos de cerca).

  • La Analogía: Imagina a un maestro chef cocinando un plato complejo. El nuevo robot observa al maestro, memorizando cada corte, cada movimiento de cuchara y cada sazón.
  • El Resultado: El nuevo robot aprende lo básico de cómo navegar por el parque y seguir instrucciones. Se vuelve bastante bueno, pero solo está copiando. Si el parque cambia ligeramente, se confunde porque no realmente entiende el objetivo, solo recuerda los pasos.

2. La Fase de "Ensayo y Error" (Aprendizaje por Refuerzo)

Después, dejaron al robot suelto en una versión simulada del parque para aprender haciendo.

  • El Desafío: En un entorno de nube real, el robot a menudo falla no porque sea estúpido, sino porque el "parque" no está listo. Por ejemplo, intenta eliminar un servidor, pero el servidor aún no existe. Si el robot es castigado por esto, aprende la lección equivocada (que es malo eliminando servidores) en lugar de la correcta (que necesita construir el servidor primero).
  • La Solución (El Despliegue de Alta Determinación): El equipo construyó un "campo de entrenamiento" especial utilizando Terraform (una herramienta que construye infraestructura como si fueran piezas de Lego). Antes de que el robot intente realizar una tarea, este sistema construye automáticamente los prerrequisitos exactos (como construir el servidor, configurar la red) para que el robot pueda tener éxito si realiza los movimientos correctos.
  • El Sistema de Recompensa: En lugar de un humano calificando al robot, utilizan un Juez de Doble Canal:
    1. El Verificador de Reglas: Observa los "registros de auditoría" oficiales (como las cámaras de seguridad del parque) para ver si la acción realmente ocurrió. ¿Se eliminó el servidor? Sí/No. Esto es 100% objetivo.
    2. El Panel de Jueces: Si no hay un registro claro, otros dos modelos de IA actúan como jueces. Solo otorgan un "aprobado" si ambos están de acuerdo en que el robot tuvo éxito. Esto evita que el robot "engañe" o truque a un solo juez.

El Resultado

Después de este entrenamiento, el robot evolucionó de un seguidor sin mente a un solucionador de problemas autónomo.

  • Antes: Si el manual decía "Desactivar la renovación automática" pero el interruptor ya estaba desactivado, el robot simplemente se detenía y decía "No puedo hacerlo".
  • Después: El robot piensa: "Espera, no puedo desactivarlo si ya está desactivado. Necesito activarlo primero para poder luego desactivarlo y así demostrar que lo hice". Descubrió la lógica por su cuenta.

La Conclusión:

  • Rendimiento: Su nuevo robot (AliyunConsoleAgent-32B) es casi tan bueno como los "super-robots" caros (con una diferencia de solo 1.8%).
  • Costo: Cuesta un 92% menos de ejecutar.
  • Impacto: Utilizaron este sistema para auditar más de 54,000 instrucciones y encontraron casi 4,400 errores reales que los equipos de producto pudieron corregir.

En resumen, enseñaron a un robot local y asequible a pensar como un genio, haciendo que primero sombreara a un genio y, luego, dejándolo practicar en un gimnasio de entrenamiento perfectamente preparado donde pudiera aprender de sus errores sin ser castigado por cosas fuera de su control.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →