← Derniers articles
🤖 AI

AliyunConsoleAgent: Training Web Agents in Real-World Cloud Environments via Distillation and Reinforcement Learning

Le document présente AliyunConsoleAgent, un cadre d'agent web rentable qui atteint des performances proches de l'état de l'art pour la vérification de la documentation des consoles cloud grâce à un paradigme d'entraînement en deux étapes combinant l'ajustement fin supervisé sur des trajectoires distillées et l'apprentissage par renforcement avec un système de récompense robuste dans des environnements réels.

Auteurs originaux : Bojie Rong, Zheyu Shen, Qiaoping Wang, Pengfei Kang, Yang Xu, Yawen Wei, Hanyu Wu, Zhi Zhao, Leihao Pei, Linquan Jiang

Publié 2026-06-09
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Bojie Rong, Zheyu Shen, Qiaoping Wang, Pengfei Kang, Yang Xu, Yawen Wei, Hanyu Wu, Zhi Zhao, Leihao Pei, Linquan Jiang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous soyez le gestionnaire d'un parc à thème massif et en constante évolution (la Console Cloud). Chaque jour, le parc ajoute de nouvelles attractions, modifie les guichets de billetterie et met à jour les règles de sécurité. Pendant ce temps, les guides de voyage (la Documentation) sont rédigés par une équipe différente qui les met à jour lentement, à la main.

Le Problème :
Parce que le parc change rapidement, les guides deviennent vite obsolètes. Une étape dans le guide peut dire : « Cliquez sur le bouton bleu », mais dans le parc réel, ce bouton est devenu rouge, ou a été remplacé par un écran tactile. Vérifier chaque instruction du guide par rapport au parc réel est un cauchemar. Il faudrait des millions d'heures de travail humain par an pour le faire, et actuellement, ils ne vérifient qu'environ 1 % des instructions. S'ils ne vérifient pas, les clients se perdent et sont frustrés.

L'Ancienne Solution (et pourquoi elle a échoué) :
L'entreprise a essayé d'embaucher des « robots super-intelligents » (des Modèles Propriétaires de Frontière). Ces robots sont incroyablement intelligents et peuvent lire les guides et naviguer parfaitement dans le parc. Cependant, ils sont coûteux (c'est comme embaucher une équipe de doctorants pour chaque vérification) et risqués (vous devez leur montrer vos cartes privées du parc, ce qui viole les règles de sécurité). Vous ne pouvez pas vous permettre de les utiliser pour les millions de vérifications nécessaires.

La Nouvelle Solution : AliyunConsoleAgent
Les auteurs ont construit leur propre « robot entraînable » (un modèle d'IA de 3{3} milliards de paramètres) qui est moins cher et plus sûr à exécuter sur leurs propres serveurs. Mais un robot standard n'est pas assez intelligent pour gérer un parc à thème chaotique et changeant. Ils ont donc utilisé une méthode d'entraînement en deux étapes :

1. La Phase d'« Ombrage » (Affinage Supervisé)

D'abord, ils ont pris les robots super-intelligents et ont fait en sorte que le nouveau robot les observe (shadowing).

  • L'Analogie : Imaginez un chef cuisinier maître (le super-robot) préparant un plat complexe. Le nouveau robot regarde le maître, mémorisant chaque coup de couteau, chaque mélange et chaque assaisonnement.
  • Le Résultat : Le nouveau robot apprend les bases pour naviguer dans le parc et suivre les instructions. Il devient plutôt bon, mais il se contente de copier. Si le parc change légèrement, il est confus car il ne comprend pas réellement l'objectif, il se contente de mémoriser les étapes.

2. La Phase de « Tentative et Erreur » (Apprentissage par Renforcement)

Ensuite, ils ont laissé le robot en liberté dans une version simulée du parc pour apprendre par la pratique.

  • Le Défi : Dans un environnement cloud réel, le robot échoue souvent non pas parce qu'il est stupide, mais parce que le « parc » n'est pas prêt. Par exemple, il essaie de supprimer un serveur, mais le serveur n'existe pas encore. Si le robot est puni pour cela, il apprend la mauvaise leçon (qu'il est mauvais pour supprimer des serveurs) au lieu de la bonne (qu'il doit d'abord construire le serveur).
  • La Solution (Le Déploiement à Haut Déterminisme) : L'équipe a construit un « terrain d'entraînement » spécial utilisant Terraform (un outil qui construit l'infrastructure comme des Legos). Avant que le robot ne tente une tâche, ce système construit automatiquement les prérequis exacts (comme construire le serveur, configurer le réseau) afin que le robot puisse réussir s'il fait les bons mouvements.
  • Le Système de Récompense : Au lieu d'un humain qui note le robot, ils utilisent un Juge à Double Canal :
    1. Le Vérificateur de Règles : Il examine les « journaux d'audit » officiels (les caméras de surveillance du parc) pour voir si l'action a réellement eu lieu. Le serveur a-t-il été supprimé ? Oui/Non. C'est 100 % objectif.
    2. Le Panel de Juges : S'il n'y a pas de journal clair, deux autres modèles d'IA agissent comme juges. Ils ne donnent un « passage » que si tous les deux sont d'accord sur le fait que le robot a réussi. Cela empêche le robot de « tricher » ou de tromper un juge unique.

Le Résultat

Après cet entraînement, le robot est passé d'un simple suiveur aveugle à un résolveur de problèmes autonome.

  • Avant : Si le guide disait « Désactiver le renouvellement automatique » mais que l'interrupteur était déjà éteint, le robot s'arrêtait simplement et disait « Je ne peux pas le faire ».
  • Après : Le robot réfléchit : « Attendez, je ne peux pas l'éteindre s'il est déjà éteint. Je dois d'abord l'allumer pour ensuite pouvoir l'éteindre afin de prouver que je l'ai fait. » Il a découvert la logique par lui-même.

L'Essentiel :

  • Performance : Leur nouveau robot (AliyunConsoleAgent-32B) est presque aussi performant que les « super-robots » coûteux (avec une différence de seulement 1,8 %).
  • Coût : Il coûte 92 % de moins à exécuter.
  • Impact : Ils ont utilisé ce système pour auditer plus de 54 000 instructions et ont trouvé près de 4 400 erreurs réelles que les équipes produit ont pu corriger.

En bref, ils ont appris à un robot local et abordable à penser comme un génie en le faisant faire l'ombre d'un génie, puis en le laissant s'entraîner dans une salle de sport parfaitement préparée où il pouvait apprendre de ses erreurs sans être puni pour des choses hors de son contrôle.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →