MMG2Skill: Can Agents Distill In-the-Wild Guides into Self-Evolving Skills?
Cet article présente MMG2Skill, un cadre en boucle fermée et le benchmark correspondant (MMG2Skill-Bench) qui permet aux agents d'IA de distiller des guides web multimodaux bruités en compétences exécutables auto-évolutives grâce à une compilation structurée et une révision pilotée par les trajectoires, surpassant de manière significative les agents de référence à travers divers domaines.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous avez un assistant robotique brillant mais légèrement naïf. Vous voulez qu'il accomplisse des tâches complexes comme éditer une photo, construire une maison dans un jeu vidéo ou jouer à un jeu de cartes stratégique. Vous disposez d'une immense bibliothèque de guides, de tutoriels et de wikis écrits par des humains sur Internet qui expliquent comment faire ces choses.
Le problème est que ces guides sont écrits pour des humains, pas pour des robots. Ils sont désordonnés, supposent que vous savez des choses que le robot ignore, et peuvent devenir confus si le robot commet une petite erreur. Si vous donnez simplement au robot un lien brut vers un article intitulé « Comment construire une maison », il pourrait être submergé par le texte, manquer les étapes cruciales ou essayer de faire les choses dans le mauvais ordre.
Ce document présente MMG2Skill, une nouvelle façon d'enseigner aux robots en utilisant ces guides humains désordonnés. Considérez cela comme un système de « Traducteur et de Coach » qui transforme les instructions humaines en un carnet de jeu personnel pour le robot.
Voici comment cela fonctionne, divisé en trois étapes simples :
1. Le Traducteur : Transformer le « Langage Humain » en « Carnet de Jeu Robotique »
Au lieu de donner tout l'article désordonné au robot, le système lit d'abord le guide et en extrait les étapes fondamentales. Il transforme l'article en une liste de contrôle propre et structurée appelée Compétence (Skill).
- L'Analogie : Imaginez un chef cuisinier lisant un article de blog complexe sur une recette. Au lieu de remettre tout le blog au sous-chef, le chef exécute une fiche de « Procédure Opérationnelle Standard » (SOP) concise et à puces : « Étape 1 : Hacher les oignons. Étape 2 : Chauffer la poêle. Étape 3 : Ajouter l'huile. »
- Le Résultat : Le robot dispose désormais d'une fiche d'instructions claire et modifiable (un fichier
SKILL.md) plutôt que d'un mur de texte déroutant.
2. Le Coach : Apprendre des Erreurs en Temps Réel
Le robot tente d'accomplir la tâche en utilisant cette nouvelle liste de contrôle. S'il échoue, le système ne se contente pas de dire « Réessaie ». Il agit comme un détective.
- Le Détective : Il examine exactement ce que le robot a fait, le compare à l'objectif et cherche la raison de l'échec. Le robot a-t-il oublié d'attendre que le fichier soit enregistré ? A-t-il cliqué sur le mauvais bouton ?
- La Correction : Le système édite ensuite la liste de contrôle. Il ajoute une note telle que : « Attendre 5 secondes que le fichier soit enregistré avant de cliquer sur 'Terminé'. »
- L'Analogie : C'est comme un moniteur de conduite observant un élève échouer à un créneau. Au lieu de simplement dire « Tu as échoué », l'instructeur écrit une note sur la fiche d'exercice de l'élève : « N'oubliez pas de vérifier le rétroviseur avant de reculer. » La fois suivante, l'élève utilise cette fiche mise à jour.
3. L Le Stopper Intelligent : Savoir Quand S'arrêter
Parfois, un robot continue d'essayer même après avoir réussi, ou continue de tourner en boucle après un échec. Le système inclut un « Stopper Intelligent ».
- L'Analogie : Imaginez un GPS qui réalise que vous êtes déjà arrivé à destination. Au lieu de vous faire faire le tour du pâté de maisons cinq fois de plus pour en être sûr, il dit : « Vous êtes arrivé. Coupez le moteur. »
- Le Bénéfice : Cela permet de gagner du temps et de l'argent (puissance de calcul) en arrêtant le robot dès qu'il perçoit des signes clairs de succès, plutôt que de le forcer à effectuer un nombre fixe de tentatives.
Qu'ont-ils découvert ?
Les chercheurs ont testé cela sur trois mondes très différents :
- Ordinateurs de bureau : Contrôle de logiciels comme Word ou Photoshop.
- Jeux Vidéo : Jouer à Minecraft pour récolter des ressources et fabriquer des objets.
- Jeux de Cartes : Jouer à des jeux de stratégie comme le Doudizhu ou le Mahjong.
Les Résultats :
- Les Guides Bruts Nuisent : Lorsqu'ils donnaient simplement les guides humains bruts et désordonnés au robot, celui-ci devenait en réalité moins bon dans les tâches. Le bruit supplémentaire le confondait.
- Le Carnet de Jeu Gagne : Lorsqu'ils utilisaient le système « Traducteur et Coach » (MMG2Skill) pour transformer ces guides en compétences propres et éditables, les robots devenaient nettement meilleurs. Ils se sont améliorés de 12 % à 25 % de manière générale.
- La Magie de l'Édition : Les gains les plus importants provenaient de la capacité du système à corriger la liste de contrôle après une erreur. Une traduction unique ne suffisait pas ; le robot avait besoin d'apprendre de ses propres échecs et de mettre à jour son propre carnet de jeu.
L'Essentiel
Ce document montre que nous n'avons pas besoin d'écrire un code parfait pour chaque tâche de robot. Nous pouvons utiliser les millions de guides humains déjà présents sur Internet, mais nous devons les traduire dans un format que le robot comprend et laisser le robot les éditer au fur et à mesure qu'il apprend. Cela transforme un manuel humain désordonné en un carnet de jeu auto-améliorant pour le robot.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.