← Derniers articles
🤖 AI

MMSkills: Towards Multimodal Skills for General Visual Agents

L'article présente MMSkills, un cadre qui répond aux limites des représentations de compétences basées sur le texte en formalisant et en mettant en œuvre des connaissances procédurales multimodales réutilisables — combinant des procédures textuelles avec des preuves visuelles conditionnées par l'état — afin d'améliorer les capacités de prise de décision en temps réel des agents visuels généraux.

Auteurs originaux : Kangning Zhang, Shuai Shao, Qingyao Li, Jianghao Lin, Lingyue Fu, Shijian Wang, Wenxiang Jiao, Yuan Lu, Weiwen Liu, Weinan Zhang, Yong Yu

Publié 2026-05-14
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Kangning Zhang, Shuai Shao, Qingyao Li, Jianghao Lin, Lingyue Fu, Shijian Wang, Wenxiang Jiao, Yuan Lu, Weiwen Liu, Weinan Zhang, Yong Yu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

La Grande Idée : Apprendre aux Robots à « Voir » Comme les Humains

Imaginez que vous enseignez à un robot comment utiliser un ordinateur.

  • L'Ancienne Méthode (Compétences uniquement textuelles) : Vous donnez au robot une recette écrite : « Cliquez sur le menu 'Fichier', puis 'Nouveau', puis 'Feuille'. »
    • Le Problème : Si le robot se trouve sur le mauvais écran, ou si une fenêtre contextuelle bloque le menu, le robot suit aveuglément le texte. Il clique sur « Fichier » même si le menu n'est pas là, reste bloqué et échoue. Il sait quoi faire, mais pas quand le faire ou à quoi cela ressemble une fois terminé.
  • La Nouvelle Méthode (MMSkills) : Vous donnez au robot un « Guide Intelligent ». Ce guide ne contient pas seulement du texte ; il possède des photos de l'apparence que l'écran doit avoir à chaque étape, ainsi que des listes de contrôle pour vérifier si le robot est sur la bonne voie.

Ce papier présente MMSkills, un système qui transforme ces « Guides Intelligents » en outils réutilisables pour des agents IA (robots utilisant des ordinateurs ou jouant à des jeux).


Les Trois Problèmes Majeurs Qu'ils Ont Résolus

Les auteurs ont identifié trois grands obstacles à la mise en œuvre de ces Guides Intelligents :

  1. Que contient le paquet ?

    • Analogie : Si vous enseignez à quelqu'un à faire un gâteau, une recette textuelle ne suffit pas. Vous avez besoin d'une photo de la pâte (pour savoir quand elle est prête), d'une photo du four (pour savoir qu'il est chaud) et d'une liste de contrôle (pour vérifier que vous n'avez pas oublié les œufs).
    • La Solution : Un paquet MMSkill contient trois éléments :
      • Le Texte : Les instructions étape par étape.
      • Les Cartes d'État : Un système de « feux de circulation ». Il indique à l'agent : « Allez-y seulement si vous voyez un bouton bleu », ou « Arrêtez-vous ! Ne cliquez pas si vous voyez un message d'erreur rouge ».
      • Preuves Visuelles : Des photos (images clés) montrant exactement à quoi l'écran doit ressembler à des moments critiques (par exemple, des photos « Avant » et « Après »).
  2. Où trouvons-nous ces guides ?

    • Analogie : Vous ne voulez pas engager une personne pour écrire une nouvelle recette pour chaque gâteau. Vous voulez observer des gens faire des gâteaux, identifier les étapes communes et rédiger vous-même une recette générique.
    • La Solution : Ils ont construit un « Générateur » automatisé. Il observe des milliers de vidéos publiques montrant des gens utilisant des ordinateurs (trajectoires), regroupe les tâches similaires et rédige automatiquement ces Guides Intelligents. Il ne se contente pas de copier la vidéo ; il extrait la logique et les indices visuels.
  3. Comment le robot les utilise-t-il sans se confondre ?

    • Analogie : Imaginez essayer de lire un énorme album photo de 50 pages tout en conduisant une voiture. C'est distrayant et dangereux. Le robot pourrait se concentrer tellement sur les anciennes photos qu'il percuterait le monde réel.
    • La Solution : Ils ont inventé le « Chargement par Branches ».
      • Au lieu de pousser tout l'album photo dans le cerveau principal du robot, celui-ci ouvre une fenêtre latérale temporaire (une branche).
      • Dans cette fenêtre latérale, il regarde rapidement uniquement la photo spécifique dont il a besoin à cet instant pour prendre une décision.
      • Il ferme ensuite la fenêtre latérale et dit au robot principal : « D'accord, j'ai vérifié la photo. Vous êtes sur la bonne voie. Maintenant, cliquez sur le bouton. »
      • Cela permet de maintenir le robot principal concentré sur l'écran en direct, et non sur les anciennes photos de référence.

Fonctionnement dans la Vie Réelle (L'Exemple du « Graphique »)

Le papier utilise un exemple spécifique pour montrer pourquoi c'est mieux : Créer un graphique dans un tableur.

  • Scénario : La tâche est « Créer un graphique sur la Feuille 2 ».
  • Agent uniquement textuel : Lit « Créer un graphique ». Il voit un graphique en cours de création. Il clique sur « Terminé ».
    • Résultat : Il a créé le graphique sur la Feuille 1 (la mauvaise feuille) car le texte ne lui a pas dit de vérifier quelle feuille était active. Score : 0.
  • Agent MMSkills :
    1. Il charge la compétence « Créer un graphique ».
    2. La Carte d'État indique : « Vérification : La feuille active s'appelle-t-elle 'Feuille 2' ? »
    3. La Preuve Visuelle montre une photo de l'onglet de la feuille correcte.
    4. Le robot voit qu'il est actuellement sur la Feuille 1. La « Branche » dit : « Attendez ! Vous êtes sur la mauvaise feuille. Passez d'abord à la Feuille 2. »
    5. Le robot change de feuille, crée le graphique et vérifie que le titre correspond à la photo.
    • Résultat : Parfait graphique sur la bonne feuille. Score : 1.

Ce Que les Résultats Ont Montré

Les chercheurs ont testé cela sur deux types de tâches :

  1. Tâches de Bureau : Comme utiliser Excel, Chrome ou Word (OSWorld, macOSWorld).
  2. Tâches de Jeux : Comme jouer à Minecraft ou Super Mario Bros.

Les Constats :

  • Taux de Réussite Supérieurs : Les robots utilisant MMSkills ont résolu significativement plus de tâches que les robots sans compétences ou avec uniquement des compétences textuelles.
  • Aide aux Petits Robots : Même les modèles d'IA plus petits et moins puissants sont devenus beaucoup plus performants dans les tâches lorsqu'ils ont reçu ces guides visuels.
  • Moins d'Erreurs : Les robots ont commis moins d'erreurs répétitives (comme cliquer sur le même bouton 10 fois) et ont terminé les tâches plus rapidement.
  • Pas Seulement pour les Ordinateurs : Le système a fonctionné tout aussi bien dans les jeux vidéo, prouvant que « voir l'état » est important, que vous gériez des fichiers ou que vous sautiez par-dessus des obstacles.

Résumé

MMSkills est une méthode pour enseigner aux agents IA non seulement quoi faire, mais comment reconnaître s'ils le font correctement. En combinant des instructions textuelles avec des listes de contrôle de type « feux de circulation » et des photos spécifiques, et en utilisant une méthode de « fenêtre latérale » pour les consulter, le système aide les robots à éviter de se perdre, de se confondre ou de rester bloqués sur le mauvais écran. Il transforme un robot qui suit aveuglément les ordres en un robot qui comprend réellement le monde visuel dans lequel il travaille.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →