MIND-Skill: Quality-Guaranteed Skill Generation via Multi-Agent Induction and Deduction
L'article présente MIND-Skill, un cadre multi-agents qui génère automatiquement des compétences LLM de haute qualité et réutilisables grâce à un cycle d'induction-déduction optimisé par des pertes textuelles (reconstruction, résultat et grille d'évaluation) afin d'assurer robustesse et généralisation sur des tâches complexes.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous avez un assistant robot brillant mais légèrement maladroit. Vous lui apprenez à accomplir une tâche spécifique, comme « envoyer un remboursement à un ami sur Venmo », en lui montrant une vidéo de vous l'exécutant parfaitement. Le robot observe, mais au lieu de simplement copier vos mouvements exacts, il tente de rédiger un manuel de règles pour lui-même afin de pouvoir accomplir des tâches similaires à l'avenir.
Le problème est que, si le robot rédige un mauvais manuel de règles, il pourrait rester bloqué. Il pourrait mémoriser le nom de votre ami spécifique (trop spécifique) ou rédiger des instructions trop vagues pour être utiles (trop abstraites).
MIND-Skill est un nouveau système conçu pour aider ces agents IA à rédiger automatiquement des manuels de règles parfaits et de haute qualité. Il le fait en utilisant un jeu astucieux de « Professeur et Élève » qui garantit que les règles fonctionnent réellement.
Voici comment cela fonctionne, décomposé en parties simples :
1. Les Deux Personnages : Le Professeur et l'Élève
Le système utilise deux agents IA travaillant ensemble :
- Le Professeur (Agent d'Induction) : Cet agent observe une vidéo réussie d'une tâche effectuée. Sa tâche est de rédiger un manuel de règles général (une « compétence ») expliquant comment accomplir la tâche, sans mentionner de noms ou de nombres spécifiques.
- L'Élève (Agent de Déduction) : Cet agent est le test. Il reçoit uniquement le manuel de règles rédigé par le Professeur et la description originale de la tâche. Il tente d'accomplir la tâche à partir de zéro en utilisant uniquement ces instructions.
2. Le Test de « Reconstruction »
C'est l'astuce de magie. Le système ne demande pas simplement : « L'Élève a-t-il obtenu la bonne réponse ? » Il demande : « L'Élève a-t-il suivi la même logique que la vidéo originale ? »
- Si le Professeur rédige un manuel de règles disant « Cliquez sur le bouton rouge », mais que la vidéo originale montrait le clic sur un bouton bleu, l'Élève échouera. Le système le détecte.
- Si le Professeur rédige un manuel de règles trop vague (par exemple, « Faites la chose »), l'Élève sera confus et échouera.
- Si le Professeur rédige un manuel de règles trop spécifique (par exemple, « Cliquez sur le bouton pour l'Utilisateur #123 »), le système réalise que cela ne fonctionnera pour personne d'autre.
Le système compare la performance de l'Élève à la vidéo originale. Si elles correspondent, le manuel de règles est bon. Si elles ne correspondent pas, le système sait que le manuel de règles est défectueux.
3. Les Trois « Bulletins de Notes »
Pour s'assurer que le manuel de règles est parfait, le système attribue au Professeur trois bulletins de notes spécifiques (appelés « pertes ») après chaque tentative :
- La Carte « Avez-vous suivi les étapes ? » (Perte de Reconstruction) : L'Élève a-t-il suivi la même stratégie que la vidéo originale ? (Par exemple, ont-ils tous deux vérifié l'e-mail en premier, puis cliqué sur envoyer ?)
- La Carte « Avez-vous terminé le travail ? » (Perte de Résultat) : L'Élève a-t-il effectivement terminé la tâche avec succès dans le monde réel ?
- La Carte « Est-ce un bon manuel ? » (Perte de Critère) : Le manuel de règles est-il bien rédigé ? Est-il clair ? Évite-t-il de copier des détails spécifiques (comme des noms ou des identifiants) qui ne devraient pas être là ? Cela garantit que le manuel de règles est un outil utile, et non une simple copie d'un événement spécifique.
4. La Boucle d'Amélioration
Le système exécute ce jeu encore et encore.
- Le Professeur rédige une ébauche.
- L'Élève la teste.
- Le système note l'ébauche en utilisant les trois bulletins de notes.
- Le système indique au Professeur exactement ce qui n'allait pas (par exemple, « Vous avez inclus un nom spécifique ; supprimez-le », ou « Vous avez sauté une vérification de sécurité »).
- Le Professeur réécrit le manuel de règles en se basant sur ces commentaires.
Cela se produit automatiquement, affinant le manuel de règles jusqu'à ce qu'il soit impeccable.
Pourquoi est-ce spécial ?
La plupart des méthodes précédentes tentaient de rédiger des manuels de règles en demandant simplement à une IA intelligente de « résumer » une vidéo. Mais l'IA fait souvent des erreurs, soit en étant trop vague, soit en étant trop spécifique.
MIND-Skill est différent car il teste immédiatement le manuel de règles. C'est comme un chef écrivant une recette, puis la remettant immédiatement à un sous-chef pour qu'il prépare le plat. Si le sous-chef brûle la nourriture ou utilise les mauvais ingrédients, le chef sait que la recette était mauvaise et la corrige avant que quiconque d'autre ne l'essaie.
Les Résultats
L'article a testé cela dans deux mondes difficiles :
- AppWorld : Une simulation de l'utilisation d'applications réelles (comme envoyer de l'argent, réserver des billets, gérer des fichiers).
- BFCL-v3 : Un test de l'appel correct de fonctions informatiques.
Les résultats ont montré que les agents utilisant les manuels de règles de MIND-Skill étaient bien meilleurs pour résoudre de nouvelles tâches jamais vues que les agents utilisant des manuels de règles créés par d'autres méthodes. Même lorsque l'IA « Professeur » n'était pas le modèle le plus intelligent disponible, le processus de test rendait les manuels de règles finaux si bons qu'ils performaient aussi bien que ceux créés par les modèles les plus intelligents.
En bref : MIND-Skill transforme les agents IA en enseignants auto-améliorants qui rédigent leurs propres manuels d'instructions parfaits en testant constamment si ces manuels fonctionnent réellement.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.