← Derniers articles
🤖 AI

PANDO: Efficient Multimodal AI Agents via Online Skill Distillation

PANDO introduit un cadre efficace de distillation de compétences en ligne qui permet aux agents web multimodaux d'améliorer leurs performances et de réduire la consommation de tokens en maintenant une bibliothèque de compétences structurée et en employant des techniques telles que la réflexion sur le progrès et l'incitation consciente du cache, atteignant un taux de réussite de 58,3 % sur VisualWebArena avec des coûts d'inférence nettement inférieurs à ceux des méthodes existantes.

Auteurs originaux : Yubo Li, Yidi Miao, Haotian Shen, Yuxin Liu

Publié 2026-05-26
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Yubo Li, Yidi Miao, Haotian Shen, Yuxin Liu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Le Grand Problème : Le Piège du « Pay-per-Click »

Imaginez que vous engagez un assistant très intelligent, mais cher, pour vous aider à faire vos achats en ligne. Chaque fois qu'il consulte une page web, réfléchit à ce qu'il doit faire ou clique sur un bouton, vous devez lui verser une minuscule redevance (appelée un « token »).

Actuellement, la plupart des agents IA tentent de s'améliorer dans leurs tâches en dépensant plus d'argent. S'ils échouent, ils réessaient. S'ils sont bloqués, ils demandent un deuxième avis. Ils exécutent la même tâche dix fois et choisissent le meilleur résultat. Cela fonctionne, mais c'est comme payer un taxi pour aller à l'épicerie, puis payer un deuxième taxi pour revenir vérifier si vous avez oublié votre portefeuille, puis un troisième pour vérifier le prix une nouvelle fois. Cela permet d'obtenir le résultat, mais c'est incroyablement coûteux et lent.

Les auteurs de ce papier se sont demandé : Pouvons-nous créer un agent qui devient moins cher et plus rapide à mesure qu'il travaille, au lieu de simplement dépenser plus d'argent à chaque fois ?

La Solution : PANDO (L'Agent « Châtaignier Géant »)

Les chercheurs ont construit un agent nommé PANDO. Ils l'ont nommé d'après la clairière de trembles « Pando » dans l'Utah.

  • La Métaphore : Pando ressemble à 47 000 arbres distincts, mais ils sont en réalité tous connectés par un seul système racinaire souterrain. Lorsqu'un arbre grandit, il partage ses nutriments avec les autres. Lorsqu'un arbre meurt, le système racinaire s'en souvient et maintient toute la forêt en vie.
  • La Version IA : PANDO est un agent IA qui possède une « racine de mémoire » partagée (une Bibliothèque de Compétences). Au lieu de traiter chaque nouvelle tâche comme un problème entièrement nouveau, il se souvient de ce qu'il a appris des tâches précédentes et utilise ces leçons pour résoudre les nouvelles.

Comment PANDO Fonctionne (La Boucle en 4 Étapes)

PANDO ne se contente pas de deviner et de vérifier. Il suit un cycle : Planifier → Agir → Réfléchir → Apprendre.

  1. Planifier : Le « Cerveau » (une IA intelligente et coûteuse) décompose une grande tâche (comme « trouver la guitare la moins chère sous 500 $ ») en petites étapes.
  2. Agir : Les « Mains » (une IA moins chère et plus rapide) cliquent réellement sur les boutons.
  3. Réfléchir : Un « Manager » vérifie si les étapes ont fonctionné. Le filtre de prix a-t-il réellement modifié la liste ? Si non, pourquoi ?
  4. Apprendre (La Partie Magique) : C'est ici que PANDO devient plus intelligent.
    • Bibliothèque de Compétences : Si l'agent trouve avec succès une guitare bon marché, il note la recette : « Pour trouver des articles bon marché, cliquez sur « Trier par prix » puis « Du moins cher au plus cher ». » Il enregistre cela comme une Règle ou une Routine.
    • Réutilisation des Compétences : La prochaine fois que l'agent doit trouver l'article le « plus cher », il n'a pas besoin de réfléchir intensément. Il consulte simplement sa bibliothèque, voit la règle et inverse l'interrupteur sur « Du plus cher au moins cher ».
    • Rétrogradation (Le Nettoyage) : Si une règle cesse de fonctionner (par exemple, si un site web change sa mise en page), l'agent la marque comme « cassée » et arrête de l'utiliser. Cela empêche l'agent de rester coincé dans des boucles en essayant d'utiliser d'anciennes instructions défectueuses.

Pourquoi C'est un Changement de Jeu

Le papier a testé PANDO sur 910 tâches web différentes (achats, petites annonces, Reddit). Voici ce qui s'est passé :

  • Taux de Réussite : PANDO a réussi 58,3 % du temps. C'est mieux que les meilleurs agents actuels (qui étaient autour de 54 %).
  • Coût : C'est la grande victoire. PANDO a utilisé 58 % de tokens en moins (d'argent) que le deuxième meilleur agent.
  • L'Effet « Repas Gratuit » :
    • Au début : PANDO est un peu lent car il apprend les règles.
    • Plus tard : Au fur et à mesure qu'il construit sa bibliothèque de compétences, il devient plus rapide et moins cher. À la fin du test, il résolvait les tâches avec moins d'étapes et moins d'argent qu'au début.
    • Analogie : Imaginez un étudiant passant un examen de mathématiques.
      • Anciens Agents : Chaque fois qu'ils voient un nouveau problème, ils redérivent la formule à partir de zéro. Cela prend une éternité.
      • PANDO : La première fois qu'ils voient un problème, ils le résolvent et écrivent la formule sur une feuille de triche. Les 99 fois suivantes, ils regardent simplement la feuille de triche. Ils terminent l'examen plus vite et avec moins d'effort cérébral.

Les « Coûts Cachés » que PANDO Évite

Le papier souligne que d'autres agents masquent leurs coûts de deux manières :

  1. Découverte par Pré-évaluation : Certains agents passent des semaines à « s'entraîner » ou à « découvrir » des outils avant même que le test ne commence. PANDO apprend pendant le test, il n'y a donc aucun coût initial caché.
  2. Mise à l'échelle par Déploiement : Certains agents essaient simplement la tâche 10 fois et choisissent le gagnant. PANDO l'essaie une seule fois, mais utilise sa mémoire pour faire en sorte que cette unique tentative compte.

La Conclusion

PANDO prouve qu'il n'est pas nécessaire de jeter plus d'argent sur une IA pour l'améliorer. En lui donnant une mémoire structurée (une bibliothèque de compétences) et un moyen de nettoyer les mauvais souvenirs (rétrogradation), l'agent devient plus efficace à mesure qu'il travaille.

C'est la différence entre un travailleur qui oublie tout chaque jour et doit être constamment reformé, et un travailleur qui tient un cahier de « comment faire les choses » et qui devient plus rapide chaque jour.

À retenir : PANDO ne devient pas seulement plus intelligent ; il devient moins cher à exécuter à mesure qu'il acquiert de l'expérience.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →