← Derniers articles
💬 NLP

Multi-Agent Computer Use

Ce document propose Multi-Agent Computer Use (MACU), un système dans lequel un modèle gestionnaire orchestre des sous-agents parallèles via un graphe orienté acyclique (DAG) dynamique pour gérer efficacement des tâches complexes à long horizon, démontrant des améliorations de performance significatives par rapport aux bases de référence à agent unique sur les benchmarks de navigation de bureau et de navigation web.

Auteurs originaux : Jing Yu Koh, Ruslan Salakhutdinov, Daniel Fried

Publié 2026-06-02
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Jing Yu Koh, Ruslan Salakhutdinov, Daniel Fried

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous deviez organiser un événement massif et complexe, comme un mariage ou une retraite d'entreprise.

L'ancienne méthode (Agent unique) :
Autrefois, nous essayions de mener cela à bien en embauchant un assistant incroyablement intelligent mais très occupé. Cet assistant devait tout faire seul : appeler le traiteur, réserver la salle, vérifier la météo et acheter les fleurs. Si le traiteur disait : « Nous sommes complets à cette date », l'assistant devait s'arrêter, appeler la salle pour vérifier si cette date était libre, appeler le fleuriste pour voir s'il était disponible, puis essayer de rappeler le traiteur avec une nouvelle date. Si l'assistant restait bloqué sur un appel téléphonique, toute la planification de l'événement était à l'arrêt. Il travaillait de manière linéaire, une étape après l'autre, et s'il heurtait un mur, il devait revenir tout au début pour essayer un autre chemin.

La nouvelle méthode (Utilisation de l'ordinateur par multi-agents - MACU) :
Ce document propose une méthode plus intelligente : embaucher un Chef de projet et une équipe d'Assistants spécialisés.

Voici comment fonctionne ce nouveau système, en utilisant l'analogie de la planification d'un mariage :

1. Le Chef de projet (Le « Manager »)

Au lieu de faire le travail, la seule mission du Manager est d'observer la vue d'ensemble et de dessiner une carte (appelée Graphe Orienté Acyclique, ou DAG).

  • Décomposition : Le Manager regarde la tâche « Organiser un mariage » et la décompose en morceaux plus petits : « Trouver une salle », « Réserver un traiteur », « Choisir les fleurs » et « Envoyer les invitations ».
  • La Carte : Le Manager dessine une carte montrant quelles tâches peuvent se dérouler en même temps. Par exemple, « Trouver une salle » et « Réserver un traiteur » ne dépendent pas l'une de l'autre, elles peuvent donc se dérouler simultanément.
  • Le Cerveau : Le Manager est le seul à voir l'ensemble de la carte. Si une nouvelle information arrive (ex : « La salle est trop chère »), le Manager peut instantanément redessiner la carte, annuler la recherche de la salle coûteuse et envoyer un nouvel assistant pour en trouver une moins chère, le tout sans interrompre les autres assistants.

2. L'équipe d'assistants (Les « Sous-agents »)

Le Manager envoie une équipe d'assistants identiques (sous-agents) pour effectuer le travail réel.

  • Puissance Parallèle : Au lieu d'attendre qu'une personne finisse, le Manager envoie quatre assistants d'un coup. L'un part vérifier les hôtels, un autre vérifie les vols, un troisième vérifie les restaurants et un quatrième vérifie la météo. Ils travaillent en parallèle, comme une équipe de stands changeant les pneus d'une voiture de course.
  • Isolation : Chaque assistant travaille dans son propre « bac à sable » privé (un ordinateur virtuel). Si un assistant plante ou s'embrouille, cela ne casse pas les autres. Ils sont isolés de leurs erreurs respectives.

3. La Carte « Vivante » (Replanification)

C'est la partie la plus importante. Dans l'ancien système, si vous faisiez un plan, vous vous y teniez même si les choses changeaient.
Dans ce nouveau système, la carte est vivante.

  • La Boucle de Rétroaction : Dès qu'un assistant termine une tâche (ex : « J'ai trouvé un hôtel, mais il est complet »), il fait un rapport au Manager.
  • Le Pivot : Le Manager regarde la nouvelle information et met immédiatement à jour la carte. Peut-être que l'hôtel est complet, alors le Manager ajoute une nouvelle tâche pour « Trouver un hôtel de secours » et envoie un nouvel assistant pour s'en charger. Si un assistant reste bloqué dans une boucle (comme essayer de cliquer sur un bouton qui ne fonctionne pas), le Manager peut dire : « Arrête ça, essaie une autre approche », et envoyer une nouvelle personne avec une stratégie différente.
  • Se souvenir du passé : Parfois, un assistant trouve un fichier ou une information dont la personne suivante aura besoin. Le Manager agit comme un bibliothécaire, sauvegardant ce fichier et le transmettant à l'assistant suivant pour qu'il n'ait pas à repartir de zéro.

Pourquoi est-ce meilleur ?

Le document a testé cela sur quatre types différents de « tâches informatiques », allant de tâches simples sur bureau (comme changer une police de caractères) à la planification de voyages complexes sur plusieurs jours sur le Web.

  • Vitesse : Pour les tâches complexes, l'équipe a terminé environ 1,5 fois plus vite que l'assistant unique car elle faisait les choses en même temps.
  • Taux de réussite : L'équipe était bien meilleure pour résoudre des problèmes difficiles. Sur les tests de planification de voyage les plus complexes, l'assistant unique a échoué 90 % du temps, mais l'équipe a réussi 34 % du temps. C'est un bond énorme.
  • Se débloquer : Quand l'assistant unique se retrouvait coincé dans une impasse, tout le processus s'arrêtait. L'équipe, en revanche, pouvait envoyer une personne différente pour essayer une autre porte. Si un chemin était bloqué, un autre chemin était déjà ouvert.

L'essentiel

Le document soutient que pour les tâches informatiques complexes et de longue durée, nous ne devrions pas compter sur un seul « super-bot » essayant de tout faire en ligne droite. Au lieu de cela, nous devrions utiliser un Manager qui dessine une carte flexible et une Équipe de travailleurs qui peuvent fonctionner en parallèle, s'arrêter, démarrer et changer de direction instantanément en fonction de ce qu'ils trouvent.

C'est la différence entre un explorateur solitaire essayant de traverser une jungle seul et une expédition guidée avec un chef, une carte et une équipe capable de se diviser, de couvrir plus de terrain et de s'adapter instantanément aux obstacles.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →