← Derniers articles
🤖 machine learning

Agent JIT Compilation for Latency-Optimizing Web Agent Planning and Scheduling

Ce papier présente la compilation JIT d'agents, un cadre comprenant un planificateur, un ordonnanceur et un protocole garantissant les invariants, qui convertit des tâches en langage naturel en code exécutable pour obtenir des accélérations significatives et des améliorations de précision par rapport aux boucles séquentielles traditionnelles d'agents web.

Auteurs originaux : Caleb Winston, Ron Yifeng Wang, Azalia Mirhoseini, Christos Kozyrakis

Publié 2026-05-21
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Caleb Winston, Ron Yifeng Wang, Azalia Mirhoseini, Christos Kozyrakis

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de faire accomplir à un robot une tâche complexe pour vous, comme « Commander le taco le moins cher chez Taco Bell ».

Actuellement, la plupart des robots fonctionnent comme un assistant humain très prudent et lent. Ils regardent l'écran, demandent à un cerveau surintelligent (une IA) quoi faire ensuite, cliquent sur un bouton, attendent que l'écran change, demandent à nouveau au cerveau, tapent un mot, attendent, et demandent encore. Cette boucle « regarder-penser-agir » se répète encore et encore. C'est lent, coûteux (car le cerveau IA coûte de l'argent à chaque fois que vous le sollicitez), et sujet aux erreurs, car le robot pourrait cliquer sur le mauvais élément si l'écran ressemble légèrement différent.

Ce papier introduit une nouvelle méthode pour rendre ces robots plus rapides et plus intelligents, appelée Compilation JIT d'Agent. Considérez cela comme le passage d'un « manuel d'instructions étape par étape » à la « rédaction d'un script logiciel personnalisé » avant même que le robot ne commence à bouger.

Voici comment cela fonctionne, décomposé en trois parties simples :

1. Le Planificateur « Pré-vol » (JIT-Planner)

Au lieu de demander à l'IA « Que devrais-je faire ensuite ? » à chaque étape, le système prend d'abord votre demande (« Commander le taco le moins cher ») et génère instantanément plusieurs programmes informatiques (codes) différents qui pourraient résoudre le problème.

  • L'analogie : Imaginez que vous devez conduire de New York à Boston.
    • Ancienne méthode : Vous vous arrêtez à chaque station-service pour demander à un local : « Quelle est la direction de Boston ? » Vous conduisez un mile, demandez à nouveau, conduisez un autre mile, demandez encore.
    • Nouvelle méthode : Avant de partir, vous demandez à une application de cartes de générer trois itinéraires différents. Elle vérifie le trafic, l'état des routes et la distance. Elle choisit l'itinéraire absolument le plus rapide et inscrit les coordonnées GPS dans le système de navigation de votre voiture une seule fois. Ensuite, vous conduisez simplement.
  • La magie : Le système vérifie ces itinéraires générés pour s'assurer qu'ils sont logiques (par exemple, vous ne pouvez pas cliquer sur « Commander » avant d'avoir cliqué sur « Ajouter au panier »). Il choisit celui qui utilise le moins de « puissance cérébrale » (appels à l'IA) et de temps.

2. Le « Agent de circulation » (JIT-Scheduler)

Une fois que le robot a un plan, il doit décider comment l'exécuter. Doit-il tout faire un par un ? Doit-il essayer de faire trois choses à la fois ? Ou doit-il essayer la même tâche trois fois en parallèle et simplement utiliser la première qui se termine ?

  • L'analogie : Imaginez que vous commandez de la nourriture pour une fête.
    • Séquentiel (Un par un) : Vous appelez un restaurant, attendez la réponse, appelez le suivant, attendez...
    • Parallèle : Vous appelez trois restaurants en même temps.
    • Couverture (Hedging) : Vous appelez trois restaurants, mais vous ne vous souciez que du premier qui décroche. Si l'un est lent, vous n'attendez pas ; vous prenez simplement la réponse de celui qui est rapide.
  • La magie : Le système examine la tâche spécifique et utilise des données passées pour deviner quelle stratégie est la meilleure. Si la tâche est simple, il procède un par un. Si la tâche est délicate et risque de bloquer, il essaie plusieurs chemins à la fois (couverture) pour s'assurer qu'elle se termine rapidement. Il choisit la stratégie qui économise le plus de temps.

3. Le « Code de règles » (Protocole d'application des invariants)

Pour s'assurer que le robot ne plante pas ou ne clique pas sur le mauvais bouton, chaque outil utilisé par le robot (comme « cliquer sur un bouton » ou « taper du texte ») est accompagné d'un code de règles strict.

  • L'analogie : Pensez à un distributeur automatique.
    • Ancienne méthode : Vous appuyez simplement sur les boutons au hasard. Parfois, vous appuyez sur « Snack » alors que la machine est vide, et rien ne se passe.
    • Nouvelle méthode : La machine possède un capteur. Elle vérifie : « La machine est-elle allumée ? Y a-t-il de l'argent à l'intérieur ? La porte est-elle fermée ? » Si les conditions ne sont pas remplies, la machine refuse de vous laisser appuyer sur le bouton.
  • La magie : Avant que le robot n'exécute le code, il vérifie ces règles. Si un plan tente de « Commander » alors que le « Panier » est vide, le système détecte cette erreur avant même que le robot ne commence, empêchant ainsi les erreurs et le temps perdu.

Les Résultats

Les auteurs ont testé cela sur cinq sites web différents (comme des sites de livraison de nourriture, d'e-mail et de shopping). Les résultats étaient impressionnants :

  • Vitesse : Leur nouvelle méthode était 10 fois plus rapide que la méthode standard « demander à l'IA à chaque étape ».
  • Précision : Elle était également 28 % plus précise, ce qui signifie qu'elle obtenait réellement le bon taco 28 % plus souvent.
  • Comparaison : Même par rapport à d'autres agents IA avancés (comme ceux d'OpenAI ou d'Anthropic), leur méthode était 2,4 fois plus rapide et 9 % plus précise.

Résumé

En bref, ce papier dit : Ne demandez pas à l'IA de conduire la voiture étape par étape. Au lieu de cela, faites en sorte que l'IA écrive l'itinéraire complet de conduite sous forme de script, vérifie que l'itinéraire est sûr, choisisse le moyen le plus rapide de le conduire, puis exécutez simplement le script. Cela transforme une conversation lente et saccadée en une exécution fluide et à grande vitesse.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →