AutoRPA: Efficient GUI Automation through LLM-Driven Code Synthesis from Interactions
AutoRPA est un cadre qui comble le fossé entre les agents ReAct basés sur les LLM inefficaces et l'automatisation robotisée des processus (RPA) traditionnelle en distillant automatiquement les trajectoires d'interaction en des fonctions RPA robustes et réutilisables, permettant ainsi de réduire considérablement l'utilisation de jetons et les coûts d'exécution tout en maintenant les capacités de résolution de tâches.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous ayez un assistant personnel très intelligent, mais légèrement coûteux, nommé « LLM » (Large Language Model). Cet assistant est brillant pour comprendre comment utiliser un écran d'ordinateur ou de téléphone pour la première fois. Si vous lui demandez de « réserver un vol » ou de « supprimer une note », il peut regarder l'écran, réfléchir à ce qu'il faut faire, cliquer sur les bons boutons et accomplir la tâche.
Cependant, il y a un hic : Ils sont lents et coûteux à utiliser pour des tâches répétitives.
Chaque fois que vous lui demandez de réserver un vol, il doit « réfléchir » à partir de zéro. Il lit l'écran, planifie les étapes et clique. Si vous devez le faire 100 fois par jour, vous payez pour 100 heures de « réflexion », ce qui est un gaspillage d'argent et de temps.
D'un autre côté, avant l'existence de ces assistants intelligents, les gens utilisaient l'« Automatisation des Processus Robotisés » (RPA). Considérez la RPA comme un script préenregistré. C'est comme un robot qui clique aveuglément sur « Bouton 3, puis tapez 'Bonjour', puis cliquez sur 'Enregistrer' ». C'est incroyablement rapide et peu coûteux à exécuter. Mais c'est aussi fragile. Si le concepteur de l'application déplace le « Bouton 3 » vers un autre endroit, le robot plante car il ne sait pas s'adapter. Il a besoin d'un humain pour réécrire manuellement le script chaque fois que l'écran change.
Le Problème
Nous voulons la rapidité et le faible coût du robot (RPA) mais l'adaptabilité intelligente de l'assistant (LLM). Nous voulons une solution qui fonctionne pour les tâches répétitives (comme réserver des vols tous les jours) sans avoir besoin qu'un humain réécrive le code à chaque mise à jour de l'application.
La Solution : AutoRPA
L'article présente AutoRPA, un système qui agit comme un chef cuisinier qui transforme une démonstration culinaire désordonnée en une recette parfaite et réutilisable.
Voici comment cela fonctionne, étape par étape :
1. L'« Exploration » (Le Chef qui observe)
D'abord, AutoRPA utilise l'assistant LLM intelligent pour effectuer la tâche (par exemple, réserver un vol) une seule fois ou quelques fois. L'assistant regarde l'écran, réfléchit et clique. C'est la phase « ReAct ».
- Analogie : Le chef observe un second cuisinier préparer un plat pour la première fois, notant chaque mouvement.
2. La « Traduction » (Transformer les notes en recette)
Les actions de l'assistant sont généralement « codées en dur » (par exemple, « Cliquez sur le bouton aux coordonnées pixels 144, 278 »). C'est problématique car si l'écran se décale, les coordonnées sont fausses.
AutoRPA dispose d'un Agent Traducteur spécial qui réécrit ces actions. Au lieu de dire « Cliquez à 144, 278 », il dit « Cliquez sur le bouton qui indique 'Réserver un vol' ».
- Analogie : Le chef prend les notes désordonnées du second cuisinier (« Appuyez sur le point rouge en haut à droite ») et les réécrit sous forme d'instructions claires (« Appuyez sur le bouton 'Démarrer' rouge »). Cela permet à la recette de fonctionner même si la disposition de la cuisine change légèrement.
3. La « Construction » (Créer le script maître)
Un Agent Constructeur prend ces instructions traduites et flexibles et les combine en un seul programme informatique robuste (une fonction RPA). Il examine de nombreuses tentatives différentes (trajectoires) pour déterminer la meilleure façon de gérer les variations.
- Analogie : Le chef rédige la carte de recette finale et professionnelle que n'importe qui, n'importe où, peut utiliser pour préparer ce plat parfaitement.
4. La « Réparation Hybride » (Le filet de sécurité)
Parfois, la nouvelle recette peut contenir un bug. Si le robot tente d'exécuter le code et échoue, AutoRPA n'abandonne pas simplement. Il dispose d'une Stratégie de Réparation Hybride :
- Il met le robot en pause.
- Il rappelle l'assistant LLM intelligent pour déterminer pourquoi il a échoué et comment le corriger à partir de ce point exact.
- Il utilise la correction de l'assistant pour mettre à jour la recette.
- Analogie : Si le robot brûle le toast, le chef intervient, répare le toast, puis met à jour la carte de recette afin que le robot ne brûle plus le toast la prochaine fois.
Les Résultats
L'article a testé cela sur trois environnements différents (applications Android, sites web et tâches web simulées).
- Efficacité : Le nouveau code AutoRPA est 82 % à 96 % moins cher à exécuter que de demander à l'assistant intelligent d'effectuer la tâche à chaque fois. Cela économise une quantité massive d'utilisation de « tokens » (la monnaie de la réflexion de l'IA).
- Taux de réussite : Il résout les tâches aussi bien, voire parfois mieux, que l'assistant intelligent seul, car le code généré est stable et ne se perd pas à cause de changements mineurs à l'écran.
- Réutilisabilité : Une fois le code construit pour un « type » de tâche (comme « réserver un vol »), il peut être réutilisé pour des centaines d'instances spécifiques (réserver à New York, réserver à Londres) sans avoir besoin de réfléchir à nouveau.
Résumé
AutoRPA est un système qui observe une IA intelligente apprendre une tâche, traduit cet apprentissage en un script flexible et réutilisable, puis polit ce script jusqu'à ce qu'il soit parfait. Il nous offre le meilleur des deux mondes : l'intelligence pour gérer de nouvelles situations et l'efficacité d'un robot pour gérer le travail répétitif.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.