OmegaUse-SOP: SOP Engineering for Professional Computer Use from Human Demonstrations
Cet article présente OmegaUse-SOP, un système de type « human-in-the-loop » qui transforme les démonstrations d'experts en compétences de procédures opérationnelles normalisées (SOP) réutilisables et spécifiques à un domaine pour les agents GUI, améliorant considérablement leur fiabilité dans des environnements professionnels complexes tels que les flux de travail de simulation photovoltaïque.
Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez un programme informatique capable de regarder un écran, de comprendre ce qu'il voit et de cliquer sur des boutons ou de taper du texte comme le ferait un humain. C'est la promesse de l'« agent GUI », un type d'intelligence artificielle conçu pour naviguer dans le monde numérique non pas en lisant du code, mais en observant et en interagissant avec les interfaces graphiques que nous utilisons quotidiennement. Bien que ces agents soient devenus très performants pour les tâches simples, ils trébuchent souvent face à des travaux professionnels complexes. Le travail réel est rarement une ligne droite ; il implique des règles cachées, des habitudes logicielles spécifiques et des étapes qui doivent être vérifiées et revérifiées. Lorsqu'un agent tente d'accomplir une tâche professionnelle sans comprendre ces nuances, il se perd souvent, manque un détail crucial ou effectue la mauvaise action. Le défi n'est donc pas seulement de rendre l'agent plus intelligent, mais de lui enseigner les procédures spécifiques et non écrites que les experts utilisent pour accomplir leur travail correctement.
Un chercheur de Baidu et une entreprise de génie électrique en Chine ont développé un nouveau système pour résoudre ce problème, appelé OmegaUse-SOP. L'idée centrale est de traiter la manière dont les humains exécutent des tâches logicielles complexes comme un ensemble d'instructions qui peuvent être capturées, affinées et réutilisées. Ils appellent ce processus l'« Ingénierie SOP », ce qui signifie « Ingénierie de Procédures Opérationnelles Standard ». Considérez cela comme le fait de prendre le flux de travail d'un maître artisan et de le transformer en un guide fiable qu'une machine peut suivre. Au lieu de simplement enregistrer une vidéo de quelqu'un cliquant sur des boutons, le système observe l'expert humain, comprend ce qu'il fait, puis réécrit ces actions en étapes claires et logiques qu'un ordinateur peut comprendre et adapter à de nouvelles situations.
Le système fonctionne via quatre étapes distinctes qui s'opèrent en boucle. Premièrement, le module « Observer » regarde un expert humain accomplir une tâche sur un ordinateur. Il enregistre chaque clic de souris, chaque pression de touche et chaque changement d'écran, sauvegardant une image de l'écran juste avant chaque action. Cela crée un journal détaillé de ce qui s'est passé exactement et de l'aspect de l'écran à ce moment-là. Ensuite, le module « Raisonner » prend ce journal brut et le traduit en langage clair. Il analyse un clic sur un point spécifique et déduit que l'humain était en réalité en train de sélectionner un champ « nom du projet », et non pas simplement en cliquant sur une coordonnée aléatoire. Il transforme une liste d'événements techniques en un récit : « Cliquez sur la case du nom du projet, puis tapez le nom ». Cette étape est cruciale car elle aide l'ordinateur à comprendre la signification de l'action, et non pas seulement le mouvement.
Une fois les étapes comprises, l'étape « Configurer » permet à un utilisateur humain d'ajouter des règles et des variables spécifiques. Dans le travail professionnel, la même tâche peut devoir être effectuée avec des chiffres ou des paramètres différents à chaque fois. Ce module permet à l'utilisateur de marquer certaines parties des instructions comme étant modifiables, afin que l'agent sache quelles valeurs remplacer pour un nouveau travail. Enfin, le module « Exécuter » met le plan en action. L'agent regarde l'écran actuel, trouve la bonne étape dans ses instructions et effectue l'action. Après chaque étape, il vérifie si l'écran a changé comme prévu. Si quelque chose semble incorrect, il peut s'arrêter et demander l'aide d'un humain, ou essayer à nouveau. Ce cycle d'observation, de compréhension, d'ajustement et d'action transforme une simple démonstration humaine en une compétence réutilisable qui peut être appliquée à de nombreuses tâches différentes.
Pour tester si cette approche fonctionne réellement, le chercheur s'est associé à un client du secteur de l'énergie pour s'attaquer à un défi très spécifique : la conception de systèmes d'énergie solaire à l'aide d'un progiciel complexe appelé PVsyst. Ils ont choisi cinq tâches difficiles que les experts effectuent régulièrement, telles que l'importation de données météorologiques, le réglage de l'angle des panneaux solaires et le calcul des pertes d'énergie. Ils ont testé trois modèles d'intelligence artificielle différents sur ces tâches. Premièrement, ils ont laissé les modèles tenter d'accomplir les tâches en écoutant simplement une instruction simple, sans l'aide du nouveau système. Les résultats ont été mitigés ; les modèles ont considérablement éprouvé des difficultés, n'accomplissant qu'une à trois tâches sur cinq selon le modèle utilisé. Ils se sont souvent emmêlés dans la disposition spécifique du logiciel ou ont manqué des exigences subtiles.
Ensuite, le chercheur a appliqué le système OmegaUse-SOP. Ils ont enregistré des experts humains effectuant les mêmes cinq tâches, ont utilisé le système pour transformer ces enregistrements en compétences raffinées étape par étape, et ont laissé les modèles réessayer. La différence a été immédiate et totale. Avec l'aide des SOP ingéniérées, chaque modèle, y compris les modèles open-source, a accompli les cinq tâches avec succès. Le système ne s'est pas contenté de rendre les agents légèrement meilleurs ; il les a transformés de novices peu fiables en opérateurs compétents. Le chercheur a également mené un test spécifique pour voir quelle partie de leur système était la plus importante. Il a découvert que le module « Raisonner », la partie qui traduit les clics bruts en instructions significatives, était la clé. Lorsqu'ils ont supprimé cette étape et laissé les agents essayer de suivre les journaux bruts et inexpliqués, le taux de réussite a chuté de manière spectaculaire. Cela a prouvé que le simple enregistrement de ce qu'un humain fait ne suffit pas ; l'ordinateur doit comprendre pourquoi il le fait.
Les conclusions suggèrent que pour que l'intelligence artificielle maîtrise véritablement les logiciels professionnels, elle a besoin de plus que d'une vision ou d'une mémoire puissantes. Elle a besoin d'un moyen de capturer le savoir implicite que détiennent les experts humains — les habitudes, les vérifications et les manières spécifiques dont ils naviguent dans des menus complexes. En construisant un système capable de transformer les démonstrations humaines en compétences structurées, éditables et vérifiées, le chercheur a montré une voie pratique à suivre. Le système OmegaUse-SOP ne remplace pas le jugement humain ; au contraire, il crée un pont entre l'expertise humaine et l'exécution par la machine, permettant aux ordinateurs de gérer de manière fiable les flux de travail complexes et régis par des règles qui définissent le travail professionnel dans des domaines tels que l'ingénierie et la conception.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.