← Derniers articles
🤖 AI

CoAdapt-GUI: Joint Workflow Context and Policy Adaptation for Unseen GUI Applications

CoAdapt-GUI est un cadre d'adaptation au moment de l'exécution qui améliore la généralisation des agents d'interface graphique mobile aux applications inédites en adaptant conjointement une politique spécifique à une tâche via LoRA et en affinant le contexte de flux de travail transférable à partir des propres interactions de l'agent, atteignant ainsi des gains de performance significatifs par rapport aux méthodes de référence.

Auteurs originaux : Linqiang Guo (Peter), Li Gu (Peter), Zihuan Jiang (Peter), Zhixiang Chi (Peter), Siobhan Reid (Peter), Ziqiang Wang (Peter), Yuanhao Yu (Peter), Wei Liu (Peter), Yang Wang (Peter), Tse-Hsun (Peter)
Publié 2026-08-13
📖 3 min de lecture☕ Lecture pause café

Auteurs originaux : Linqiang Guo (Peter), Li Gu (Peter), Zihuan Jiang (Peter), Zhixiang Chi (Peter), Siobhan Reid (Peter), Ziqiang Wang (Peter), Yuanhao Yu (Peter), Wei Liu (Peter), Yang Wang (Peter), Tse-Hsun (Peter), Chen

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous enseigniez à un robot comment naviguer dans le monde numérique. Ce robot est un « agent GUI », un assistant intelligent capable de regarder l'écran d'un téléphone, de lire ce qu'il voit et d'appuyer sur des boutons pour suivre vos instructions, comme « réserver un vol » ou « envoyer un SMS ». Pendant un certain temps, ces robots sont devenus plutôt performants, mais seulement s'ils s'entraînent sur les applications exactes qu'ils utiliseront plus tard. C'est comme un élève qui mémorise les réponses d'un examen de mathématiques spécifique mais qui perd ses moyens face à un nouveau manuel scolaire. Le véritable défi survient lorsque le robot rencontre une application qu'il n'a jamais vue auparavant, avec des boutons et des menus qu'il ne reconnaît pas. C'est le problème de l'« application non vue ». Les scientifiques cherchent comment apprendre à ces robots à apprendre à la volée, en utilisant seulement quelques essais pour comprendre comment fonctionne une nouvelle application, sans avoir besoin qu'un humain leur montre le chemin à chaque fois.

Ce document présente un nouveau système ingénieux appelé CoAdapt-GUI qui aide ces agents robots à s'adapter bien mieux aux nouvelles applications qu'auparavant. Imaginez le cerveau du robot comme ayant deux parties : une « politique », qui est son instinct pour appuyer et balayer, et un « workflow » (flux de travail), qui est une liste de contrôle mentale d'étapes et de règles pour accomplir une tâche. Les tentatives précédentes pour aider les robots à apprendre de nouvelles applications consistaient principalement à ajuster leurs instincts (la politique) tout en ignorant leur liste de contrôle. Les auteurs ont découvert que cela ne suffit pas. Si la liste de contrôle du robot est remplie de détails spécifiques aux anciennes applications (comme « cherchez le bouton bleu sur l'écran d'accueil »), il sera confus lorsque la nouvelle application aura un bouton rouge à un endroit différent.

CoAdapt-GUI résout cela en faisant deux choses à la fois. Premièrement, il agit comme un éditeur strict pour la liste de contrôle du robot. Il prend les règles générales que le robot connaît (comme « si vous êtes bloqué, essayez de revenir en arrière ») mais élimine tout détail spécifique aux anciennes applications (comme « le bouton retour est en haut à gauche de l'écran »). Cela crée un guide « propre » qui peut fonctionner n'importe où. Deuxièmement, il permet au robot de s'entraîner sur la nouvelle application et de mettre à jour ses instincts (la politique) en fonction de ce qui fonctionne et de ce qui échoue. La magie opère parce que ces deux parties s'entraident : la liste de contrôle propre aide le robot à mieux s'entraîner, et les résultats de l'entraînement aident le robot à affiner sa liste de contrôle.

Les chercheurs ont testé ce système dans un terrain de jeu numérique appelé AndroidWorld. Dans un test, où le robot devait gérer de nouvelles versions de tâches familières, CoAdapt-GUI a réussi 45,0 % du temps. Il s'agit d'un bond significatif par rapport à la meilleure méthode précédente, qui n'a réussi que 37,5 % du temps. Dans un test plus difficile, où le robot devait apprendre de nouveaux types de tâches qu'il n'avait jamais vus auparavant, le système a augmenté les taux de réussite de 38,6 % à 52,9 %. Le document suggère qu'en séparant le « quoi faire » (workflow) du « comment le faire » (politique) et en nettoyant les instructions avant de les utiliser, les robots peuvent devenir beaucoup plus flexibles et prêts pour le monde réel, où les applications changent constamment.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →