Uncertainty Quantification for Computer-Use Agents: A Benchmark across Vision-Language Models and GUI Grounding Datasets
Auteurs originaux : Divake Kumar, Sina Tayebati, Devashri Naik, Amanda Sofie Rios, Nilesh Ahuja, Omesh Tickoo, Ranganath Krishnan, Amit Ranjan Trivedi
Auteurs originaux : Divake Kumar, Sina Tayebati, Devashri Naik, Amanda Sofie Rios, Nilesh Ahuja, Omesh Tickoo, Ranganath Krishnan, Amit Ranjan Trivedi
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Résumé Technique : Quantification de l'Incertitude pour les Agents d'Utilisation de l'Ordinateur
Énoncé du Problème
Les agents d'utilisation de l'ordinateur transforment les prédictions de modèles visuels-langage (VLM) en actions GUI exécutables, spécifiquement des coordonnées de clic en une seule étape. Contrairement à la classification passive, une prédiction incorrecte dans ce contexte déclenche une action involontaire sur le système hôte. Par conséquent, une quantification de l'incertitude (UQ) fiable est essentielle pour les mécanismes de déploiement critiques tels que le rejet d'erreur, le calibrage, le classement par sévérité de l'erreur et la définition de régions de sécurité spatiale.
Cependant, les preuves existantes concernant l'UQ post-hoc pour ces agents sont fragmentées. Les études antérieures évaluent généralement des paires modèle-jeu de données isolées ou des familles d'UQ spécifiques, laissant planer l'incertitude quant à savoir si les classements des méthodes d'UQ restent stables lorsque l'architecture de l'agent, la géométrie du benchmark ou l'interface observable (par exemple, les internes en open-weights versus les API propriétaires) changent. La question centrale abordée est la suivante : Quand l'UQ généralise-t-elle pour les agents d'utilisation de l'ordinateur ?
Méthodologie : Le Benchmark ARGUS
Les auteurs introduisent ARGUS (Assessing Regime-wise Generalization of Uncertainty Scoring), un benchmark unifié trans-régime conçu pour évaluer la transférabilité des méthodes d'UQ post-hoc.
Configuration Expérimentale
- Régimes : Un régime est défini par la combinaison d'un agent, d'un jeu de données et d'une interface de modèle observable.
- Modèles :
- Panel Open-weight : 4 agents VLM (Qwen2.5-VL-7B, Qwen2.5-VL-72B-AWQ, UI-TARS-1.5-7B, POINTS-GUI-G-8B).
- Panel Closed-source : 3 fournisseurs de pointe (GPT-5.4, Claude Sonnet 4.6, Gemini 3.1 Pro) via API uniquement.
- Jeux de Données : 4 benchmarks de localisation GUI en une étape (SCREENSPOT-V2, SCREENSPOT-PRO, OSWORLD-G, UI-VISION-EG).
- Méthodes d'UQ :
- Open-weight : 27 méthodes à travers 7 familles (Logit, Échantillonnage, Hybride, Densité/Sonde, Attention, Verbalisation, VLM-native). Celles-ci utilisent des signaux internes comme les logits, les états cachés et les cartes d'attention.
- Closed-source : Un sous-ensemble harmonisé de 8 méthodes compatible avec les interfaces via API uniquement (supprimant les méthodes nécessitant des états internes).
- Métriques d'Évaluation :
- Détection d'Erreur : AUROC (clics incorrects comme positifs).
- Exécution Sélective : PRR (qualité de rejet normalisée par l'oracle) et AURC.
- Calibrage : ECE et score de Brier (après régression isotonique).
- Sévérité Graduée : AUSE (erreur de sparsification sur la distance normalisée uniquement sur les manqués).
- Transfert : Corrélation de rang de Spearman (ρ) entre les classements des méthodes d'UQ à travers différents régimes.
- Couverture Spatiale : Rayon du disque de clic conforme et écart de couverture.
Protocole
Le benchmark utilise une division stricte 80/20 calibration/test répétée sur 50 graines (seeds). Les sondes apprises et les estimateurs de densité sont entraînés uniquement sur la partie calibration. Toutes les métriques principales sont calculées sur les enregistrements de test mis en réserve. Pour les modèles fermés (closed-source), les méthodes nécessitant des signaux internes indisponibles sont supprimées plutôt que remplacées par des proxies afin de garantir une comparaison équitable.
Résultats Clés
1. Transfert Sélectif des Classements d'UQ
La conclusion principale est que les classements d'UQ présentent une généralisation sélective :
- Stable au sein des Modèles Fixes : Les classements sont hautement stables à travers les jeux de données pour un modèle donné. Par exemple, pour le modèle POINTS-GUI-G, le transfert entre jeux de données a atteint un Spearman ρ=0,969. Le transfert moyen à travers les 120 paires open-weight était de ρ=0,705.
- Instable entre les Classes de Modèles : Les classements se dégradent considérablement lors du passage entre les classes de modèles (par exemple, des VLM classiques aux agents spécialisés en GUI).
- Instable entre les Interfaces : Le transfert des modèles open-weight vers les API closed-source est statistiquement indiscernable de zéro. Sur l'intersection partagée des 8 méthodes, le transfert moyen entre les deux niveaux était de ρ=+0,08 (l'IC à 95 % inclut zéro). Cela implique que les recommandations d'UQ pour les modèles open-weight ne peuvent pas être extrapolées aux fournisseurs closed-source.
2. Fiabilité Dépendante du Régime
Aucune famille d'UQ unique ne domine tous les régimes. La "meilleure" famille dépend de la configuration spécifique :
- Open-weight : Les méthodes de Densité/Sonde (ex: SAPLMA, SEP, Mahal-RMD) sont la famille la plus stable à travers les modèles et les jeux de données.
- Closed-source : L'auto-évaluation Verbalisée (ex: Verbalised-1S/2S) et les méthodes Hybrides (ex: CCP) performent le mieux. Notamment, Verbalised-1S a atteint un AUROC de 0,966 sur Gemini pour SCREENSPOT-V2, porté par une distribution de score fortement bimodale.
- Transitions de Modèles : Le passage des modèles classiques aux agents spécialistes provoque une perte d'AUROC pour les familles Attention, Verbalisée et VLM-native sur tous les jeux de données. En revanche, les méthodes de Densité/Sonde restent relativement stables.
3. Divergence des Objectifs
La détection d'erreur binaire (AUROC) et le classement de la sévérité des manqués graduée (AUSE) sélectionnent souvent des méthodes différentes. Dans le panel open-weight, la meilleure méthode pour l'AUROC et l'AUSE ne concordait que sur 2 cellules sur 16. Cela indique qu'une méthode bonne pour identifier si une erreur s'est produite n'est pas nécessairement bonne pour classer quelle est la sévérité de l'erreur.
4. Limitations de la Couverture Spatiale
La discrimination au niveau du score est insuffisante pour le déploiement. Bien que les disques de clic conformes (utilisant des scores d'UQ injectés) puissent réduire les rayons de 40 à 60 % par rapport aux lignes de base fixes, la couverture peut se dégrader en cas de désaccords de calibration-test ou d'interface. Par exemple, la couverture des modèles closed-source a montré une sous-couverture systématique sur certains fournisseurs, suggérant que la prédiction conforme marginalement valide nécessite une validation prudente des hypothèses d'échangeabilité.
Contributions
- Benchmark Trans-Régime : ARGUS fournit la première évaluation unifiée de l'UQ post-hoc pour la localisation GUI exécutable à travers les interfaces open-weight et API uniquement, couvrant 27 méthodes et 4 jeux de données.
- Analyse du Transfert de Classement : L'article quantifie là où les classements des méthodes d'UQ généralisent (modèle fixe, jeu de données variable) et là où ils échouent (changement de classe de modèle ou d'interface).
- Protocole Harmonisé : Un protocole strict pour la comparaison via API qui évite les substitutions de proxies pour les signaux internes indisponibles, garantissant une évaluation équitable entre les niveaux.
- Fiabilité Dépendante du Régime : Preuve que la classe du modèle, l'observabilité de l'API et la géométrie d'échec spatiale modifient fondamentalement les familles d'UQ fiables.
- Évaluation du Déploiement : Évaluation complète de l'UQ pour le rejet, le calibrage, le classement de la sévérité et la couverture spatiale conforme, accompagnée de la publication d'un package Python (
argus-uq) avec les enregistrements par item et les scripts d'analyse.
Signification et Revendications
L'article affirme que la qualité de l'incertitude n'est pas une propriété intrinsèque d'une méthode d'UQ, mais dépend conjointement de la méthode, du modèle, de la géométrie du jeu de données, de l'interface observable et de l'objectif de déploiement.
Les auteurs soulignent que le "transfert sélectif" est le principe directeur :
- Ne pas extrapoler : Les recommandations d'UQ pour les modèles open-weight ne doivent pas être extrapolées aux fournisseurs closed-source ; elles doivent être re-classées sur le split de calibration cible.
- Ne pas supposer l'universalité : Une méthode qui classe bien les erreurs pour un agent GUI peut échouer pour un autre.
- Ne pas se fier uniquement aux scores : Un AUROC élevé ne garantit pas une couverture spatiale ; les régions conformes doivent être validées pour les écarts de couverture.
Le travail conclut que le déploiement nécessite un panel d'UQ conscient du régime (un petit ensemble de méthodes candidates) plutôt qu'un score universel unique, la sélection finale devant être validée sur le split de calibration spécifique. Les auteurs publient argus-uq pour faciliter ce processus de sélection conscient du régime.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.
Recevez les meilleurs articles machine learning chaque semaine.
Adopté par des chercheurs de Stanford, Cambridge et de l'Académie des sciences.
Vérifiez votre boîte mail pour confirmer votre inscription.
Quelque chose s'est mal passé. Réessayer ?
Pas de spam, désinscription à tout moment.