Uncertainty Quantification for Computer-Use Agents: A Benchmark across Vision-Language Models and GUI Grounding Datasets
Oorspronkelijke auteurs: Divake Kumar, Sina Tayebati, Devashri Naik, Amanda Sofie Rios, Nilesh Ahuja, Omesh Tickoo, Ranganath Krishnan, Amit Ranjan Trivedi
Oorspronkelijke auteurs: Divake Kumar, Sina Tayebati, Devashri Naik, Amanda Sofie Rios, Nilesh Ahuja, Omesh Tickoo, Ranganath Krishnan, Amit Ranjan Trivedi
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Technische Samenvatting: Onzekerheidskwantificering voor Computer-gebruik Agenten
Probleemstelling
Computer-gebruik agenten transformeren visuele-taalmodel (VLM) voorspellingen naar uitvoerbare GUI-acties, specifelijk enkelvoudige klikcoördinaten. In tegenstelling tot passieve classificatie, triggert een onjuiste voorspelling in deze context een onbedoelde actie op het gastsysteem. Daarom is betrouwbare onzekerheidskwantificering (Uncertainty Quantification, UQ) essentieel voor kritieke implementatiemechanismen zoals foutafwijzing, kalibratie, miss-severity ranking en het definiëren van ruimtelijke veiligheidsregio's.
Echter, bestaand bewijs over post-hoc UQ voor deze agenten is gefragmenteerd. Eerdere studies evalueren doorgaans geïsoleerde model-datasetparen of specifieke UQ-families, waardoor het onduidelijk blijft of de rangschikking van UQ-methoden stabiel blijft wanneer de agent-architectuur, de benchmark-geometrie of de observeerbare interface (bijv. open-weight internals versus closed-source API's) verandert. De centrale vraag die wordt behandeld is: Wanneer generaliseert UQ in computer-gebruik agenten?
Methodologie: De ARGUS Benchmark
De auteurs introduceren ARGUS (Assessing Regime-wise Generalization of Uncertainty Scoring), een uniforme cross-regime benchmark ontworpen om de overdraagbaarheid van post-hoc UQ-methoden te evalueren.
Experimentele Opzet
- Regimes: Een regime wordt gedefinieerd door de combinatie van een agent, een dataset en een observeerbare modelinterface.
- Modellen:
- Open-weight Panel: 4 VLM-agenten (Qwen2.5-VL-7B, Qwen2.5-VL-72B-AWQ, UI-TARS-1.5-7B, POINTS-GUI-G-8B).
- Closed-source Panel: 3 frontier vendors (GPT-5.4, Claude Sonnet 4.6, Gemini 3.1 Pro) via API alleen.
- Datasets: 4 single-step GUI-grounding benchmarks (SCREENSPOT-V2, SCREENSPOT-PRO, OSWORLD-G, UI-VISION-EG).
- UQ-Methoden:
- Open-weight: 27 methoden over 7 families (Logit, Sampling, Hybrid, Density/Probe, Attention, Verbalised, VLM-native). Deze maken gebruik van interne signalen zoals logits, hidden states en attention maps.
- Closed-source: Een geharmoniseerde subset van 8 methoden die compatibel is met API-only interfaces (waarbij methoden die interne staten vereisen worden geschrapt).
- Evaluatiemetrieken:
- Foutdetectie: AUROC (incorrecte klikken als positieven).
- Selectieve Executie: PRR (oracle-genormaliseerde afwijzingskwaliteit) en AURC.
- Kalibratie: ECE en Brier score (na isotone regressie).
- Gegradeerde Ernst (Graded Severity): AUSE (miss-only sparsification error op genormaliseerde afstand).
- Transfer: Spearman rank correlatie (ρ) tussen UQ-methode rangschikkingen over verschillende regimes.
- Ruimtelijke Dekking (Spatial Coverage): Conformal click-disk radius en coverage gap.
Protocol
De benchmark gebruikt een strikte 80/20 kalibratie/test split die 50 keer wordt herhaald over verschillende seeds. Geleerde probes en density estimators worden alleen getraind op de kalibratiesplit. Alle hoofdcategorieën worden berekend op de uitgesloten testrecords. Voor closed-source modellen worden methoden die interne signalen vereisen die niet beschikbaar zijn, geschrapt in plaats van vervangen door proxies om een eerlijke vergelijking te waarborgen.
Belangrijkste Resultaten
1. Selectieve Transfer van UQ-Rangschikkingen
De belangrijkste bevinding is dat UQ-rangschikkingen selectieve generalisatie vertonen:
- Stabiel binnen vaste Modellen: Rangschikkingen zijn zeer stabiel over datasets voor een vast model. Bijvoorbeeld, in het POINTS-GUI-G model bereikte de cross-dataset transfer een Spearman ρ=0.969. De gemiddelde transfer over alle 120 open-weight paren was ρ=0.705.
- Instabiel over Modelklassen: Rangschikkingen verslechteren aanzienlijk wanneer men beweegt tussen modelklassen (bijv. vanilla VLMs naar specialistische GUI-agenten).
- Instabiel over Interfaces: Transfer van open-weight modellen naar closed-source API's is statistisch niet te onderscheiden van nul. Op de gedeelde 8-methode intersectie was de gemiddelde cross-tier transfer ρ=+0.08 (95% CI bevat nul). Dit impliceert dat UQ-aanbevelingen voor open-weight modellen niet geëxtrapoleerd kunnen worden naar closed-source vendors.
2. Regime-afhankelijke Betrouwbaarheid
Geen enkele enkele UQ-familie domineert alle regimes. De "beste" familie hangt af van de specifieke configuratie:
- Open-weight: Density/Probe methoden (bijv. SAPLMA, SEP, Mahal-RMD) zijn de meest stabiele familie over modellen en datasets heen.
- Closed-source: Verbalised zelfbeoordeling (bijv. Verbalised-1S/2S) en Hybrid methoden (bijv. CCP) presteren het best. Opvallend genoeg behaalde Verbalised-1S een AUROC van 0.966 op Gemini voor SCREENSPOT-V2, gedreven door een scherp bimodale scoreverdeling.
- Modeltransities: Het overstappen van vanilla naar specialistische agenten zorgt ervoor dat Attention, Verbalised, en VLM-native families AUROC verliezen over alle datasets. In contrast blijven Density/Probe methoden relatief stabiel.
3. Divergentie van Doelstellingen
Binaire foutdetectie (AUROC) en gegradeerde miss-severity ranking (AUSE) selecteren vaak verschillende top-methoden. In het open-weight panel kwamen de top-methode voor AUROC en AUSE slechts in 2 van de 16 cellen overeen. Dit geeft aan dat een score die goed is in het identificeren of er een fout is opgetreden, niet noodzakelijkerwijs goed is in het ranken van hoe ernstig de fout is.
4. Beperkingen in Ruimtelijke Dekking
Discriminatie op scoreniveau is onvoldoende voor implementatie. Hoewel conformal click disks (gebruikmakend van plug-in UQ scores) radii met 40–60% kunnen verkleinen vergeleken met vaste baselines, kan de dekking verslechteren onder kalibratie-test of interface mismatch. Zo vertoonde de closed-source dekking systematische onderdekking bij bepaalde vendors, wat suggereert dat marginaal geldige conformal voorspelling een zorgvuldige validatie van exchangeability aannames vereist.
Bijdragen
- Cross-Regime Benchmark: ARGUS biedt de eerste verenigde evaluatie van post-hoc UQ voor uitvoerbare GUI-grounding over open-weight en API-only interfaces, dekkend over 27 methoden en 4 datasets.
- Ranking-Transfer Analyse: Het papier kwantificeert waar UQ-methode rangschikkingen generaliseren (vast model, variërende dataset) en waar ze falen (veranderende modelklasse of interface).
- Geharmoniseerd Protocol: Een strikt protocol voor API-only vergelijking dat proxy-substituties voor niet-beschikbare interne signalen vermijdt, wat een eerlijke cross-tier evaluatie garandeert.
- Regime-afhankelijke Betrouwbaarheid: Bewijs dat modelklasse, API-observabiliteit en ruimtelijke faalgeometrie fundamenteel bepalen welke UQ-families betrouwbaar zijn.
- Implementatie-evaluatie: Uitgebreide beoordeling van UQ voor afwijzing, kalibratie, ernst-ranking en de conformationele ruimtelijke dekking, vergezeld van een vrijgegeven Python-package (
argus-uq) met per-item records en analyse-scripts.
Betekenis en Claims
Het artikel claimt dat onzekerheidskwaliteit geen intrinsieke eigenschap van een UQ-methode is, maar gezamenlijk afhangt van de methode, het model, de dataset-geometrie, de observeerbare interface en de implementatiedoelstelling.
De auteurs benadrukken dat "selectieve transfer" het leidende principe is:
- Niet extrapoleren: UQ-aanbevelingen voor open-weight modellen moeten niet worden geëxtrapoleerd naar closed-source vendors; ze moeten opnieuw gerankt worden op de specifieke doel-kalibratiesplit.
- Niet uitgaan van universaliteit: Een methode die fouten goed rankt voor de ene GUI-agent, kan falen op een andere.
- Niet enkel vertrouwen op scores: Een hoge AUROC garandeert geen ruimtelijke dekking; conformal regio's moeten gevalideerd worden op dekking-gaten.
Het werk concludeert dat implementatie een regime-bewust UQ-panel vereist (een kleine set kandidaat-methoden) in plaats van één universele score, waarbij de definitieve selectie gevalideerd wordt op de specifieke doel-kalibratiesplit. De auteurs brengen argus-uq uit om dit regime-bewuste selectieproces te faciliteren.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.
Ontvang wekelijks de beste machine learning papers.
Vertrouwd door onderzoekers van Stanford, Cambridge en de Franse Academie van Wetenschappen.
Check je inbox om je aanmelding te bevestigen.
Er ging iets mis. Opnieuw proberen?
Geen spam, altijd opzegbaar.