Uncertainty Quantification for Computer-Use Agents: A Benchmark across Vision-Language Models and GUI Grounding Datasets
मूल लेखक: Divake Kumar, Sina Tayebati, Devashri Naik, Amanda Sofie Rios, Nilesh Ahuja, Omesh Tickoo, Ranganath Krishnan, Amit Ranjan Trivedi
मूल लेखक: Divake Kumar, Sina Tayebati, Devashri Naik, Amanda Sofie Rios, Nilesh Ahuja, Omesh Tickoo, Ranganath Krishnan, Amit Ranjan Trivedi
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
तकनीकी सारांश: कंप्यूटर-उपयोग एजेंटों के लिए अनिश्चितता परिमाणीकरण (Uncertainty Quantification)
समस्या विवरण
कंप्यूटर-उपयोग एजेंट विजुअल-लैंग्वेज मॉडल (VLM) के भविष्यवाणियों को निष्पादित GUI क्रियाओं, विशेष रूप से सिंगल-स्टेप क्लिक निर्देशांकों (coordinates) में परिवर्तित करते हैं। निष्क्रिय वर्गीकरण (passive classification) के विपरीत, इस संदर्भ में एक गलत भविष्यवाणी होस्ट सिस्टम पर एक अनचाही क्रिया को ट्रिगर करती है। फलस्वरूप, त्रुटि अस्वीकृति (error rejection), अंशांकन (calibration), चूक-गंभीरता रैंकिंग (miss-severity ranking), और स्थानिक सुरक्षा क्षेत्रों (spatial safety regions) जैसे महत्वपूर्ण परिनियोजन तंत्रों के लिए विश्वसनीय अनिश्चितता परिमाणीकरण (UQ) आवश्यक है।
हालाँकि, इन एजेंटों के लिए पोस्ट-हॉक UQ पर मौजूदा साक्ष्य खंडित हैं। पूर्व अध्ययन आमतौर पर अलग-थलग मॉडल-डेटासेट युग्मों या विशिष्ट UQ परिवारों का मूल्यांकन करते हैं, जिससे यह स्पष्ट नहीं हो पाता कि क्या UQ विधि रैंकिंग तब भी स्थिर रहती है जब एजेंट आर्किटेक्चर, बेंचमार्क ज्यामिति, या अवलोकन योग्य इंटरफ़ेस (जैसे, ओपन-वेट आंतरिक भाग बनाम क्लोज्ड-सोर्स API) बदल जाता है। संबोधित किया गया केंद्रीय प्रश्न है: UQ कब सामान्यीकृत (generalize) होता है?
कार्यप्रणाली: ARGUS बेंचमार्क
लेखक ARGUS (Assessing Regime-wise Generalization of Uncertainty Scoring) पेश करते हैं, जो पोस्ट-हॉक UQ विधियों की हस्तांतरणीयता (transferability) का मूल्यांकन करने के लिए डिज़ाइन किया गया एक एकीकृत क्रॉस-रेजीम बेंचमार्क है।
प्रयोगात्मक सेटअप
- रेजीम (Regimes): एक रेजीम को एक एजेंट, एक डेटासेट और एक अवलोकन योग्य मॉडल इंटरफ़ेस के संयोजन द्वारा परिभाषित किया जाता है।
- मॉडल:
- ओपन-वेट पैनल: 4 VLM एजेंट (Qwen2.5-VL-7B, Qwen2.5-VL-72B-AWQ, UI-TARS-1.5-7B, POINTS-GUI-G-8B)।
- क्लोज्ड-सोर्स पैनल: 3 फ्रंटियर वेंडर्स (GPT-5.4, Claude Sonnet 4.6, Gemini 3.1 Pro) केवल API के माध्यम से।
- डेटासेट: 4 सिंगल-स्टेप GUI-ग्राउंडिंग बेंचमार्क (SCREENSPOT-V2, SCREENSPOT-PRO, OSWORLD-G, UI-VISION-EG)।
- UQ विधियाँ:
- ओपन-वेट: 7 परिवारों में 27 विधियाँ (Logit, Sampling, Hybrid, Density/Probe, Attention, Verbalised, VLM-native)। ये लॉगिट्स, हिडन स्टेट्स और अटेंशन मैप्स जैसे आंतरिक संकेतों का उपयोग करती हैं।
- क्लोज्ड-सोर्स: एक सामंजस्यपूर्ण 8-विधि उपसमुच्चय जो API-केवल इंटरफेस के अनुकूल है (उन विधियों को हटा दिया गया है जिन्हें आंतरिक संकेतों की आवश्यकता होती है)।
- मूल्यांकन मेट्रिक्स:
- त्रुटि पहचान (Error Detection): AUROC (गलत क्लिक को पॉजिटिव के रूप में)।
- चयनात्मक निष्पादन (Selective Execution): PRR (ओरेकल-सामान्यीकृत अस्वीजन गुणवत्ता) और AURC।
- अंशांकन (Calibration): ECE और ब्रायर स्कोर (आइसोटोनिक रिग्रेशन के बाद)।
- श्रेणीबद्ध गंभीरता (Graded Severity): AUSE (सामान्यीकृत दूरी पर मिस-ओनली स्पारसीफिकेशन एरर)।
- हस्तांतरण (Transfer): विभिन्न रेजीमों के बीच UQ विधि रैंकिंग के बीच स्पीयरमैन रैंक सहसंबंध (ρ)।
- स्थानिक कवरेज (Spatial Coverage): कॉन्फॉर्मल क्लिक-डिस्क रेडियस और कवरेज गैप।
प्रोटोकॉल
बेंचमार्क 5 सीड्स पर दोहराए गए 80/20 अंशांकन/टेस्ट स्प्लिट का उपयोग करता है। सीखे गए प्रोब्स और डेंसिटी एस्टिमेटर्स को केवल अंशांकन स्प्लिट पर प्रशिक्षित किया जाता है। सभी मुख्य मेट्रिक्स को होल्ड-आउट टेस्ट रिकॉर्ड्स पर कंप्यूट किया जाता है। क्लोज्ड-सोर्स मॉडलों के लिए, अनुपलब्ध आंतरिक संकेतों की आवश्यकता वाली विधियों को प्रॉक्सी बनाने के बजाय हटा दिया जाता है ताकि निष्पक्ष तुलना सुनिश्चित हो सके।
मुख्य परिणाम
1. UQ रैंकिंग का चयनात्मक हस्तांतरण (Selective Transfer)
प्राथमिक निष्कर्ष यह है कि UQ रैंकिंग चयनात्मक सामान्यीकरण प्रदर्शित करती है:
- निश्चित मॉडलों के भीतर स्थिर: एक निश्चित मॉडल के लिए रैंकिंग डेटासेट के बीच अत्यधिक स्थिर होती है। उदाहरण के लिए, POINTS-GUI-G मॉडल में, क्रॉस-डेटासेट हस्तांतरण ρ=0.969 तक पहुँच गया। सभी 120 ओपन-वेट युग्मों में औसत हस्तांतरण ρ=0.705 था।
- मॉडल क्लास के बीच अस्थिर: मॉडल क्लास के बीच जाने पर (जैसे, वेनिला VLMs से विशेषज्ञ GUI एजेंटों तक) रैंकिंग काफी गिर जाती है।
- इंटरफेस के बीच अस्थिर: ओपन-वेट मॉडलों से क्लोज्ड-सोर्स API में हस्तांतरण सांख्यिकीय रूप से शून्य के समान है। साझा 8-मेथड इंटरसेक्शन पर, औसत क्रॉस-टियर हस्तांतरण ρ=+0.08 था (95% CI शून्य को शामिल करता है)। इसका तात्पर्य है कि ओपन-वेट मॉडलों के लिए UQ सिफारिशों को क्लोज्ड-सोर्स वेंडर्स के लिए अनुमानित (extrapolate) नहीं किया जा सकता है।
2. रेजीम-निर्भर विश्वसनीयता
कोई भी एकल UQ परिवार सभी रेजीमों में हावी नहीं होता है। "सर्वश्रेष्ठ" परिवार विशिष्ट कॉन्फ़िगरेशन पर निर्भर करता है:
- ओपन-वेट: Density/Probe विधियाँ (जैसे, SAPLMA, SEP, Mahal-RMD) मॉडलों और डेटासेट्स के बीच सबसे स्थिर परिवार हैं।
- क्लोज्ड-सोर्स: Verbalised आत्म-आकलन (जैसे, Verbalised-1S/2S) और Hybrid विधियाँ (जैसे, CCP) सर्वश्रेष्ठ प्रदर्शन करती हैं। उल्लेखनीय रूप से, Gemini के लिए SCREENSPOT-V2 पर Verbalised-1S ने 0.966 का AUROC प्राप्त किया, जो एक तीक्ष्ण द्वि-मोडल (bimodal) स्कोर वितरण द्वारा संचालित था।
- मॉडल संक्रमण (Transitions): वेनिला से विशेषज्ञ एजेंटों की ओर बढ़ने से सभी डेटासेट्स में Attention, Verbalised, और VLM-native परिवार का AUROC कम हो जाता है। इसके विपरीत, Density/Probe विधियाँ अपेक्षाकृत स्थिर रहती हैं।
3. उद्देश्यों का विचलन (Divergence of Objectives)
बाइनरी एरर डिटेक्शन (AUROC) और श्रेणीबद्ध मिस-सेवेरिटी रैंकिंग (AUSE) अक्सर अलग-अलग शीर्ष विधियों का चयन करते हैं। ओपन-वेट पैनल में, AUROC और AUSE के लिए शीर्ष विधि केवल 16 सेल में से 2 पर सहमत थी। यह इंगित करता है कि एक स्कोर जो यह पहचानने में अच्छा है कि क्या त्रुटि हुई, वह यह रैंक करने में आवश्यक रूप से अच्छा नहीं है कि त्रुटि कितनी गंभीर है।
4. स्थानिक कवरेज सीमाएँ
स्कोर-स्तर का भेदभाव परिनियोजन के लिए अपर्याप्त है। जबकि कॉन्फॉर्मल क्लिक डिस्क (प्लग-इन UQ स्कोर का उपयोग करके) फिक्स्ड बेसलाइन्स की तुलना में रेडियस को 40-60% तक कम कर सकते हैं, कवरेज अंशांकन-टेस्ट या इंटरफ़ेस मिसमैच के तहत घट सकता है। उदाहरण के लिए, क्लोज्ड-सोर्स कवरेज ने कुछ वेंडरों पर व्यवस्थित अंडर-कवरेज दिखाया, जो बताता है कि मामूली रूप से वैध कॉन्फॉर्मल प्रेडिक्शन के लिए एक्सचेंजबिलिटी धारणाओं का सावधानीपूर्वक सत्यापन आवश्यक है।
योगदान
- क्रॉस-रेजीम बेंचमार्क: ARGUS ओपन-वेट और API-ओनली इंटरफेस दोनों में पोस्ट-हॉक UQ के मूल्यांकन के लिए पहला एकीकृत बेंचमार्क प्रदान करता है, जिसमें 27 विधियाँ और 4 डेटासेट शामिल हैं।
- रैंकिंग-ट्रांसफर विश्लेषण: यह शोध मात्रा निर्धारित करता है कि UQ विधि रैंकिंग कहाँ सामान्य होती है (निश्चित मॉडल, परिवर्तनशील डेटासेट) और कहाँ टूट जाती है (परिवर्तित मॉडल क्लास या इंटरफेस)।
- सामंजस्यपूर्ण प्रोटोकॉल: एक सख्त API-ओनली तुलना प्रोटोकॉल जो अनुपलब्ध आंतरिक संकेतों के लिए प्रॉक्सी प्रतिस्थापन से बचता है, जिससे निष्पक्ष क्रॉस-टियर मूल्यांकन सुनिश्चित होता है।
- रेजीम-निर्भर विश्वसनीयता: साक्ष्य कि मॉडल क्लास, API दृश्यता, और स्थानिक विफलता ज्यामिति यह मौलिक रूप से बदल देती है कि कौन से UQ परिवार विश्वसनीय हैं।
- परिनियोजन मूल्यांकन: अस्वीजन, अंशांकन, गंभीरता रैंकिंग और कॉन्फॉर्मल स्थानिक कवरेज के लिए व्यापक मूल्यांकन, जिसके साथ प्रति-आइटम रिकॉर्ड और विश्लेषण स्क्रिप्ट के साथ एक पायथन पैकेज (
argus-uq) जारी किया गया है।
महत्व और दावे
पेपर का दावा है कि अनिश्चितता की गुणवत्ता किसी UQ विधि का अंतर्निहित गुण नहीं है, बल्कि यह विधि, मॉडल, डेटासेट ज्यामिति, अवलोकन योग्य इंटरफेस और परिनियोजन उद्देश्य पर संयुक्त रूप से निर्भर करती है।
लेखक इस बात पर जोर देते हैं कि "चयनात्मक हस्तांतरण" (selective transfer) ही शासी सिद्धांत है:
- अनुमान न लगाएं: ओपन-वेट मॉडलों के लिए UQ सिफारिशों को क्लोज्ड-सोर्स वेंडरों के लिए अनुमानित नहीं किया जाना चाहिए; उन्हें लक्षित अंशांकन स्प्लिट पर फिर से रैंक किया जाना चाहिए।
- सार्वभौमिकता मानकर न चलें: एक विधि जो एक GUI एजेंट के लिए त्रुटियों को अच्छी तरह से रैंक करती है, वह दूसरे के लिए विफल हो सकती है।
- केवल स्कोर पर भरोसा न करें: उच्च AUROC स्थानिक कवरेज की गारंटी नहीं देता है; कॉन्फॉर्मल क्षेत्रों के लिए कवरेज अंतराल का सत्यापन किया जाना चाहिए।
कार्य यह निष्कर्ष निकालता है कि परिनियोजन के लिए एक एकल सार्वभौमिक स्कोर के बजाय एक रेजीम-जागरूक UQ पैनल (उम्मीदवार विधियों का एक छोटा सेट) की आवश्यकता होती है, जिसका अंतिम चयन विशिष्ट लक्षित अंशांकन स्प्लिट पर सत्यापित किया जाता है। लेखक इस रेजीम-जागरूक चयन प्रक्रिया को सुगम बनाने के लिए argus-uq जारी करते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।
हर हफ़्ते machine learning के बेहतरीन पेपर पाएँ।
Stanford, Cambridge और French Academy of Sciences के रिसर्चर हम पर भरोसा करते हैं।
अपना सब्सक्रिप्शन पक्का करने के लिए इनबॉक्स देखें।
कुछ गड़बड़ हो गई। फिर से कोशिश करें?
कोई स्पैम नहीं, कभी भी अनसब्सक्राइब करें।