Faithful Mobile GUI Agents with Guided Advantage Estimator
यह शोधपत्र Faithful-Agent को प्रस्तुत करता है, जो एक दो-चरणीय ढांचा है जो साक्ष्य-आधारित सुपरवाइज्ड फाइन-ट्यूनिंग को एक गाइडेड एडवांटेज एस्टिमेटर (GuAE) के साथ जोड़कर विजन-लैंग्वेज GUI एजेंटों की विश्वसनीयता को बढ़ाता है, जिससे सामान्य निर्देश-अनुसरण क्षमताओं को बनाए रखते हुए मतिभ्रम (hallucinations) को काफी कम किया जाता है और कार्य सफलता दर में सुधार किया जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, सुशिक्षित रोबोटिक सहायक है जो आपकी फोन स्क्रीन को देख सकता है और आपके निर्देशों का पालन कर सकता है, जैसे कि "मेरे लिए एक iPhone 17 खरीदो" या "मेरा पासवर्ड रीसेट करो।" यह रोबोट एक शक्तिशाली मस्तिष्क (एक विज़न-लैंग्वेज मॉडल) का उपयोग करता है ताकि वह देख सके कि क्या हो रहा है और आप क्या कह रहे हैं।
हालाँकि, यह शोध पत्र एक बड़ी खामी की ओर इशारा करता है: यह रोबोट अक्सर एक "आत्मविश्वासी झूठा" (confident liar) होता है।
समस्या: वह रोबोट जो देखने के बजाय अनुमान लगाता है
लेखक इस व्यवहार को "अविश्वसनीय" (unfaithful) कहते हैं। वास्तविक जीवन में यह ऐसा दिखता है:
- "याददाश्त" का जाल: कल्पना कीजिए कि आप रोबोट से कहते हैं "अपना पासवर्ड रीसेट करें।" रोबोट एक ऐसी स्क्रीन देखता है जो वास्तव में खाली है या किसी विज्ञापन द्वारा ढकी हुई है। यह कहने के बजाय कि "मैं बटन नहीं देख पा रहा हूँ," यह याद रखता है कि आमतौर पर रीसेट बटन ऊपर दाईं ओर होता है। यह बिना देखे वहीं क्लिक कर देता है, भले ही बटन वहां मौजूद न हो। यह वास्तविक साक्ष्य देखने के बजाय एक याद किए गए शॉर्टकट पर निर्भर है।
- "दिवास्वप्न" (Daydream) का जाल: कल्पना कीजिए कि आप कहते हैं "Amazon पर एक iPhone खरीदें," लेकिन स्क्रीन वर्तमान में Apple Music दिखा रही है। रोबोट इस तथ्य को अनदेखा कर देता है कि वह गलत ऐप में है और फोन खरीदने की कोशिश जारी रखता है। वह आपके वास्तविक निर्देश से भटक जाता है क्योंकि वह संदर्भ (context) पर ध्यान नहीं दे रहा है।
रोबोट अनिवार्य रूप से कार्यों को पूरा करने के लिए "भ्रम" (hallucination) का सहारा ले रहा है, यानी वह यह अनुमान लगा रहा है कि वहां क्या होना चाहिए बजाय इसके कि वह जांचे कि वहां क्या है।
समाधान: "Faithful-Agent"
शोधकर्ताओं ने एक नया प्रशिक्षण तरीका बनाया है जिसे Faithful-Agent कहा जाता है। इसे एक सख्त कोच की तरह समझें जो रोबोट को एक नया नियम सिखा रहा है: "अगर आप इसे देख नहीं सकते, तो इसे छुएं नहीं।"
यह प्रशिक्षण दो चरणों में होता है, जैसे गाड़ी चलाना सीखना:
चरण 1: "रुकें और सोचें" का पाठ (SFT)
पहले, वे रोबोट को परहेज करना (abstain) सिखाते हैं।
- उपमा: एक छात्र की कल्पना करें जो परीक्षा दे रहा है। यदि उसे उत्तर नहीं पता है, तो एक सामान्य छात्र बेतहाशा अनुमान लगा सकता है। एक "वफादार" (faithful) छात्र को यह सिखाया जाता है कि हाथ उठाकर कहना, "मेरे पास इस उत्तर के लिए पर्याप्त जानकारी नहीं है।"
- यह कैसे काम करता है: रोबोट को यह पहचानने के लिए प्रशिक्षित किया जाता है कि कब स्क्रीन बाधित है, भ्रमित करने वाली है, या निर्देश से मेल नहीं खाती है। अनुमान लगाने के बजाय, यह "Back" दबाना, "Home" पर जाना, या कार्य को पूरी तरह से रोकना सीख जाता है। यह इसे बेतुके और निराधार अनुमान लगाने से रोकता है।
चरण 2: "स्मार्ट कोच" (RFT के साथ GuAE)
यह सबसे तकनीकी हिस्सा है, लेकिन इसका सरल संस्करण यहाँ है।
रोबोट कई अलग-अलग क्रियाएं करके सीखता है और देखता है कि कौन सी क्रिया उसे "पुरस्कार" (अच्छा स्कोर) दिलाती है। लेकिन वास्तविक दुनिया में, पुरस्कार अक्सर विरल (sparse) होते हैं (आपको पुरस्कार तभी मिलता है जब आप पूरा कार्य पूरा कर लेते हैं) और द्विआधारी (binary) होते हैं (या तो आप सही थे या गलत; "लगभग सही" जैसा कुछ नहीं होता)।
- समस्या: जब रोबलेट 8 अलग-अलग अनुमान लगाता है और वे सभी "गलत" दिखते हैं (या सभी "सही" दिखते हैं), तो प्रशिक्षण प्रणाली भ्रमित हो जाती है। वह यह नहीं बता पाती कि कौन सा अनुमान थोड़ा बेहतर था क्योंकि वे सभी एक जैसे दिखते हैं। लेखक इसे "एडवांटेज कोलैप्स" (Advantage Collapse) कहते हैं। यह एक ऐसे शिक्षक की तरह है जो एक ऐसी कक्षा को ग्रेड देने की कोशिश कर रहा है जहाँ हर छात्र को 50/50 मिला है; शिक्षक यह तय नहीं कर पाता कि किसे अधिक मदद की आवश्यकता है।
- समाधान (GuAE): शोधकर्ताओं ने एक नया "गाइडेड एडवांटेज एस्टिमेटर" (GuAE) बनाया है।
- उपमा: एक कोच की कल्पना करें जो टीम के प्रदर्शन के स्कोर को शून्य तक गिरने से रोकने के लिए मना करता है, भले ही सभी का प्रदर्शन समान क्यों न हो। कोच स्कोरिंग सिस्टम में एक "सुरक्षा एंकर" (safety anchor) जोड़ता है। भले ही टीम संघर्ष कर रही हो, कोच यह सुनिश्चित करता है कि एक स्पष्ट संकेत बना रहे कि, "कोशिश करते रहें, लेकिन अधिक सावधान रहें।"
- यह रोबोट को उस लूप में फंसने से रोकता है जहाँ वह सीखना बंद कर देता है क्योंकि फीडबैक बहुत सपाट दिखता है।
परिणाम
पेपर ने इस नए रोबोट का परीक्षण एक "ट्रैप" (Trap) डेटासेट पर किया (ऐसे परिदृश्य जिन्हें रोबोट को फंसाने के लिए बनाया गया था, जैसे छिपे हुए बटन या गलत ऐप्स)।
- पहले: पुराने रोबोट इन जाल में लगभग 86% बार विफल रहे (सफलता दर केवल ~14% थी)। वे अनुमान लगाते रहे और विफल होते रहे।
- बाद में: Faithful-Agent इन जाल में 80% बार सफल रहा।
सबसे महत्वपूर्ण बात यह है कि रोबोट ने सामान्य कार्यों को करने की अपनी क्षमता नहीं खोई। यह अधिक विश्वसनीय बन गया बिना "मूर्ख" या अत्यधिक सतर्क हुए। इसने सीखा कि "मैं अभी यह नहीं कर सकता" कहना, गलत अनुमान के साथ सिस्टम को क्रैश करने से बेहतर है।
सारांश
यह पेपर AI एजेंटों को यह सिखाने का एक तरीका पेश करता है कि जब सबूत गायब हों तो अनुमान लगाना बंद करें। उन्हें यह सिखाकर कि जब चीजें गलत लगें तो रुकें और पीछे हटें, और एक स्मार्ट स्कोरिंग सिस्टम का उपयोग करके उन्हें तब भी सीखते रहने में मदद करना जब फीडबैक अस्पष्ट हो, रोबोट बहुत अधिक भरोसेमंद हो जाता है और अपनी खुद की वास्तविकता बनाने की संभावना कम हो जाती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।