POINTS-GUI-G: GUI-Grounding Journey
यह शोध पत्र POINTS-GUI-G-8B को प्रस्तुत करता है, जो एक ऐसा अत्याधुनिक GUI ग्राउंडिंग मॉडल है जिसे न्यूनतम स्थानिक जागरूकता वाले बेस से परिष्कृत डेटा इंजीनियरिंग, बेहतर प्रशिक्षण रणनीतियों और सत्यापन योग्य पुरस्कारों के साथ सुदृढीकरण लर्निंग (reinforcement learning) का लाभ उठाकर कई बेंचमार्क पर उत्कृष्ट प्रदर्शन प्राप्त करने के लिए प्रशिक्षित किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही स्मार्ट रोबोट असिस्टेंट है जो टेक्स्ट पढ़ सकता है और तस्वीरों को देख सकता है। आप उसे अपने कंप्यूटर या फोन का उपयोग करना सिखाना चाहते हैं, ठीक वैसे ही जैसे आप करते हैं। लेकिन एक समस्या है: रोबोट निर्देश तो पढ़ सकता है ("लाल बटन पर क्लिक करें"), लेकिन उसे यह नहीं पता कि स्क्रीन पर वह लाल बटन वास्तव में कहाँ है। यह वैसा ही है जैसे किसी को शहर का नक्शा दे दिया जाए लेकिन यह न बताया जाए कि वह वर्तमान में किस सड़क पर खड़ा है।
यह पेपर POINTS-GUI-G का परिचय देता है, जो उस रोबोट असिस्टेंट का एक नया संस्करण है जिसने आखिरकार स्क्रीन को देखना और यह कहना सीख लिया है, "आह, मुझे बटन दिख गया! यह इन सटीक निर्देशांकों (coordinates) पर है।"
यहाँ बताया गया है कि शोधकर्ताओं ने इस रोबोट को स्क्रीन का उस्ताद बनाने के लिए कैसे प्रशिक्षित किया, जिसे सरल उपमाओं के माध्यम से समझाया गया है:
1. शुरुआती बिंदु: एक खाली स्लेट (A Blank Slate)
अधिकांश अन्य शोधकर्ता एक ऐसे रोबोट को लेते थे जो चीजें खोजने में पहले से ही अच्छा था (जैसे कि एक अनुभवी जासूस) और बस उसे कुछ और सुराग दे देते थे। इस पेपर के लेखकों ने एक ऐसे रोबोट से शुरुआत करने का निर्णय लिया जो चीजें खोजने में खराब था। वे इस कौशल को ज़मीन से बनाना चाहते थे, जैसे कि एक बच्चे को पढ़ना सिखाना, बजाय इसके कि केवल एक किशोर की वर्तनी (spelling) को सुधारें। उन्होंने "POINTS-1.5" नामक एक बेस मॉडल से शुरुआत की जिसमें स्क्रीन पर चीजों की ओर इशारा करने की लगभग कोई क्षमता नहीं थी।
2. सफलता के तीन स्तंभ
इस "अंधे" रोबोट को "दृष्टि संपन्न" बनाने के लिए, उन्होंने तीन मुख्य रणनीतियों का उपयोग किया:
A. पाठ्यपुस्तकों की सफाई और व्यवस्था (Refined Data Engineering)
कल्पना कीजिए कि आप एक छात्र को ढेर सारी पाठ्यपुस्तकों का उपयोग करके पढ़ा रहे हैं। कुछ किताबें इंच का उपयोग करती हैं, कुछ सेंटीमीटर का, कुछ अंग्रेजी में लिखी गई हैं, और अन्य फ्रेंच में। कुछ पन्ने फटे हुए हैं, और कुछ पर scribbles (लकीरें) बनी हुई हैं। इससे सीखना एक बुरा सपना होगा।
शोधकर्ताओं ने इसे ठीक करने के लिए तीन चीजें कीं:
- मानकीकरण (Standardization): उन्होंने सभी बिखरे हुए, अलग-अलग डेटासेट्स को लिया और उन्हें एक एकल प्रारूप (format) में बदल दिया। अब, हर "कोऑर्डिनेट" (स्थान) को एक ही तरह से मापा जाता है, जैसे कि सब कुछ एक मानक पैमाने में बदलना।
- शोर में कमी (Noise Reduction): उन्होंने सख्त संपादकों की तरह काम किया। उन्होंने यह जांचने के लिए एक विशेष टूल (जिसे OmniParser-v2 कहा जाता है) का उपयोग किया कि क्या पाठ्यपुस्तकें सही हैं। यदि पाठ्यपुस्तक कहती थी "बटन यहाँ है" लेकिन तस्वीर स्पष्ट रूप से दिखाती थी कि बटन कहीं और था, तो उन्होंने उस पन्ने को बाहर फेंक दिया। उन्होंने केवल सटीक उदाहरणों को ही रखा।
- इसे कठिन बनाना (Making it Harder): एक बार जब रोबोट बड़े, स्पष्ट बटनों को खोजने में अच्छा हो गया, तो शोधकर्ताओं ने उसे "हार्ड मोड" की पहेलियाँ देना शुरू कर दिया। उन्होंने ऐसी स्क्रीन्स बनाईं जिनमें छोटे, भीड़भाड़ वाले बटन और भ्रमित करने वाले लेआउट थे (जैसे कि कागजों से भरी एक अव्यवस्थित मेज) ताकि रोबोट को अधिक सटीक और तेज बनने के लिए मजबूर किया जा सके।
B. आँखों को ट्यून करना (Improved Training Strategies)
आमतौर पर, इन AI मॉडल्स को प्रशिक्षित करते समय, उनकी "आँखें" (कंप्यूटर का वह हिस्सा जो छवियों को प्रोसेस करता है) अपनी जगह पर जमी रहती हैं। शोधकर्ताओं ने महसूस किया कि स्क्रीन पर बटन खोजने के लिए, आँखों का लचीला होना आवश्यक है।
- विज़न को अनफ्रीज़ करना (Unfreezing the Vision): उन्होंने "आँखों" को तब सीखने और तालमेल बिठाने दिया जब बाकी दिमाग सीख रहा था। इससे रोबोट को सूक्ष्म विवरणों को पहचानने में बेहतर होने में मदद मिली।
- रेज़ोल्यूशन निरंतरता (Resolution Consistency): कल्पना कीजिए कि आप 5 फीट की दूरी से बास्केटबॉल के घेरे में शॉट मारने का अभ्यास कर रहे हैं, लेकिन फिर आप वास्तविक खेल में पहुँचते हैं जहाँ घेरा 10 फीट दूर है। आप चूक जाएंगे। शोधकर्ताओं ने देखा कि उनका रोबोट छोटी, कम-रेज़ोल्यूशन वाली छवियों पर अभ्यास कर रहा था लेकिन उसका परीक्षण विशाल, हाई-डेफिनिशन स्क्रीन्स पर किया जा रहा था। उन्होंने बड़ी, स्पष्ट छवियों पर रोबोट को प्रशिक्षित करके इसे ठीक किया ताकि उसका "विज़न" वास्तविक चीज़ के लिए तैयार रहे।
C. वीडियो गेम रिवॉर्ड सिस्टम (Reinforcement Learning)
यह सबसे अनूठा हिस्सा है। आमतौर पर, Reinforcement Learning (RL) का उपयोग रोबोट को सोचने या तर्क संबंधी पहेलियाँ हल करने के लिए सिखाने के लिए किया जाता है। यहाँ, उन्होंने इसका उपयोग रोबोट को देखना सिखाने के लिए किया।
इसे एक वीडियो गेम की तरह समझें:
- रोबोट अनुमान लगाता है कि बटन कहाँ है।
- कंप्यूटर जाँचता है: "क्या आपने बटन को हिट किया?"
- हाँ? +100 अंक।
- नहीं? 0 अंक।
चूंकि उत्तर या तो सही होता है या गलत (इसमें "शायद" जैसा कुछ नहीं होता), इसलिए रोबोट को बहुत स्पष्ट फीडबैक मिलता है। शोधकर्ताओं ने पाया कि यह "कोशिश करो, स्कोर प्राप्त करो, फिर से कोशिश करो" वाला लूप इस मॉडल को केवल उदाहरण दिखाने और यह कहने की तुलना में बहुत अधिक सटीक बनाता है कि "यह सही है।"
परिणाम
इन तीन विधियों को संयोजित करके, POINTS-GUI-G मॉडल स्क्रीन पर चीजें खोजने में चैंपियन बन गया।
- इसने कई अन्य मॉडल्स को हराया जो बहुत बड़े और महंगे थे।
- इसने उन टेस्ट्स पर अविश्वसनीय रूप से उच्च स्कोर किया जो यह मापते हैं कि एक रोबोट फोन, कंप्यूटर और वेबसाइटों पर बटन, टेक्स्ट और आइकन को कितनी अच्छी तरह खोज सकता है।
संक्षेप में: यह पेपर दिखाता है कि यदि आप अपने प्रशिक्षण डेटा को साफ करते हैं, अपने मॉडल की "आँखों" को स्वतंत्र रूप से सीखने देते हैं, और एक सख्त "सही-या-गलत" रिवॉर्ड सिस्टम का उपयोग करते हैं, तो आप एक छोटा, कुशल रोबोट बना सकते हैं जो कई विशाल, महंगे विकल्पों की तुलना में आपके कंप्यूटर स्क्रीन को नेविगेट करने में बेहतर है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।