ScreenParse: Moving Beyond Sparse Grounding with Complete Screen Parsing Supervision
यह शोध पत्र ScreenParse को प्रस्तुत करता है, जो 771K स्क्रीनशॉट में 21 मिलियन UI तत्वों के सघन एनोटेशन वाला एक बड़े पैमाने का डेटासेट है, और ScreenVLM को, जो इस डेटा पर प्रशिक्षित एक संक्षिप्त मॉडल है जो स्क्रीन पार्सिंग में बड़े फाउंडेशन मॉडलों से काफी बेहतर प्रदर्शन करता है और हस्तांतरणीय संरचनात्मक पूर्ववृत्तों (structural priors) के माध्यम से ग्राउंडिंग क्षमताओं को बढ़ाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ "Moving Beyond Sparse Grounding with Complete Screen Parsing Supervision" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ अनुवाद दिया गया है।
बड़ी समस्या: "स्पॉटलाइट" बनाम "पूरा कमरा"
कल्पना कीजिए कि आप एक रोबोट को एक व्यस्त लिविंग रूम में नेविगेट करना सिखाने की कोशिश कर रहे हैं।
- पुराना तरीका (Sparse Grounding): वर्तमान AI ट्रेनिंग का अधिकांश हिस्सा एक समय में केवल एक ही वस्तु पर स्पॉटलाइट डालने जैसा है। यदि निर्देश है "रिमोट उठाओ," तो रोबate केवल यह सीखता है कि रिमोट कैसा दिखता है। वह कॉफी टेबल, लैंप, कालीन और टीवी को अनदेखा कर देता है। यदि आप फिर उससे "सोफे पर बैठने" के लिए कहते हैं, तो वह भ्रमित हो सकता है क्योंकि उसने कभी यह नहीं सीखा कि सोफा कहाँ है या वह कैसा दिखता है। वह केवल उन्हीं विशिष्ट चीजों को जानता है जिन्हें खोजने के लिए उसे बताया गया था।
- नया तरीका (ScreenParse): यह पेपर तर्क देता है कि एक वास्तव में स्मार्ट कंप्यूटर एजेंट बनाने के लिए, हमें छत की लाइटें चालू करने और रोबोट को एक बार में पूरा कमरा दिखाने की आवश्यकता है। हमें उसे हर एक वस्तु, वह कहाँ है, उसका नाम क्या है, और वह क्या कहता है, यह सब एक साथ सिखाने की आवश्यकता है।
समाधान: ScreenParse (द "सुपर-मैप")
लेखकों ने ScreenParse नामक एक विशाल नया डेटासेट बनाया है। इसे इंटरनेट के एक विशाल, अत्यंत विस्तृत मानचित्र के रूप में समझें।
- इसमें क्या है? इसमें वेबसाइटों के 771,000 स्क्रीनशॉट शामिल हैं।
- यह कितना विस्तृत है? पिछले मानचित्रों के विपरीत जो केवल "महत्वपूर्ण" बटनों को चिह्नित करते थे, यह मानचित्र सब कुछ चिह्नित करता है। यह 21 मिलियन व्यक्तिगत तत्वों (जैसे बटन, टेक्स्ट बॉक्स, इमेज, लोगो) की पहचान करता है और उन्हें 55 अलग-अलग प्रकारों में से एक के रूप में लेबल करता है।
- पैमाना (Scale): यह एक ऐसे मानचित्र की तरह है जो न केवल मुख्य सड़कों को दिखाता है, बल्कि पूरे शहर के हर घर, मेलबॉक्स, पेड़ और स्ट्रीट साइन को भी दिखाता है।
उन्होंने इसे कैसे बनाया: "Webshot" फैक्ट्री
आप पूछ सकते हैं, "उन्होंने 21 मिलियन आइटम कैसे लेबल किए? क्या उन्होंने लाखों लोगों को काम पर रखा?"
नहीं। उन्होंने Webshot नामक एक स्वचालित फैक्ट्री बनाई।
- द क्रॉलर (The Crawler): इसने 1 मिलियन अलग-अलग वेबसाइटों का दौरा किया (जैसे एक पर्यटक हर सड़क की फोटो लेता है)।
- द स्कैनर (The Scanner): इसने पेज पर दिखने वाले हर तत्व को स्वचालित रूप से खोजने के लिए एक कंप्यूटर प्रोग्राम का उपयोग किया (जैसे एक रोबोट वैक्यूम जो हर धूल के कण को देख सकता है)।
- द एडिटर (The "Judge"): चूंकि कंप्यूटर गलतियाँ कर सकते हैं (जैसे किसी छाया को बटन के रूप में लेबल करना), उन्होंने एक स्मार्ट AI (एक विजन लैंग्वेज मॉडल) का उपयोग एक "क्वालिटी जज" के रूप में किया। इसने कंप्यूटर के काम को देखा, लेबल ठीक किए, और उन स्क्रीनशॉट को हटा दिया जो अव्यवस्थित या भ्रमित करने वाले थे।
स्टार प्लेयर: ScreenVLM (द "कॉम्पैक्ट एक्सपर्ट")
इस नए "सुपर-मैप" के साथ, उन्होंने एक नया AI मॉडल प्रशिक्षित किया जिसे ScreenVLM कहा जाता है।
- उपमा: एक लाइब्रेरी की कल्पना करें। बड़े फाउंडेशन मॉडल्स (जैसे Qwen या InternVL) विशाल, भारी विश्वकोशों की तरह हैं। वे बहुत कुछ जानते हैं, लेकिन उन्हें ले जाना धीमा और महंगा है।
- ScreenVLM एक जेब के आकार की, अत्यधिक विशिष्ट फील्ड गाइड की तरह है। यह बहुत छोटा है (केवल 316 मिलियन पैरामीटर्स), लेकिन क्योंकि इसे "सुपर-मैप" पर प्रशिक्षित किया गया था, यह स्क्रीन के लेआउट को समझने में अविश्वसनीय रूप से कुशल है।
- सीक्रेट सॉस (The Secret Sauce): उन्होंने ScreenVLM को केवल टेक्स्ट पढ़ने के बजाय पेज की "संरचना" (चीजें कहाँ हैं और वे क्या हैं) पर विशेष ध्यान देने के लिए सिखाया। यह एक छात्र को केवल संकेतों पर लिखे शब्दों को याद करने के बजाय, एक इमारत के फ्लोर प्लान को याद करने के लिए सिखाने जैसा है।
परिणाम: यह क्यों मायने रखता है
पेपर ने इस नए दृष्टिकोण का तीन तरीकों से परीक्षण किया:
- परीक्षण: उन्होंने मॉडल्स से पूरे स्क्रीन का वर्णन करने के लिए कहा। ScreenVLM सब कुछ खोजने में बहुत बेहतर था (60% सटीकता) जबकि विशाल, भारी मॉडल्स (जो केवल लगभग 30% सटीकता प्राप्त करते थे) की तुलना में।
- ट्रांसफर: उन्होंने अन्य बड़े मॉडल्स को लिया और उन्हें ScreenParse मैप का उपयोग करके एक "क्रैश कोर्स" दिया। अचानक, वे बड़े मॉडल्स भी स्क्रीन को समझने में बहुत बेहतर हो गए। यह साबित करता है कि "पूरे कमरे" को सीखना एक ऐसा कौशल है जो केवल उनके द्वारा बनाए गए मॉडल की ही नहीं, बल्कि किसी भी रोबोट की मदद करता है।
- गति: क्योंकि ScreenVLM छोटा है, यह बड़े मॉडल्स की तुलना में 4 गुना तेज़ चलता है। इसका मतलब है कि यह केवल एक विशाल डेटा सेंटर में ही नहीं, बल्कि एक साधारण लैपटॉप या फोन पर भी चल सकता है।
निचोड़ (The Bottom Line)
पेपर का दावा है कि बेहतर कंप्यूटर उपयोग करने वाले एजेंट बनाने के लिए, हमें उन्हें एक समय में केवल एक चीज़ खोजने के लिए सिखाना बंद करना होगा। इसके बजाय, हमें उन्हें एक बार में पूरी तस्वीर देखना सिखाना चाहिए। स्क्रीन के हर पिक्सेल और तत्व को लेबल करने वाला एक विशाल डेटासेट बनाकर, उन्होंने एक छोटा, तेज़ और अविश्वसनीय रूप से स्मार्ट AI बनाया जो वर्तमान दिग्गजों से बेहतर तरीके से कंप्यूटर स्क्रीन को समझता है।
यह पेपर क्या दावा नहीं करता है:
- यह दावा नहीं करता कि यह अभी मोबाइल ऐप्स या डेस्कटॉप सॉफ्टवेयर पर पूरी तरह काम करता है (इसका मुख्य ध्यान वेबसाइटों पर रहा है)।
- यह दावा नहीं करता कि यह सभी रोबोट समस्याओं को हल कर देता है, केवल यह कि यह सुधार करता है कि रोबोट कार्य करने से पहले स्क्रीन को कैसे "देखता" और "समझता" है।
- यह चिकित्सा या क्लिनिकल उपयोगों का उल्लेख नहीं करता है; इसका ध्यान पूरी तरह से कंप्यूटर इंटरफेस (GUIs) और वेब पेजों पर है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।