Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining
यह शोध पत्र Video2GUI को प्रस्तुत करता है, जो एक स्वचालित ढांचा (framework) है जो डेटा की कमी को दूर करने और मल्टीमॉडल GUI एजेंटों के सामान्यीकरण प्रदर्शन (generalization performance) को महत्वपूर्ण रूप से बढ़ाने के लिए अनलेबल इंटरनेट वीडियो से 12 मिलियन GUI इंटरेक्शन प्रक्षेपवक्रों (trajectories) का एक बड़े पैमाने पर डेटासेट संश्लेषित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को कंप्यूटर, फोन या वेबसाइट का उपयोग करना सिखाना चाहते हैं। ऐसा करने के लिए, आपको उसे लोगों द्वारा बटन क्लिक करने, टेक्स्ट टाइप करने और पेजों को स्क्रॉल करने के लाखों उदाहरण दिखाने होंगे।
समस्या यह है कि इन उदाहरणों को ढूंढना अविश्वसनीय रूप से कठिन है। आमतौर पर, शोधकर्ताओं को हर एक क्लिक को मैन्युअल रूप से रिकॉर्ड और लेबल करने के लिए लोगों को काम पर रखना पड़ता है, जो धीमा, महंगा है और उन्हें केवल कुछ ही प्रकार के ऐप्स तक सीमित कर देता है। यह एक डिक्शनरी के केवल कुछ पन्ने पढ़कर भाषा सीखने की कोशिश करने जैसा है।
Video2GUI एक नया सिस्टम है जो इसे हल करता है, यह पूरे इंटरनेट को एक विशाल, मुफ्त क्लासरूम में बदलकर। यह कैसे काम करता है, यहाँ इसके सरल रूपक दिए गए हैं:
1. द ग्रेट फिल्टर (सही वीडियो खोजना)
इंटरनेट वीडियो से भरा हुआ है, लेकिन अधिकांश वीडियो रोबोट को सिखाने के लिए बेकार हैं (जैसे कुकिंग शो या बिल्ली के वीडियो)। शोधकर्ताओं ने 500 मिलियन यूट्यूब वीडियो से शुरुआत की।
- द रफ सिफ्ट (मोटा छँटनी): सबसे पहले, उन्होंने शीर्षकों और विवरणों को स्कैन करने के लिए एक स्मार्ट AI का उपयोग किया। यह एक लाइब्रेरियन की तरह है जो किताबों को खोलने से पहले ही यह देखने के लिए उनकी स्पाइन्स (Spines) की जाँच करता है कि क्या वे "कंप्यूटर" के बारे में हैं। इसने ढेर को घटाकर 20 मिलियन कर दिया।
- द फाइन सिफ्ट (बारीक छँटनी): इसके बाद, उन्होंने उन वीडियो के पहले एक मिनट को वास्तव में "देखने" के लिए एक अधिक उन्नत AI का उपयोग किया। इसने जाँच की: क्या स्क्रीन स्पष्ट है? क्या आवाज चरणों को अच्छी तरह समझा रही है? क्या यह वास्तव में सॉफ्टवेयर का उपयोग करना दिखा रहा है? यह उच्च गुणवत्ता वाले ट्यूटोरियल सुनिश्चित करने के लिए वीडियो को ग्रेड देने वाले एक सख्त शिक्षक की तरह है।
- परिणाम: उनके पास 4.2 मिलियन उच्च गुणवत्ता वाले ट्यूटोरियल वीडियो बचे।
2. द ट्रांसलेटर (वीडियो को निर्देशों में बदलना)
अब उनके पास वीडियो थे, लेकिन एक रोबोट वीडियो को वैसे नहीं समझ सकता जैसे एक इंसान समझता है। वीडियो को निर्देशों की एक संरचित सूची में अनुवादित करने की आवश्यकता होती है।
- प्रक्रिया: उन्होंने वीडियो को देखने और उन्हें तोड़ने के लिए एक शक्तिशाली AI (एक सुपर-स्मार्ट ट्रांसलेटर की तरह) का उपयोग किया। इसने लक्ष्य (जैसे, "जूते खरीदना"), लिए गए चरणों और प्रत्येक क्लिक के सटीक क्षण की पहचान की।
- जादू: AI ने केवल अनुमान नहीं लगाया; इसने बटन क्लिक किए जा रहे स्थानों के सटीक निर्देशांक (coordinates) खोजने के लिए वीडियो फ्रेमों को देखा। इसने किसी व्यक्ति के ऑनलाइन शॉपिंग करने के 10 मिनट के वीडियो को एक सटीक, चरण-दर-चरण मानचित्र में बदल दिया: "0:05 पर, सर्च बार पर क्लिक करें। 0:10 पर, 'sneakers' टाइप करें।"
3. द लाइब्रेरी (WildGUI)
इन सभी अनुवादित निर्देशों को WildGUI नामक एक विशाल नई लाइब्रेरी में एकत्र किया गया था।
- पैमाना: इस लाइब्रेरी में 12 मिलियन इंटरैक्शन पाथ (ट्रैजेक्टरीज) शामिल हैं जो 1,500 से अधिक विभिन्न ऐप्स और वेबसाइटों को कवर करते हैं।
- विविधता: इसमें विंडोज डेस्कटॉप से लेकर एंड्रॉइड फोन और मैक कंप्यूटर तक सब कुछ शामिल है। यह एक ऐसी लाइब्रेरी होने जैसा है जिसमें मानव ने कभी भी कंप्यूटर का उपयोग करने के हर संभावित तरीके को व्यवस्थित और अध्ययन के लिए तैयार रखा है।
4. द ट्रेनिंग (रोबोट को सिखाना)
शोधकर्ताओं ने दो मौजूदा AI मॉडल्स (Qwen2.5-VL और Mimo-VL) को लिया और उन्हें इस नई लाइब्रेरी से "फीड" किया।
- परिणाम: इस विशाल डेटासेट का अध्ययन करने के बाद, रोबोट काफी बेहतर हो गए। वे विभिन्न परीक्षणों पर 5% से 20% तक सुधर गए।
- प्रमाण: अब वे बटन ढूंढ सकते थे, सही चीजों पर क्लिक कर सकते थे और जटिल वेबसाइटों को नेविगेट कर सकते थे, जो मौजूदा सर्वश्रेष्ठ रोबोटों के बराबर या उनसे बेहतर था।
निचोड़
पेपर का दावा है कि इंटरनेट वीडियो को ट्रेनिंग डेटा में बदलने की प्रक्रिया को स्वचालित करके, उन्होंने एक विशाल, विविध डेटासेट बनाया जो AI एजेंटों को कंप्यूटर का उपयोग करने में बहुत स्मार्ट बनाता है। उन्होंने एक नए प्रकार का रोबोट नहीं बनाया; उन्होंने बस मौजूदा रोबोटों को अध्ययन करने के लिए एक बहुत बेहतर, बड़ा और अधिक विविध टेक्स्टबुक दे दी।
उन्होंने इस डेटासेट और इसे बनाने के लिए उपयोग किए गए टूल्स को जारी कर दिया है ताकि अन्य शोधकर्ता भविष्य में और भी बेहतर AI एजेंट बनाने के लिए इनका उपयोग कर सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।