← नवीनतम पेपर
🤖 AI

OpenMobile: Building Open Mobile Agents with Task and Trajectory Synthesis

OpenMobile एक ओपन-सोर्स फ्रेमवर्क है जो एक स्केलेबल एक्सप्लोरेशन पाइपलाइन और पॉलिसी-स्विचिंग रणनीति के माध्यम से उच्च-गुणवत्ता वाले टास्क निर्देशों और एजेंट ट्रेजेक्टरीज को संश्लेषित करता है, जिससे इसके डेटा पर प्रशिक्षित एजेंटों को मोबाइल बेंचमार्क पर प्रतिस्पर्धी प्रदर्शन प्राप्त करने में सक्षम बनाया जा सके और यह सुनिश्चित किया जा सके कि परिणाम ओवरफिटिंग के बजाय व्यापक कार्यक्षमता से उत्पन्न होते हैं।

मूल लेखक: Kanzhi Cheng, Zehao Li, Zheng Ma, Nuo Chen, Jialin Cao, Qiushi Sun, Zichen Ding, Fangzhi Xu, Hang Yan, Jiajun Chen, Anh Tuan Luu, Jianbing Zhang, Lewei Lu, Dahua Lin

प्रकाशित 2026-04-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kanzhi Cheng, Zehao Li, Zheng Ma, Nuo Chen, Jialin Cao, Qiushi Sun, Zichen Ding, Fangzhi Xu, Hang Yan, Jiajun Chen, Anh Tuan Luu, Jianbing Zhang, Lewei Lu, Dahua Lin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट बटलर (नौकर) को आपका स्मार्टफोन इस्तेमाल करना सिखाना चाहते हैं, जैसे कि "फ्लाइट बुक करना," "रिमाइंडर सेट करना," या "कोई खास फोटो ढूँढना।"

अभी, सबसे उन्नत रोबोट बटलर (जैसे बड़ी टेक कंपनियों के) अविश्वसनीय रूप से स्मार्ट हैं। वे इन कार्यों को लगभग 70% बार कर सकते हैं। लेकिन एक पेच है: वे एक 'ब्लैक बॉक्स' हैं। हमें यह नहीं पता कि उन्हें कैसे सिखाया गया था। उन्होंने गुप्त, निजी डेटा से सीखा है जिसे कोई और नहीं देख सकता।

दूसरी ओर, "ओपन-सोर्स" समुदाय (शौकिया लोग और शोधकर्ता जो अपना काम साझा करते हैं) संघर्ष कर रहा है। वे अपने रोबोट्स को पुरानी, अव्यवस्थित पाठ्यपुस्तकों (पब्लिक डेटासेट्स) का उपयोग करके सिखाने की कोशिश कर रहे हैं, और उनके रोबोट केवल 30% बार सफल होते हैं। वे अंधेरे में फंसे हुए हैं, बस यह अनुमान लगाने की कोशिश कर रहे हैं कि पेशेवरों ने यह कैसे किया होगा।

पेश है "OpenMobile"।

OpenMobile को एक पारदर्शी, ओपन-सोर्स "रोबोट स्कूल" के रूप में सोचें जिसमें कोई भी शामिल हो सकता है। यह एक नया फ्रेमवर्क है जिसे मोबाइल एजेंटों (जो फोन का उपयोग करने वाले रोबट हैं) को सिखाने के लिए डिज़ाइन किया गया है, जो शून्य से अपनी खुद की उच्च-गुणवत्ता वाली प्रशिक्षण सामग्री तैयार करता है।

यह कैसे काम करता है, इसके लिए कुछ सरल उपमाओं (analogies) का उपयोग करते हैं:

1. "सब कुछ की लाइब्रेरी" (टास्क सिंथेसिस)

समस्या: पुराने तरीके रोबोट को यह दिखाकर सिखाने की कोशिश करते थे कि वह एक ऐप में एक बार घूमकर देखता है और फिर अनुमान लगाता है, "ओह, शायद यह यह करने की कोशिश कर रहा है?" यह एक पूरे शहर के नक्शे को सीखने के लिए एक सड़क पर चलने और बाकी मोहल्लों के बारे में अनुमान लगाने जैसा है। आप बहुत कुछ मिस कर देते हैं।

OpenMobile का समाधान:
अनुमान लगाने के बजाय, OpenMobile पहले रोबोट को एक खोज अभियान (scavenger hunt) पर भेजता है।

  • चरण 1: रोबोट 20 अलग-अलग Android ऐप्स के माध्यम से घूमता है, बटन क्लिक करता है और स्क्रीन स्वाइप करता है ताकि यह देख सके कि क्या संभव है। यह एक विशाल "ग्लोबल मेमोरी" (एक विशाल लाइब्रेरी कैटलॉग की तरह) बनाता है जिसमें हर ऐप की हर विशेषता दर्ज होती है।
  • चरण 2: एक बार जब लाइब्रेरी बन जाती है, तो एक शिक्षक (एक AI) उस कैटलॉग को देखता है और नए, रचनात्मक होमवर्क असाइनमेंट लिखता है।
    • उपमा: यह कहने के बजाय कि "लाल बटन क्लिक करें," शिक्षक कहता है, "कुकिंग ऐप में 'स्पाइसी टैकोस' की रेसिपी खोजें, फिर सामग्री को अपनी माँ को टेक्स्ट करें, और अंत में 20 मिनट के लिए एक टाइमर सेट करें।"
    • क्योंकि शिक्षक के पास पूरी लाइब्रेरी है, वह वास्तविक दुनिया पर आधारित जटिल, बहु-चरणीय कार्य बना सकता है, न कि केवल रैंडम अनुमान।

2. "कोच और छात्र" (ट्रैजेक्टरी सिंथेसिस)

समस्या: आमतौर पर, आप एक रोबोट को एक आदर्श उदाहरण (एक "एक्सपर्ट") को कार्य को पूरी तरह से करते हुए दिखाकर सिखाते हैं। रोबोट उस एक्सपर्ट की नकल करता है। लेकिन क्या होता है जब रोबोट गलती करता है? यदि वह केवल आदर्श उदाहरण देखता है, तो उसे पता नहीं चलता कि गलती को कैसे सुधारा जाए। वह घबरा जाता है और असफल हो जाता है।

OpenMobile का समाधान:
OpenMobile एक "पॉलिसी-स्विचिंग" रणनीति का उपयोग करता है। एक छात्र (लर्नर) और एक मास्टर कोच (एक्सपर्ट) को एक साथ काम करते हुए कल्पना करें।

  • छात्र कार्य करने की कोशिश करता है।
  • कोच बारीकी से देखता है। जब तक छात्र ठीक से काम कर रहा है, छात्र चलता रहता है।
  • जादुई क्षण: जिस क्षण छात्र पटरी से उतरने लगता है (जैसे, गलत बटन क्लिक करना), कोच तुरंत हस्तक्षेप करता है, गलती को ठीक करता है, और छात्र को सही रास्ते पर वापस लाता है।
  • परिणाम: रोबोट न केवल सफल होना सीखता है, बल्कि विफलता से उबरना भी सीखता है। वह सीखता है कि गलती करना दुनिया का अंत नहीं है; यह रास्ता सुधारने का सिर्फ एक मौका है। यही वह "सीक्रेट सॉस" है जिसे अधिकांश अन्य ओपन-सोर्स तरीके मिस कर देते हैं।

3. परिणाम: अंतर को कम करना

टीम ने इस पद्धति का उपयोग करके 2,800 जटिल कार्यों और 34,000 एक्शन स्टेप्स का डेटासेट बनाने के लिए किया। उन्होंने अपने रोबोट्स को इस डेटा पर प्रशिक्षित किया और तीन प्रमुख बेंचमार्क (मोबाइल रोबोट्स के "ओलंपिक्स" की तरह) पर उनका परीक्षण किया।

  • पहले: ओपन-सोर्स रोबोट लगभग 30% स्कोर कर रहे थे।
  • बाद में: उनके रोबोटों ने सबसे कठिन टेस्ट में 51.7% और यहाँ तक कि 64.7% स्कोर किया।
  • फैसला: वे अब बड़ी टेक कंपनियों के गुप्त, क्लोज्ड-सोर्स दिग्गजों के साथ प्रतिस्पर्धा करने योग्य हैं, जो यह साबित करता है कि सुपर-स्मार्ट रोबोट बनाने के लिए आपको ब्लैक बॉक्स की आवश्यकता नहीं है।

यह क्यों मायने रखता है

पेपर इस बड़े डर को भी संबोधित करता है: "क्या उन्होंने केवल टेस्ट के सवालों को रटकर धोखाधड़ी की है?"
उन्होंने एक "प्लेजरिज्म चेक" (साहित्यिक चोरी की जांच) चलाया और पाया कि हालांकि उनका ट्रेनिंग डेटा टेस्ट ऐप्स से संबंधित था, लेकिन वह विशिष्ट टेस्ट प्रश्नों की नकल नहीं कर रहा था। रोबोट बेहतर हुए क्योंकि उन्होंने सोचना और गलतियों को ठीक करना सीखा, न कि इसलिए कि उन्होंने उत्तर रट लिए थे।

संक्षेप में: OpenMobile एक टूलकिट है जो किसी को भी एक ऐसा रोबोट बटलर बनाने की अनुमति देता है जो स्मार्ट, अनुकूलन योग्य है, और जानता है कि चीजें गलत होने पर कैसे संभलना है, और वह भी बिना किसी गुप्त कॉर्पोरेट डेटा के। यह केवल केक बेचने के बजाय, सबको परफेक्ट केक बनाने की रेसिपी देने जैसा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →