← नवीनतम पेपर
💬 NLP

UI-MOPD: Multi-Platform On-Policy Distillation for Unified GUI Agents

यह शोध पत्र UI-MOPD प्रस्तुत करता है, जो एक नवीन ढांचा है जो एक एकीकृत क्रॉस-प्लेटफॉर्म GUI एजेंट को प्रशिक्षित करने के लिए मल्टी-टीचर ऑन-पॉलिसी डिस्टिलेशन और नव निर्मित Uni-GUI डेटासेट का लाभ उठाता है, जो विशेष रूप से डेस्कटॉप और मोबाइल विशेषज्ञता को प्रभावी ढंग से एकीकृत करते हुए दुर्लभ डेटा और विविध इंटरैक्शन परंपराओं से संबंधित चुनौतियों को दूर करता है।

मूल लेखक: Niu Lian, Tongbo Chen, Zhehao Yu, Chengzhen Duan, Fazhan Liu, Hui Liu, Pei Fu, Jian Luan, Heng Qu, Shu-Tao Xia, Jinpeng Wang

प्रकाशित 2026-08-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Niu Lian, Tongbo Chen, Zhehao Yu, Chengzhen Duan, Fazhan Liu, Hui Liu, Pei Fu, Jian Luan, Heng Qu, Shu-Tao Xia, Jinpeng Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ आपका डिजिटल सहायक एक मास्टर शेफ (मुख्य रसोइया) है। लेकिन यहाँ एक मोड़ है: इस शेफ को एक ही समय में दो पूरी तरह से अलग रसोईघरों में खाना बनाना है। एक रसोई हाई-टेक डेस्कटॉप कंप्यूटर है जिसमें एक विशाल स्क्रीन, एक माउस और एक कीबोर्ड है। दूसरी रसोई एक चिकना, जेब में समा जाने वाला मोबाइल फोन है जिसमें टच स्क्रीन है और कोई भौतिक बटन नहीं है। कंप्यूटर वाली रसोई में, "पीछे जाने" (going back) का अर्थ एक विंडो को बंद करना हो सकता है। फोन वाली रसोई में, इसका अर्थ एक छोटे से "बैक" तीर (arrow) को टैप करना हो सकता है। यदि आप शेफ को दोनों जगहों पर खाना बनाना सिखाने के लिए केवल सभी रेसिपीज़ को आपस में मिला देते हैं और उम्मीद करते हैं कि सब ठीक हो जाएगा, तो परिणाम एक आपदा होता है: शेफ भ्रमित हो जाता है, माउस का उपयोग करना भूल जाता है, और गलती से कीबोर्ड को स्वाइप करने की कोशिश करने लगता है। यह बिल्कुल वही समस्या है जिसका सामना "GUI एजेंट्स" के साथ वैज्ञानिक कर रहे—स्मार्ट कंप्यूटर प्रोग्राम जो हमारे डिजिटल जीवन को पूरा करने के लिए क्लिक करने, टाइप करने और स्वाइप करने के लिए डिज़ाइन किए गए हैं।

लंबे समय तक, ये एजेंट्स विशेषज्ञों की तरह थे: एक कंप्यूटर में माहिर था, दूसरा फोन में, लेकिन वे दोनों को एक साथ नहीं संभाल सकते थे। शोधकर्ताओं ने इसे केवल दोनों विशेषज्ञों को आपस में टकराकर, इस उम्मीद में सुधारने की कोशिश की कि उनका संयुक्त ज्ञान एक 'सुपर-एजेंट' बना देगा। लेकिन जैसा कि यह नया अध्ययन बताता है, वह "मिक्स-एंड-मैच" दृष्टिकोण अक्सर सीमाओं को धुंधला कर देता है, जिससे एजेंट दोनों कामों में और भी खराब हो जाता है। हर किसी के मन में एक ही सवाल है: हम एक एकल, एकीकृत एजेंट कैसे बना सकते हैं जो अपनी बुद्धि या कौशल खोए बिना डेस्कटॉप और मोबाइल फोन के बीच सहजता से स्विच कर सके?

यहाँ UI-MOPD आता है, जो त्सिंगहुआ विश्वविद्यालय, श्याओमी और अन्य शीर्ष संस्थानों के शोधकर्ताओं द्वारा प्रस्तावित एक चतुर नया तरीका है। UI-MOPD को एक ब्लेंडर (मिक्सी) के रूप में नहीं, बल्कि एक अद्वितीय प्रशिक्षण रणनीति वाले एक शानदार कोच के रूप में सोचें। छात्र (नए एकीकृत एजेंट) को निर्देशों का एक गंदा मिश्रण याद करने के लिए मजबूर करने के बजाय, कोच दो विशेषज्ञ गुरुओं के साथ एक गतिशील प्रशिक्षण शिविर स्थापित करता है: एक "डेस्कटॉप गुरु" और एक "मोबाइल गुरु"।

यहाँ जादू कैसे होता है। छात्र एजेंट खुद काम करने की कोशिश करता है, अपने स्वयं के "रोलआउट्स" (कार्य पूरा करने के प्रयास) उत्पन्न करता है। जब छात्र कंप्यूटर कार्य पर काम कर रहा होता है, तो कोच तुरंत विशिष्ट, उच्च-गुणवत्ता वाली सलाह देने के लिए डेस्कटॉप गुरु को बुला लेता है। जब छात्र फोन कार्य पर स्विच करता है, तो कोच मोबाइल गुरु को बदल देता है। इसे मल्टी-प्लेटफॉर्म ऑन-पॉलिसी डिस्टिलेशन कहा जाता है। मुख्य बात यह है कि छात्र सही समय पर सही विशेषज्ञ से सीखता है, न कि उनके अंतरों का औसत निकालने की कोशिश करता है। डेस्कटॉप गुरु छात्र को स्वाइप करना नहीं सिखाता; मोबाइल गुरु उन्हें माउस का उपयोग करना नहीं सिखाता। वे "व्यवहार संबंधी एंकर" (behavioral anchors) के रूप में कार्य करते हैं, जिससे छात्र के कार्य वर्तमान परिवेश के विशिष्ट नियमों के प्रति सच्चे रहते हैं।

शोधकर्ताओं ने इसे संभव बनाने के लिए Uni-GUI नामक एक विशाल, उच्च-गुणवत्ता वाला डेटासेट बनाया है। उन्होंने कंप्यूटर और फोन दोनों पर कार्यों को करने के लगभग 10,000 उच्च-गुणवत्ता वाले, सफल उदाहरण एकत्र करने के लिए एक विशेष उपकरण बनाया। उन्होंने खराब प्रयासों को हटा दिया और केवल उन्हीं को रखा जो वास्तव में काम कर रहे थे, यह सुनिश्चित करते हुए कि शिक्षकों के पास छात्र को दिखाने के लिए सटीक उदाहरण हों।

जब उन्होंने इस नए दृष्टिकोण का परीक्षण किया, तो परिणाम उत्साहजनक थे। एक कठिन कंप्यूटर बेंचमार्क OSWorld पर, नया एजेंट 38.2% बार सफल रहा। एक मोबाइल बेंचमार्क MobileWorld पर, यह 12.0% बार सफल रहा। ये संख्याएँ बताती हैं कि UI-MOPD उन पिछले तरीकों से काफी बेहतर है जिन्होंने केवल डेटा को मिलाने या मॉडल को मर्ज करने की कोशिश की थी। उदाहरण के लिए, जबकि अन्य तरीके एक प्लेटफॉर्म को बेहतर बना सकते हैं लेकिन दूसरे को खराब कर सकते हैं, UI-MOPD दोनों तरफ एक साथ प्रदर्शन बढ़ाने में सफल रहा। अध्ययन इंगित करता है कि यह "विशेषज्ञ कोच" पद्धति एजेंट को विभिन्न उपकरणों के विशिष्ट व्यवहार को सीखने के साथ-साथ अपनी सामान्य बुद्धिमत्ता बनाए रखने में मदद करती है, जिससे उस "औसत निकालने" वाले जाल से बचा जा सके जिसने पिछले मॉडलों को भ्रमित कर दिया था।

संक्षेप में, यह पेपर सुझाव देता है कि यदि आप एक ऐसा स्मार्ट एजेंट चाहते हैं जो आपके लैपटॉप और आपके फोन दोनों को संभाल सके, तो बस उन दोनों को आपस में मिला न दें। इसके बजाय, इसे एक ऐसी स्मार्ट प्रणाली दें जो जानती हो कि किस स्क्रीन को देखते समय किस विशेषज्ञ की बात सुननी है। यह एक ऐसे भविष्य की ओर एक कदम है जहाँ आपका डिजिटल सहायक वास्तव में सभी डिजिटल क्षेत्रों का मास्टर होगा, न कि केवल एक का।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →