← नवीनतम पेपर
💻 computer science

EMERGE-Policy: A Robot Mind Emerges Beyond a Single Policy

EMERGE-Policy एक ग्राफ-संरचित एजेंटिक फ्रेमवर्क पेश करता है जहाँ एक केंद्रीय मुख्य एजेंट (Main Agent) धारणा (perception), तर्क (reasoning) और सत्यापन (verification) के लिए पृथक संदर्भों के भीतर विशिष्ट उप-एजेंटों (Sub Agents) को समन्वित करता है, जो उभरते हुए सिस्टम-स्तरीय सहयोग और क्लोज्ड-लूप सुधार के माध्यम से फाइन-ट्यूनिंग-मुक्त रोबोट प्रदर्शन को सक्षम बनाता है।

मूल लेखक: Zhirui Fang, Qingchi Yu, Ziyang Chen, Longfei Li, Haoran Ma, Keru Zhou, Xinrun Xu, Samith Va, Yuxuan Hu, Peixuan Song, Qiang Du, Bin Qian, Yongkang Deng, Xin Li, Yezhen Wang, Zhe Li, Hao Luo, Shuyan L
प्रकाशित 2026-09-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhirui Fang, Qingchi Yu, Ziyang Chen, Longfei Li, Haoran Ma, Keru Zhou, Xinrun Xu, Samith Va, Yuxuan Hu, Peixuan Song, Qiang Du, Bin Qian, Yongkang Deng, Xin Li, Yezhen Wang, Zhe Li, Hao Luo, Shuyan Li, Ziwei Wang, Weijian Deng, Xiu Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट लंबे समय से एक ही, सटीक गति को दोहराने में विशेषज्ञ रहे हैं, जैसे कि असेंबली लाइन पर एक वेल्डर या समान बक्सों को एक के ऊपर एक रखने वाली एक भुजा। लेकिन एक रोबोट को एक अव्यवस्थित, अप्रत्याशित वास्तविक दुनिया को संभालने में सक्षम दिमाग देना बहुत कठिन साबित हुआ है। दशकों तक, शोधकर्ताओं ने एक एकल, विशाल कंप्यूटर प्रोग्राम—एक "मस्तिष्क"—बनाने की कोशिश की, जो एक साथ किसी वस्तु को देख सके, एक कमांड समझ सके और हाथ को हिला सके। हालांकि ये प्रणालियाँ प्रभावशाली हो गई हैं, लेकिन जब चीजें गलत होती हैं तो वे अक्सर लड़खड़ा जाती हैं। यदि कोई कप फिसल जाता है या रोशनी बदल जाती है, तो एकल मस्तिष्क भ्रमित हो सकता है क्योंकि वह सब कुछ एक ही बड़ी छलांग में करने की कोशिश करता है। रोबोटिक्स में नया विचार यह सुझाव देता है कि बुद्धिमत्ता को एक स्थान पर रहने की आवश्यकता नहीं हो सकती है। इसके बजाय, एक रोबोट का मन विशेष विशेषज्ञों की एक टीम से उभर सकता है जो मिलकर काम करते हैं, जहाँ एक हिस्सा देखता है, दूसरा योजना बनाता है, तीसरा काम की जाँच करता है, और चौथा याद रखता है कि क्या हुआ था। यह दृष्टिकोण रोबोट को एक एकल इकाई के रूप में नहीं, बल्कि एक समन्वित समूह के रूप में मानता है, जिससे यह एक एकल प्रोग्राम की तुलना में गलतियों से उबरने और परिवर्तनों के अनुकूल होने में सक्षम होता है।

यह EMERGE-Policy नामक एक नए ढांचे के पीछे का मूल विचार है, जिसे त्सिंगहुआ और पेकिंग यूनिवर्सिटी सहित कई विश्वविद्यालयों के शोधकर्ताओं द्वारा विकसित किया गया है। एक विशाल मॉडल पर सब कुछ करने के लिए निर्भर रहने के बजाय, शोधकर्ताओं ने एक ऐसी प्रणाली बनाई है जहाँ एक केंद्रीय "मुख्य एजेंट" (Main Agent) एक प्रोजेक्ट मैनेजर के रूप में कार्य करता है। यह मैनेजर स्वयं कच्चे वीडियो फीड को नहीं देखता है या हर मोटर मूवमेंट की गणना नहीं करता है। इसके बजाय, यह एक जटिल कार्य, जैसे कि "इन कपों को एक पिरामिड में स्टैक करें," को छोटे चरणों में तोड़ देता है। फिर यह विशिष्ट कार्यों को विशेष "उप-एजेंटों" (Sub Agents) को सौंप देता है। सहायकों की एक टीम पूरी तरह से दृश्य को देखने और कपों को खोजने पर ध्यान केंद्रित करती है। दूसरी टीम रोबोट के हाथ की निगरानी करती है ताकि यह सुनिश्चित हो सके कि वह सही ढंग से चल रहा है। तीसरी टीम यह जाँचती है कि कप रखने के बाद वास्तव में स्थिर है या नहीं। यदि कुछ गलत हो जाता है, तो चौथी टीम रोबोट को उस विफलता को याद रखने और एक अलग दृष्टिकोण आज़माने में मदद करती है। मुख्य एजेंट इन समूहों का समन्वय करता है, केवल आवश्यक, सारांशित जानकारी प्राप्त करता है जिसकी उसे अगला निर्णय लेने के लिए आवश्यकता होती है, जबकि कच्चे डेटा को प्रोसेस करने का भारी काम बैकग्राउंड में होता है।

शोधकर्ताओं ने इस प्रणाली का परीक्षण चुनौतियों से भरे कई बेंचमार्क पर किया, जिसमें ऐसे कार्य शामिल थे जहाँ रोबोट को कठिन परिस्थितियों में मेज पर वस्तुओं को नियंत्रित करना था। उन्होंने अपने टीम-आधारित दृष्टिकोण की तुलना वर्तमान में उपलब्ध सर्वश्रेष्ठ एकल-प्रोग्राम मॉडलों के साथ की। परिणामों ने दिखाया कि समन्वित टीम ने एकल मॉडलों की तुलना में काफी बेहतर प्रदर्शन किया, विशेष रूप से तब जब वातावरण बदल गया या निर्देश अस्पष्ट थे। मानक परीक्षणों पर, प्रणाली ने 99 प्रतिशत के करीब सफलता दर हासिल की, जो सर्वश्रेष्ठ एकल मॉडलों की तुलना में एक छोटा लेकिन सार्थक सुधार है। अधिक महत्वपूर्ण बात यह है कि जब शोधकर्ताओं ने व्यवधान पेश किए—जैसे कि रोशनी बदलना, कप का आकार बदलना, या रोबोट का दृश्य बाधित करना—तो टीम-आधारित प्रणाली मजबूत बनी रही। जबकि एकल मॉडल इन नई स्थितियों में अक्सर पूरी तरह विफल हो जाते थे, EMERGE-Policy प्रणाली समस्या का पता लगाने, निदान करने और सफल होने के लिए अपनी योजना को समायोजित करने में सक्षम थी। कागज के कपों को तीन-स्तरीय पिरामिड में स्टैक करने वाले एक वास्तविक रोबोट वाले एक विशिष्ट परीक्षण में, सिस्टम ने 94 प्रतिशत परीक्षणों में सफलता प्राप्त की, भले ही कप अलग आकार के थे या कैमरा एंगल बदल गया था।

इस सफलता का एक प्रमुख हिस्सा यह है कि प्रणाली मेमोरी और गलतियों को कैसे संभालती है। वीडियो के हर एक फ्रेम को याद करने की कोशिश करने के बजाय, जो कंप्यूटर को अभिभूत कर सकता है, प्रणाली एक डिजिटल लॉग में क्या हुआ इसका एक संक्षिप्त सारांश लिख देती है। यदि रोबोट एक कप गिरा देता है, तो प्रणाली केवल दोबारा प्रयास नहीं करती है। यह विश्लेषण करती है कि गिरावट क्यों हुई, विफलता के बारे में एक नोट लिखती है, और आगे बढ़ने से पहले समस्या के उस हिस्से को ठीक करने के लिए एक विशिष्ट योजना बनाती है। यह रोबोट को पूरे कार्य को फिर से शुरू किए बिना स्थानीय स्तर पर त्रुटियों से उबरने की अनुमति देता है। शोधकर्ताओं ने यह भी पाया कि प्रणाली को यह "पूर्वावलोकन" (preview) देने से कि आगे क्या हो सकता है, उसे गलतियाँ होने से पहले बचने में मदद मिली। कुछ संभावित चालों को अपने मन में सिम्युलेट करके और यह जाँचकर कि कौन सी सबसे अच्छी दिखती है, रोबोट सबसे सुरक्षित रास्ता चुन सका। इस "कल्पना" चरण ने, एक सख्त सत्यापन प्रक्रिया के साथ मिलकर, यह सुनिश्चित किया कि रोबोट अपरिवर्तनीय गलतियाँ कम करे।

प्रयोग केवल कंप्यूटर सिमुलेशन तक सीमित नहीं थे। टीम ने एक भौतिक रोबोटिक आर्म पर कार्यों के एक लंबे क्रम को करने के लिए प्रणाली को तैनात किया: मेज से कागज के कप हटाना, उन्हें उल्टा रखना और परतों में स्टैक करना। इस वास्तविक दुनिया के परीक्षण ने साबित कर दिया कि ढांचा भौतिक वस्तुओं, जैसे कि हिलने या फिसलने वाले कप की अनिश्चितता को संभाल सकता है। सिस्टम ने 94 प्रतिशत समय कार्य को सफलतापूर्वक पूरा किया, और यहाँ तक कि जब शोधकर्ताओं ने प्रक्रिया में बाधा डाली या रोशनी बदली, तो रोबोट पुन: योजना बनाने और काम पूरा करने में सक्षम था। अध्ययन बताता है कि रोबोट की बुद्धिमत्ता का भविष्य एक बड़े, स्मार्ट एकल मस्तिष्क को बनाने में नहीं, बल्कि कई छोटे, विशेष उपकरणों को एक साथ काम करने का एक बेहतर तरीका बनाने में निहित है। इन उपकरणों को एक स्पष्ट पदानुक्रम में व्यवस्थित करके जहाँ प्रत्येक के पास एक विशिष्ट कार्य है और रिपोर्ट करने का एक स्पष्ट तरीका है, शोधकर्ताओं ने एक ऐसी प्रणाली बनाई है जो न केवल अधिक सटीक है बल्कि वास्तविक दुनिया की अराजकता के प्रति अधिक लचीली भी है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →