← नवीनतम पेपर
💻 computer science

Toward Unified Robot Learning: Bridging Representation, Vision-Language-Action, and World Models

यह सर्वेक्षण वर्तमान विखंडन को संबोधित करने, घटकों की अंतःक्रियाओं का विश्लेषण करने और संरचनाहीन वातावरण में दीर्घ-अवधि तर्क करने में सक्षम सुदृढ़, भौतिक रूप से आधारित रोबोटिक प्रणालियों के लिए भविष्य की दिशाओं को रेखांकित करने हेतु रिप्रजेंटेशन लर्निंग, विजन-लैंग्वेज-एक्शन मॉडल्स और वर्ल्ड मॉडल्स को एकीकृत करके रोबोट लर्निंग पर एक एकीकृत परिप्रेक्ष्य प्रस्तावित करता है।

मूल लेखक: Shaunak A. Mehta, Ananya Hazarika, Haochen Zhang, Fan Yang, Ryo Moriyama, Wenkai Li, Yash Patel, Kanata Suzuki

प्रकाशित 2026-09-04
📖 9 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shaunak A. Mehta, Ananya Hazarika, Haochen Zhang, Fan Yang, Ryo Moriyama, Wenkai Li, Yash Patel, Kanata Suzuki

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट लंबे समय से कारखानों के स्वामी रहे हैं, जहाँ दुनिया पूर्वानुमानित होती है, रोशनी स्थिर होती है, और हर वस्तु ठीक वहीं होती है जहाँ वह कल रखी गई थी। लेकिन जिस क्षण एक रोबोट उस नियंत्रित पिंजरे से बाहर निकलकर एक अस्त-व्यस्त रसोई, एक बिखरी हुई कार्यशाला, या एक हलचल भरी सड़क में कदम रखता है, वह अक्सर ठिठक जाता है। वास्तविक दुनिया में विश्वसनीय रूप से काम करने के लिए, एक मशीन को केवल अपने हाथों को हिलाने की क्षमता से अधिक की आवश्यकता होती है; उसे अपने परिवेश को स्पष्ट रूप से देखने, यह समझने की कि उससे क्या करने को कहा जा रहा है, और सबसे महत्वपूर्ण बात यह कि, यह कल्पना करने की आवश्यकता है कि एक विशिष्ट क्रिया करने पर क्या होगा। उसे एक दृश्य को समझने, निर्णय लेने कि कैसे कार्य करना है, और अपनी मांसपेशियों को हिलाने से पहले ही उस निर्णय के परिणामों के बारे में तर्क करने में सक्षम होना चाहिए। दशकों तक, वैज्ञानिकों ने इन तीन क्षमताओं पर अलग-अलग काम किया है, उन्हें अलग-अलग समस्याओं के रूप में माना है जिन्हें अलग-थलग हल किया जाना है।

एक नया सर्वेक्षण पत्र इन शोध के तीन धागों को एक साथ लाता है, और यह तर्क देता है कि वास्तव में सक्षम रोबोटों का मार्ग प्रत्येक भाग को अकेले बेहतर बनाने में नहीं, बल्कि उन्हें एक एकल, एकीकृत प्रणाली में बुनने में निहित है। शोधकर्ता, जो फुजित्सु और कार्नेगी मेलन यूनिवर्सिटी की एक टीम है, प्रस्तावित करते हैं कि रोबोट लर्निंग की वर्तमान पीढ़ी खंडित है। उनका सुझाव है कि यह जोड़कर कि रोबोट दुनिया को कैसे समझते हैं, वे कैसे कार्य करने का चयन करते हैं, और वे भविष्य की भविष्यवाणी कैसे करते हैं, हम ऐसी मशीनें बना सकते हैं जो मानव वातावरण की अनिश्चितता को संभालने के लिए पर्याप्त मजबूत हों। यह कार्य एक नया रोबोट या एक तैयार उत्पाद प्रस्तुत नहीं करता है; बल्कि, यह रोबोट लर्निंग के संपूर्ण परिदृश्य का एक मानचित्र प्रदान करता है, यह पहचानता है कि कहाँ कमियाँ हैं और एक अधिक एकीकृत भविष्य की ओर मार्ग प्रशस्त करता है।

यह पत्र रोबोट लर्निंग के विशाल क्षेत्र को तीन पूरक स्तंभों में व्यवस्थित करता है। पहला 'रिप्रेजेंटेशन लर्निंग' (प्रस्तुति सीखना) है, जो अनिवार्य रूप से रोबोट का वह तरीका है जिससे वह जो देखता है उसका अर्थ निकालता है। वस्तुओं के दिखने के पूर्व-निर्धारित सूचियों पर निर्भर रहने के बजाय, आधुनिक रोबट कच्ची छवियों, गहराई सेंसर और स्पर्श डेटा से संरचित जानकारी निकालने के लिए उन्नत सॉफ्टवेयर का उपयोग करते हैं। यह उन्हें एक कप और मेज के बीच स्थानिक संबंधों, या किसी सतह की बनावट को समझने की अनुमति देता है, बिना किसी मनुष्य द्वारा हर संभावित परिदृश्य के लिए नियम लिखे। दूसरा स्तंभ 'विज़न-लैंग्वेज-एक्शन मॉडल' (दृष्टि-भाषा-क्रिया मॉडल) है। ये वे प्रणालियाँ हैं जो एक रोबोट को एक दृश्य और एक बोले गए निर्देश, जैसे कि "लाल ब्लॉक उठाओ," को सीधे भौतिक गतिविधियों में अनुवाद करने की अनुमति देती हैं। यह मानवीय भाषा और यांत्रिक नियंत्रण के बीच के अंतर को पाटता है, जिससे रोबोट तात्कालिक उत्तेजनाओं पर प्रतिक्रिया करने के बजाय उच्च-स्तरीय आदेशों का पालन करने में सक्षम होता है। तीसरा स्तंभ 'वर्ल्ड मॉडल' (विश्व मॉडल) है। यह रोबोट का आंतरिक सिम्युलेटर है, एक मानसिक इंजन जो इसे यह पूछने की अनुमति देता है, "यदि मैं इस कप को धकेलता हूँ, तो यह कहाँ जाएगा?" अपने कार्यों के जवाब में पर्यावरण कैसे विकसित होगा, इसकी भविष्यवाणी करके, रोबotong आगे की योजना बना सकता है, टकरावों से बच सकता है, और अपने व्यवहार के दीर्घकालिक परिणामों को समझ सकता है।

सर्वेक्षण के लेखक देखते हैं कि जबकि इनमें से प्रत्येक क्षेत्र ने तीव्र प्रगति देखी है, वे काफी हद तक अलग-थलग विकसित हुए हैं। एक रोबोट वस्तुओं को पहचानने में उत्कृष्ट हो सकता है लेकिन यह अनुमान लगाने में बहुत खराब हो सकता है कि छूने पर वे वस्तुएं कैसे हिलेंगी। दूसरा भाषा के आदेशों का पालन करने में बहुत अच्छा हो सकता है लेकिन अपने स्वयं के शरीर की भौतिक सीमाओं को समझने में विफल हो सकता है। यह अलगाव एक नाजुक प्रणाली बनाता है। जब एक रोबोट ऐसी स्थिति का सामना करता है जो उसने पहले नहीं देखी है, या जब रोशनी बदल जाती है, या जब कोई वस्तु उम्मीद के मुताबिक अलग व्यवहार करती है, तो देखने, कार्य करने और सोचने के बीच समन्वय की कमी के कारण प्रणाली टूट जाती है। शोधकर्ताओं का तर्क है कि आज रोबोटिक्स के सामने सबसे बड़ी बाधाएं—जैसे कि नए वातावरण में सामान्यीकरण करने में असमर्थता, एक प्रकार के रोबोट से दूसरे प्रकार के रोबोट में कौशल स्थानांतरित करने की कठिनाई, और कार्यों के लंबे अनुक्रमों की योजना बनाने का संघर्ष—केवल व्यक्तिगत घटकों की समस्याएँ नहीं हैं। वे एक गहरे मुद्दे के लक्षण हैं: धारणा, क्रिया और तर्क को एक सुसंगत पूर्णता में जोड़ने की विफलता।

इसे समझाने के लिए, पत्र बताता है कि वर्तमान प्रणालियाँ अक्सर भविष्य को असंबद्ध अनुमानों की एक श्रृंखला मानती हैं। एक रोबोट एक ब्लॉक देख सकता है और उसे हिलाने का निर्णय ले सकता है, लेकिन यदि वह यह तर्क देने में सक्षम नहीं है कि वह ब्लॉक मेज के साथ कैसे परस्पर क्रिया करेगा, या हवा का एक अचानक झोंका उसके पथ को कैसे बदल सकता है, तो वह विफल हो जाएगा। सर्वेक्षण इस बात पर प्रकाश डालता है कि सच्ची मजबूती के लिए एक ऐसी प्रणाली की आवश्यकता होती है जहाँ दुनिया का प्रतिनिधित्व क्रिया के लिए नीति को आकार देता है, और जहाँ भविष्य की अवस्थाओं की भविष्यवाणी निर्णय लेने की प्रक्रिया को फीडबैक देती है। उदाहरण के लिए, यदि एक रोबोट इस बारे में अनिश्चित है कि वह क्या देख रहा है, तो उस अनिश्चितता को उसके कार्यों को प्रभावित करना चाहिए, शायद उसे धीरे चलने या स्पष्टीकरण मांगने के लिए प्रेरित करना चाहिए, बजाय इसके कि वह आँख मूंदकर आगे बढ़े। इसी तरह, यदि एक रोबोट को एक बड़े हाथ से एक छोटे हाथ में कौशल स्थानांतरित करने की आवश्यकता है, तो उसे कार्य को अपने विशिष्ट शरीर से स्वतंत्र स्तर पर समझना चाहिए, लक्ष्य पर ध्यान केंद्रित करते हुए न कि यांत्रिकी पर।

शोधकर्ताओं ने कई महत्वपूर्ण चुनौतियों की पहचान की है जिन्हें एकता प्राप्त करने के लिए हल किया जाना चाहिए। एक प्रमुख बाधा लंबी अवधि के दौरान तर्क करने की क्षमता है। मनुष्य स्वाभाविक रूप से वर्तमान में जो करते हैं उसे सूचित करने के लिए उन घटनाओं को याद रखते हैं जो मिनटों पहले हुई थीं, लेकिन रोबोट अक्सर पिछले इंटरैक्शन की सुसंगत स्मृति बनाए रखने में संघर्ष करते हैं, विशेष रूप से जब दृश्य का कुछ हिस्सा छिपा हुआ हो या जब किसी क्रिया के प्रभाव में देरी हो। एक अन्य चुनौती "आउट-ऑफ-डिस्ट्रीब्यूशन" की समस्या है, जहाँ एक रोबोट ऐसी स्थिति का सामना करता है जो उसके प्रशिक्षण डेटा से मौलिक रूप से भिन्न है। वर्तमान मॉडल यहाँ अक्सर विफल हो जाते हैं क्योंकि उन्होंने दुनिया के अंतर्निहित भौतिकी को समझने के बजाय अपने प्रशिक्षण डेटा में पैटर्न को पहचानना सीखा है। सर्वेक्षण का सुझाव है कि केवल रोबोट को अधिक डेटा खिलाना समाधान नहीं है; इसके बजाय, हमें ऐसी प्रणालियों की आवश्यकता है जो वस्तुओं, कार्यों और क्रियाओं के बीच के संबंधों के बारे में इस तरह से तर्क कर सकें जो तब भी सत्य रहे जब वातावरण बदल जाए।

पत्र अनिश्चितता की भूमिका की भी खोज करता है। वास्तविक दुनिया में, सेंसर शोर युक्त होते हैं, और वस्तुएं आंशिक रूप से छिपी हो सकती हैं। एक विश्वसनीय रोबोट को यह जानने की आवश्यकता है कि वह क्या नहीं जानता है। उसे विभिन्न परिणामों की संभावना का अनुमान लगाने और उसके अनुसार अपने व्यवहार को समायोजित करने में सक्षम होना चाहिए। लेखक तर्क देते हैं कि इसके लिए एक संभाव्य दृष्टिकोण की आवश्यकता है, जहाँ रोबोट दुनिया की स्थिति के बारे में एक विश्वास बनाए रखता है और नई जानकारी एकत्र करते समय उस विश्वास को अपडेट करता है। यह केवल सावधान होने के बारे में नहीं है; यह अनुकूलन योग्य होने के बारे में है। एक रोबोट जो अनिश्चितता के बारे में तर्क कर सकता है, वह एक अव्यवस्थित कमरे में नेविगेट कर सकता है, एक फिसलन भरी वस्तु को संभाल सकता है, या किसी गलती से उबर सकता है, बिना किसी मनुष्य के हस्तक्षेप की आवश्यकता के।

भविकी ओर देखते हुए, सर्वेक्षण एक ऐसे पथ की रूपरेखा तैयार करता है जो मॉड्यूलर पाइपलाइन से आगे बढ़ता है। एक रोबगत अलग "आँख" मॉड्यूल, एक अलग "मस्तिष्क" मॉड्यूल और एक अलग "हाथ" मॉड्यूल के साथ बनाने के बजाय, अगली पीढ़ी की प्रणालियों को एक एकीकृत इकाई के रूप में डिज़ाइन किया जाना चाहिए। इस दृष्टि में, एक रोबोट दुनिया को कैसे देखता है वह इस बात से आकार लेता है कि उसे क्या करने की आवश्यकता है, और उसके कार्यों की योजना बनाना भविष्य की उसकी भविष्यवाणियों द्वारा सूचित होता है। शोधकर्ताओं का सुझाव है कि इस एकीकरण के लिए रोबोट को प्रशिक्षित करने के नए तरीकों की आवश्यकता होगी, शायद साझा प्रतिनिधित्व का उपयोग करके जो धारणा और भविष्यवाणी दोनों के लिए काम करता है, या क्लोज्ड-लूप फीडबैक का उपयोग करके जहाँ रोबोट के कार्य लगातार दुनिया के प्रति उसकी समझ को परिष्कृत करते हैं। वे इस बात पर जोर देते हैं कि जबकि बड़े भाषा मॉडल और जनरेटिव एआई ने भाषा और छवियों को समझने के लिए शक्तिशाली उपकरण प्रदान किए हैं, वास्तविक सफलता तब आएगी जब ये उपकरण रोबोट के शरीर और उसके वातावरण की भौतिक वास्तविकता में स्थापित होंगे।

जैसा कि पत्र में वर्णित है, अंतिम लक्ष्य ऐसे स्वायत्त एजेंट बनाना है जो मनुष्यों की तरह सहजता और अनुकूलन क्षमता के साथ खुले विश्व में कार्य कर सकें। इसका अर्थ है ऐसे रोबोट जो अनुभव से सीख सकें, विभिन्न शरीरों में कौशल स्थानांतरित कर सकें, और लंबे समय तक अपने कार्यों के परिणामों के बारे में तर्क कर सकें। सर्वेक्षण निष्कर्ष निकालता है कि जबकि पहेली के व्यक्तिगत हिस्से स्पष्ट हो रहे हैं, चित्र तभी उभर कर आएगा जब हम धारणा, क्रिया और तर्क को अलग-अलग समस्याओं के रूप में मानना बंद कर देंगे। इन डोमेनों को जोड़कर, हम एक ऐसे भविष्य की ओर बढ़ सकते हैं जहाँ रोबोट केवल निर्देशों का पालन करने वाले उपकरण नहीं होंगे, बल्कि ऐसे साथी होंगे जो जटिल, अप्रत्याशित दुनिया में समझ, अनुकूलन और फलने-फूलने में सक्षम होंगे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →