← नवीनतम पेपर
💻 computer science

Embodied Robot Manipulation in the Era of Foundation Models: Planning and Learning Perspectives

यह सर्वेक्षण फाउंडेशन मॉडल्स के युग में रोबोटिक मैनिपुलेशन का एक संरचित अवलोकन प्रदान करता है, जो हालिया लर्निंग-आधारित दृष्टिकोणों को उच्च-स्तरीय योजना (जिसमें भाषा, कोड और ज्यामिति पर तर्क शामिल है) और निम्न-स्तरीय एक्शन मॉडलिंग के एक एकीकृत ढांचे में व्यवस्थित करता है, जबकि यह भी रेखांकित करता है कि फाउंडेशन मॉडल्स योजना संबंधी आर्टिफैक्ट्स और प्रत्यक्ष एक्शन जनरेशन दोनों में कैसे योगदान देते हैं।

मूल लेखक: Shuanghao Bai, Wenxuan Song, Jiayi Chen, Yuheng Ji, Zhide Zhong, Jin Yang, Han Zhao, Wanqi Zhou, Zhe Li, Pengxiang Ding, Cheng Chi, Chang Xu, Xiaolong Zheng, Donglin Wang, Haoang Li, Shanghang Zhang
प्रकाशित 2026-08-18
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shuanghao Bai, Wenxuan Song, Jiayi Chen, Yuheng Ji, Zhide Zhong, Jin Yang, Han Zhao, Wanqi Zhou, Zhe Li, Pengxiang Ding, Cheng Chi, Chang Xu, Xiaolong Zheng, Donglin Wang, Haoang Li, Shanghang Zhang, Badong Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट लंबे समय से दोहराव के उस्ताद रहे हैं, जो एक कारखाने में एक ही सटीक गति को हजारों बार करते हैं, लेकिन जब दुनिया बदलती है तो वे संघर्ष करते हैं। एक कप को मेज से सिंक तक ले जाने के लिए, एक पारंपरिक रोबोट को हर एक कदम को प्रोग्राम करने के लिए एक इंसान की आवश्यकता होती है: कप कहाँ है, उसे कैसे पकड़ना है, और बिना कुछ गिराए हाथ को ठीक से कैसे चलाना है। यह कठिनाई इसलिए उत्पन्न होती है क्योंकि इस कार्य के लिए कौशल की एक श्रृंखला की आवश्यकता होती है: वस्तु को देखना, यह समझना कि वह क्या है, इसे ले जाने के चरणों को समझना, और फिर काम करने के लिए मांसपेशियों को शारीरिक रूप से नियंत्रित करना। दशकों तक, शोधकर्ताओं ने रोबोट की आँखों और उसके हाथों के बीच के अंतर को पाटने की कोशिश की है, लेकिन यह जुड़ाव अक्सर नाजुक रहा है। प्रगति की नवीनतम लहर 'फाउंडेशन मॉडल्स' नामक एक नए प्रकार के आर्टिफिशियल इंटेलिजेंस से आई है। ये विशाल प्रणालियाँ हैं जिन्हें इंटरनेट से भारी मात्रा में डेटा पर प्रशिक्षित किया गया है, जो भाषा, छवियों और भौतिक दुनिया को समझने में सक्षम हैं, जो लगभग सहज महसूस होता है। वे रोबदों को न केवल यह सिखाने का अवसर प्रदान करते हैं कि कैसे हिलना है, बल्कि यह भी कि हिलने के बारे में कैसे सोचना है।

एशिया, ऑस्ट्रेलिया और संयुक्त राज्य अमेरिका के विश्वविद्यालयों के शोधकर्ताओं की एक टीम द्वारा किया गया एक व्यापक नया सर्वेक्षण यह मानचित्रित करता है कि कैसे ये शक्तिशाली AI मॉडल रोबोटिक मैनिपुलेशन (वस्तु संचालन) के क्षेत्र को नया आकार दे रहे हैं। लेखक, जिनका नेतृत्व ज़ियान जियाओटोंग विश्वविद्यालय और हांगकांग यूनिवर्सिटी ऑफ साइंस एंड टेक्नोलॉजी सहित संस्थानों के विद्वानों द्वारा किया गया है, इस तेजी से बढ़ते कार्य को एक स्पष्ट संरचना में व्यवस्थित करते हैं। वे प्रस्ताव देते हैं कि हमें इन रोबोटों को कोड के एक एकल ब्लॉक के रूप में देखना बंद कर देना चाहिए और इसके बजाय उन्हें एक ऐसी प्रणाली के रूप में देखना चाहिए जिसमें दो अलग-अलग परतें मिलकर काम करती हैं: एक उच्च-स्तरीय योजनाकार (planner) जो निर्णय लेता है कि क्या करना है, और एक निम्न-स्तरीय नियंत्रक (controller) जो यह तय करता है कि उसे करने के लिए मांसपेशियों को कैसे हिलाना है। यह ढांचा यह समझाने में मदद करता है कि क्यों कुछ रोबोट "आलू पकाओ और उसे रीसायकल बिन में डालो" जैसे जटिल निर्देशों का पालन कर सकते हैं, जबकि अन्य केवल एक विशिष्ट ब्लॉक को उठा सकते हैं।

इस प्रणाली के शीर्ष पर योजनाकार (planner) स्थित है। अतीत में, एक रोबोट को जटिल निर्देश देने के लिए इसे कठोर, पूर्व-लिखित चरणों में तोड़ने की आवश्यकता होती थी। आज, फाउंडेशन मॉडल्स एक ऐसे मस्तिष्क के रूप में कार्य करते हैं जो किसी कार्य के माध्यम से तर्क कर सकता है। सर्वेक्षण इस बात पर प्रकाश डालता है कि कैसे ये मॉडल एक साधारण वाक्य को तार्किक चरणों के क्रम में तोड़ सकते हैं, जैसे कि "फ्रिज की ओर जाओ," "दरवाजा खोलो," और "आलू पकड़ो।" कुछ प्रणालियाँ इन योजनाओं को उत्पन्न करने के लिए बड़े भाषा मॉडल (LLM) का उपयोग करती हैं, जबकि अन्य कार्यों का वर्णन करने के लिए कंप्यूटर कोड लिखती हैं। एक विशेष रूप से आशाजनक दृष्टिकोण में रोबोट को दुनिया के भौतिक आकार को समझने के लिए प्रशिक्षित करना शामिल है। केवल शब्द पढ़ने के बजाय, ये मॉडल 3D स्थान के मानसिक मानचित्र बनाते हैं, यह पहचानते हैं कि वस्तुएं कहाँ हैं और वे एक साथ कैसे फिट होती हैं। वे "अफोर्डेंस" (affordances) भी सीख सकते हैं, जो एक ऐसी अवधारणा है जो बताती है कि कोई वस्तु किस क्रिया की अनुमति देती है; उदाहरण के लिए, एक हैंडल खींचने की अनुमति देता है, जबकि एक सपाट सतह रखने की अनुमति देती है। भाषा, 3D विजन और वस्तुएं क्या कर सकती हैं इसकी समझ को जोड़कर, ये उच्च-स्तरीय योजनाकार रोबोट के अनुसरण के लिए एक संरचित मार्ग प्रदान करते हैं।

एक बार योजना बन जाने के बाद, रोबोट को इसे निष्पादित करना होता है। यह निम्न-स्तरीय एक्शन मॉडल का काम है, जो अमूर्त योजना को शारीरिक गति में अनुवादित करता है। शोधकर्ताओं ने पाया कि सबसे सफल आधुनिक दृष्टिकोण एक एकल विधि पर निर्भर नहीं होते हैं बल्कि अक्सर विभिन्न सीखने की रणनीतियों का मिश्रण होते हैं। कुछ रोबोट मनुष्यों को देखकर सीखते हैं, जो वीडियो या प्रदर्शनों में देखी गई उनकी गतिविधियों की नकल करते हैं। अन्य प्रयास और त्रुटि (trial and error) के माध्यम से सीखते हैं, विभिन्न गतियों को तब तक आजमाते हैं जब तक कि वे सफल न हो जाएं, यह एक प्रक्रिया है जिसे सुदृढीकरण लर्निंग (reinforcement learning) कहा जाता है। पेपर में पहचाना गया एक महत्वपूर्ण रुझान "लेटेंट लर्निंग" (latent learning) का उपयोग है, जहाँ रोबोट जटिल गतिविधियों को सरल, छिपे हुए निरूपणों में संकुचित करना सीखता है। इसे इस तरह समझें कि रोबोट हर छोटी मांसपेशी की हरकत को याद करने के बजाय गति के "सार" को सीख रहा है, जिससे वह विभिन्न वस्तुओं या स्थितियों के लिए उसी गति को अनुकूलित कर पाता है। सर्वेक्षण यह भी नोट करता है कि 3D विजन और यहाँ तक कि स्पर्श सेंसरों (touch sensors) के उपयोग पर बढ़ता जोर है। जबकि शुरुआती रोबोट मुख्य रूप से कैमरों पर निर्भर थे, नए सिस्टम अब स्पर्श संबंधी फीडबैक को शामिल करना शुरू कर रहे हैं, जिससे वे महसूस कर सकते हैं कि वे किसी चीज़ को बहुत कसकर पकड़े हुए हैं या कोई वस्तु फिसल रही है, जो नाजुक कार्यों के लिए महत्वपूर्ण है।

इन प्रगति के बावजूद, लेखक सावधानीपूर्वक नोट करते हैं कि यह क्षेत्र पूर्णता से दूर है। सर्वेक्षण में वर्णित रोबोट अभी घर या कारखाने में मानव श्रमिकों को बदलने के लिए तैयार नहीं हैं। कई प्रणालियाँ नियंत्रित वातावरण या सिमुलेशन में अच्छा काम करती हैं लेकिन वास्तविक दुनिया की अव्यवस्थित अनिश्चितता का सामना करने पर संघर्ष करती हैं। सर्वेक्षण बताता है कि जबकि ये मॉडल किसी कार्य के बारे में तर्क कर सकते हैं, वे कभी-कभी रोबोट की भौतिक सीमाओं को समझने में विफल रहते हैं, जैसे कि क्या एक हाथ वास्तव में दीवार से टकराए बिना एक निश्चित स्थान तक पहुँच सकता है। डेटा के संबंध में भी महत्वपूर्ण बाधाएं हैं; इन प्रणालियों को प्रशिक्षित करने के लिए उच्च गुणवत्ता वाले डेटा की भारी मात्रा की आवश्यकता होती है, जो महंगा और एकत्र करने में कठिन है। इसके अलावा, सुरक्षा एक प्रमुख चिंता बनी हुई है। जैसे-जैसे रोबोट अधिक स्वायत्त होते जा रहे हैं, यह सुनिश्चित करना कि वे मनुष्यों को नुकसान न पहुँचाएँ या वस्तुओं को न तोड़ें, मजबूत सुरक्षा उपायों की मांग करता है जो वर्तमान मॉडलों के पास हमेशा नहीं होते हैं।

शोधकर्ता निष्कर्ष निकालते हैं कि आगे का रास्ता अधिक सामान्य-उद्देश्य वाली प्रणालियों के निर्माण में निहित है जो विविध अनुभवों से सीख सकें और हर एक कार्य के लिए पुन: प्रोग्राम किए बिना नई स्थितियों के अनुकूल हो सकें। उनका सुझाव है कि रोबोटिक मैनिपुलेशन का भविष्य इन प्रणालियों का मूल्यांकन करने के बेहतर तरीके बनाने, अधिक वास्तविक दुनिया का डेटा एकत्र करने और दृष्टि, स्पर्श और ध्वनि जैसे कई इंद्रियों को दुनिया की एकीकृत समझ में एकीकृत करने पर निर्भर करेगा। यह सर्वेक्षण एक रोडमैप के रूप में कार्य करता है, जो दिखाता है कि हालांकि हमने रोबोटों को सोचने और चलने के तरीके सिखाने में उल्लेखनीय प्रगति की है, लेकिन वास्तव में बुद्धिमान, अनुकूलन योग्य मशीनों की यात्रा अभी शुरू ही हुई है। यह कार्य रोबोटिक मैनिपुलेशन की समस्या को हल करने का दावा नहीं करता है, बल्कि यह प्रदान करता है कि आज तकनीक कहाँ खड़ी है और इन मशीनों को हमारे दैनिक जीवन में वास्तव में उपयोगी बनाने के लिए किन चुनौतियों को पार करना आवश्यक है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →