← नवीनतम पेपर
💻 computer science

GE-Act 2.0: Pretraining and Scaling a World-Action Model for Robotic Manipulation

GE-Act 2.0 एक नवीन वर्ल्ड-एक्शन मॉडल है जिसे मैनिपुलेशन डेटा पर स्क्रैच से प्रशिक्षित किया गया है जो एक कंट्रोल-ओरिएंटेड ऑटोएनकोडर, एक सिंगल-स्टेप विजुअल प्लानर और नॉलेज-अलाइन्ड सिलेक्टिव ऑप्टिमाइजेशन के साथ एक इनवर्स डायनेमिक्स मॉडल को एकीकृत करता है, जो व्यापक स्केलिंग और क्रॉस-एम्बॉडिमेंटमेंट ट्रांसफर के माध्यम से विविध कार्यों और एम्बॉडिमेंट्स में महत्वपूर्ण ज़ीरो-शॉट सफलता प्राप्त करता है।

मूल लेखक: AgiBot Research Team, Renhang Liu, Wenzhi Zhao, Zhuo Yang, Liliang Chen, Pengfei Zhou, Shengcong Chen, Guanghui Ren, Youlun Peng, Rongjun Jin, Nan Wang, Sukai Wang, Xindong He, Jinyuan Feng, Ziyu Xion
प्रकाशित 2026-09-09
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: AgiBot Research Team, Renhang Liu, Wenzhi Zhao, Zhuo Yang, Liliang Chen, Pengfei Zhou, Shengcong Chen, Guanghui Ren, Youlun Peng, Rongjun Jin, Nan Wang, Sukai Wang, Xindong He, Jinyuan Feng, Ziyu Xiong, Linqing Zhong, Yifei Wei, Feng Han, Long Zhang, Da Huang, Nanshu Zhao, Chenghao Yin, Mo Wu, Zhaodong Yan, Kongtao Hu, Yuxiang Yan, Aogelijiang Niyazi, Yu Fang, Jia Zeng, Lizhu Meng, Daizhen Lv, Haoyu Cao, Zhiwen Hou, Lianjin Ye, Yuehan Niu, Zhikai Cai, Xuan Hu, Hui Min, Xiongfeng Cai, Yue Liao, Jing Wu, Soujanya Poria, Ye Li, Sanping Zhou, Maoqing Yao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट लंबे समय से कारखानों के फर्श के उस्ताद रहे हैं, जो बिना किसी त्रुटि के हजारों बार एक ही सटीक गति को दोहराते हैं। लेकिन यदि उन्हें रसोई, लिविंग रूम या किसी अव्यवस्थित वर्कशॉप में रख दिया जाए, तो वे अक्सर ठिठक जाते हैं। चुनौती केवल हाथ हिलाने की नहीं है; बल्कि यह समझने की है कि जब वह हाथ किसी चीज़ को छूता है तो दुनिया कैसे बदलती है। इस राह पर चलने के लिए, आर्टिफिशियल इंटेलिजेंस की एक नई पीढ़ी भविष्य की कल्पना करना सीख रही है। केवल वर्तमान में जो दिख रहा है उस पर प्रतिक्रिया देने के बजाय, ये सिस्टम यह अनुमान लगाने की कोशिश करते हैं कि यदि वे कोई विशिष्ट क्रिया करते हैं तो आगे क्या होगा। यह दृष्टिकोण, जिसे 'वर्ल्ड-एक्शन मॉडल' (world-action model) कहा जाता है, रोबोट को अपनी मांसपेशी हिलाने से पहले अपने मन में घटनाओं के एक क्रम का अनुकरण करने की अनुमति देता है, ताकि यह जांचा जा सके कि परिणाम लक्ष्य के अनुरूप है या नहीं। वर्षों से, शोधकर्ताओं ने मौजूदा वीडियो जनरेटर्स—ऐसे प्रोग्राम जिन्हें नकली फिल्में बनाने के लिए प्रशिक्षित किया गया है—को लेकर और उन्हें रोबोटिक गतिविधियों को समझने के लिए मजबूर करके इन सिस्टमों को बनाने का प्रयास किया है। हालांकि, इस पद्धति से अक्सर रोबोट को भौतिकी (physics) की एक अस्पष्ट समझ मिलती है, क्योंकि वीडियो जनरेटर को वास्तव में एक भौतिक शरीर को नियंत्रित करने के लिए डिज़ाइन नहीं किया गया था।

AgiBot की एक टीम ने अब एक अलग दृष्टिकोण पेश किया है, जो केवल वास्तविक दुनिया के इंटरैक्शन डेटा का उपयोग करके रोबोट की कल्पना को बुनियादी स्तर से निर्मित करता है। उन्होंने GE-Act 2.0 नामक एक सिस्टम बनाया है, जो भविष्य की भविष्यवाणी करना और क्रियाओं का निर्णय लेना एक साथ सीखता है, लेकिन एक महत्वपूर्ण मोड़ के साथ: सिस्टम का प्रत्येक भाग रोबोटों और मनुष्यों द्वारा वस्तुओं के हेरफेर से एकत्र किए गए डेटा पर शून्य से प्रशिक्षित किया गया है। शोधकर्ताओं ने पूर्व-निर्मित वीडियो मॉडल पर भरोसा नहीं किया। इसके बजाय, उन्होंने सिस्टम को गति की एक संकुचित भाषा सिखाई, दुनिया को देखने का एक ऐसा तरीका जो नियंत्रण के लिए महत्वपूर्ण चीजों पर ध्यान केंद्रित करने हेतु अनावश्यक विवरणों को हटा देता है। इसने रोबोट को डेटा के एक विशाल और विविध पुस्तकालय से सीखने की अनुमति दी, जिसमें सफल प्रदर्शनों, असफल प्रयासों और यहाँ तक कि बिना किसी रिकॉर्ड किए गए निर्देश के काम करने वाले मनुष्यों के वीडियो भी शामिल थे। इस विभिन्न प्रकार के शिक्षण को जोड़कर, सिस्टम ने सामान्यीकरण (generalize) करना सीखा, जिसका अर्थ है कि वह सीखी गई बातों को एक पूरी तरह से नई स्थिति में लागू कर सकता था जिसे उसने पहले कभी नहीं देखा था।

इस उपलब्धि का मूल आधार यह है कि शोधकर्ताओं ने भौतिक दुनिया की अव्यवस्थित वास्तविकता को कैसे संभाला। जब एक रोबोट सीखने की कोशिश करता है, तो उसे अक्सर एक भ्रमित करने वाली समस्या का सामना करना पड़ता है: एक ही निर्देश को कई अलग-अलग तरीकों से पूरा किया जा सकता है। एक रोबोट को "लाल कप उठाओ" कहा जा सकता है, और वह बाईं ओर से, दाईं ओर से, या हैंडल या रिम से पकड़कर आगे बढ़ सकता है। यदि प्रशिक्षण डेटा केवल एक ही तरीका दिखाता है, लेकिन रोबोट की कल्पना कुछ और बताती है, तो सिस्टम के दोनों हिस्से तालमेल से बाहर हो सकते हैं। शोधकर्ताओं ने इस बेमेल को एक "वैलिडिटी गैप" (validity gap) के रूप में पहचाना, जहाँ रोबोट का भविष्य का अनुमान उस क्रिया के साथ मेल नहीं खाता जो उसे करनी चाहिए। इसे ठीक करने के लिए, उन्होंने एक चयन प्रक्रिया विकसित की जो एक फिल्टर की तरह कार्य करती है। भविष्य के अनुमान से सीखने से पहले, रोबोट यह जाँचता है कि क्या वह भविष्य उस क्रिया के अनुकूल है जिसे उसे करना है। वह कई संभावित भविष्य उत्पन्न करता है, उन्हें आवश्यक क्रिया के विरुद्ध परीक्षण करता है, और केवल उन्हीं से सीखता है जो एक साथ तर्कसंगत लगते हैं। यह सुनिश्चित करता है कि रोबोट यह न समझ ले कि विभिन्न क्रियाएं विभिन्न परिणामों की ओर कैसे ले जाती हैं।

इस प्रशिक्षण के परिणाम आश्चर्यजनक हैं, विशेष रूप से उन कार्यों पर परीक्षण किए जाने पर जिनका अभ्यास रोबोट ने पहले कभी नहीं किया है। शोधकर्ताओं ने सौ अलग-अलग मैनिपुलेशन कार्यों पर सिस्टम का मूल्यांकन किया, जिनमें ब्लॉक को स्टैक करना और तरल पदार्थ डालना से लेकर तौलिये को मोड़ना और प्लग लगाना शामिल है। ये परीक्षण वास्तविक रोबोटों पर अलग-अलग लाइटिंग, बैकग्राउंड और वस्तुओं की व्यवस्था वाले वातावरण में किए गए थे। जब सिस्टम को 300 घंटों के छोटे डेटासेट पर प्रशिक्षित किया गया, तो इसने एक रोबोट मॉडल पर केवल 17.1% कार्यों में सफलता प्राप्त की। हालांकि, जैसे-जैसे शोधकर्ताओं ने प्रशिक्षण डेटा को बढ़ाकर 30,000 घंटे किया, सफलता दर लगातार बढ़कर 44.1% हो गई। यह सुधार व्यक्तिगत कार्यों के लिए किसी विशिष्ट फाइन-ट्यूनिंग के बिना हुआ; रोबोट ने बस सीखी गई सामान्य कौशलों को नए चुनौतियों पर लागू किया। इससे भी अधिक आश्चर्यजनक रूप से, सिस्टम ने दूसरे, अलग रोबोट मॉडल पर मजबूत क्षमता दिखाई, जिसमें प्रशिक्षण डेटा का 2% से भी कम हिस्सा था, जो बताता है कि बड़े डेटासेट से सीखे गए कौशल एक नए भौतिक रूप में प्रभावी ढंग से स्थानांतरित हुए।

निर्देशों का पालन करने की सिस्टम की क्षमता का परीक्षण कठिन परिस्थितियों में भी किया गया। कई परीक्षणों में, रोबोट को एक ऐसा कार्य करने के लिए कहा गया जो दृश्य या पिछले स्वभाव के आधार पर उसके अपेक्षित व्यवहार के विपरीत था। उदाहरण के लिए, यदि रोबोट किसी गति के बीच में था, तो वह फिर भी रुक सकता था और अपना रास्ता बदलने के लिए एक नए, स्पष्ट कमांड का पालन कर सकता था। 90% से अधिक परीक्षणों में, रोबोट ने निर्देश में बताए गए विशिष्ट वस्तु, रंग, आकार या स्थिति की सही पहचान की, भले ही वे विवरण सूक्ष्म हों या संदर्भ भ्रमित करने वाला हो। शोधकर्ताओं ने रोबोट द्वारा सीखे गए कौशल की विविधता और नए कार्यों पर उसकी सफलता की क्षमता के बीच एक मजबूत संबंध पाया। प्रशिक्षण के दौरान डेटा जितना अधिक विविध था, रोबोट के किसी नई स्थिति को संभालने की संभावना उतनी ही अधिक थी। यह सुझाव देता है कि अधिक सक्षम रोबोटों का मार्ग केवल बेहतर एल्गोरिदम में नहीं, बल्कि उस डेटा की मात्रा और विविधता में निहित है जिसका वे उपभोग करते हैं।

यह कार्य ऐसे रोबोटों की दिशा में एक महत्वपूर्ण कदम है जो दुनिया को समझने के लिए उसी समृद्ध, असंरचित डेटा से सीख सकते हैं जिसका उपयोग मनुष्य करते हैं। भविष्य की भविष्यवाणी करने और क्रियाओं की योजना बनाने वाले एक एकीकृत सिस्टम बनाकर, और कई संभावनाओं में से सही भविष्यवाणियों को चुनने के लिए इसे प्रशिक्षित करके, शोधकर्ताओं ने एक ऐसा मॉडल तैयार किया है जो मजबूत और अनुकूलनीय है। निष्कर्ष बताते हैं कि पर्याप्त विविध अनुभव के साथ, एक रोबोट वस्तुओं के व्यवहार और उनके साथ बातचीत करने के तरीके की गहरी, सहज समझ विकसित कर सकता है, जो कठोर प्रोग्रामिंग से हटकर एक अधिक लचीले रूप की ओर बढ़ता है। वास्तविक हार्डवेयर पर इस दृष्टिकोण की सफलता, बिना हर नए काम के लिए पुन: प्रशिक्षित किए, एक ऐसे भविष्य की ओर संकेत करती है जहाँ रोबनों को गतिशील, अप्रत्याशित वातावरण में तैनात किया जा सकता है और वहां फलने-फूलने के लिए सीखा जा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →