← नवीनतम पेपर
💻 computer science

GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture

यह शोध पत्र GigaBrain-0.7 को प्रस्तुत करता है, जो एक एम्बॉडीड फाउंडेशन मॉडल है जो एक नवीन तीन-प्रणाली आर्किटेक्चर का लाभ उठाता है और जिसे विविध रोबोटिक स्वरूपों में पूर्ववर्ती अत्याधुनिक मॉडलों की तुलना में बेहतर ज़ीरो-शॉट सामान्यीकरण (zero-shot generalization), निर्देश पालन और कार्य सफलता दर प्राप्त करने के लिए 37,000 घंटों से अधिक के विषम डेटा पर प्रशिक्षित किया गया है।

मूल लेखक: GigaBrain Team, Angen Ye, Axiang Sun, Can Jin, Chenxi Cheng, Chong Shi, Dengke Shang, Dingqian Zhang, Guan Huang, Guangqiang Wang, Guangqing Ding, Guo Li, Hangcong Li, Hengyu Zhong, Hongtao Lu, Jianbo
प्रकाशित 2026-08-18
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: GigaBrain Team, Angen Ye, Axiang Sun, Can Jin, Chenxi Cheng, Chong Shi, Dengke Shang, Dingqian Zhang, Guan Huang, Guangqiang Wang, Guangqing Ding, Guo Li, Hangcong Li, Hengyu Zhong, Hongtao Lu, Jianbo Qin, Jiming Mao, Jing Zhu, Jindi Lv, Jingzhi Cui, Junjie Xie, Junyi Bao, Kai Liu, Lei Yuan, Limin Long, Lv Feng, Mingming Yu, Peng Li, Pengfei Yi, Qi Li, Qianli Zhang, Qingfang Li, Qitang Hu, Rui Zhang, Shaoyan Sun, Shibo Sun, Shiying Duan, Tenghui Chen, Tianze Liu, Weijie Ke, Wenyao Xue, Xiaofeng Wang, Xiaoyu Tian, Xinyu Liu, Xinze Chen, Yang Wang, Yankai Wang, Yejun Zeng, Yifan Li, Yifei Nie, Yilong Li, Yilong Liu, Yongchao Feng, Yumeng Wang, Yun Ye, Zhichao Liu, Ziheng He, Zonghai Yang, Zheng Zhu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ एक रोबोट एक बिखरी हुई रसोई की मेज को देख सकता है, "लाल सेब को कटोरे में रख दो" जैसे बोले गए अनुरोध को समझ सकता है, और फिर यह पता लगा सकता है कि बिना किसी चीज़ को गिराए या टकराए अपने हाथ को ठीक से कैसे चलाया जाए। यह एम्बोडीड (embodied) आर्टिफिशियल इंटेलिजेंस का वादा है: ऐसी मशीनें जो केवल जानकारी को प्रोसेस नहीं करतीं बल्कि भौतिक दुनिया के साथ अंतःक्रिया करती हैं। वर्षों से, शोधकर्ता रोबots को मानव हाथों द्वारा वस्तुओं को हिलाने वाले हजारों वीडियो दिखाकर सिखाने की कोशिश कर रहे हैं, इस उम्मीद में कि मशीन भौतिकी के नियमों और कार्य-कारण (cause-and-effect) के सिद्धांतों को सीख लेगी। हालाँकि, एक बड़ी बाधा बनी रही। रोबोट अलग तरह से बनाए जाते हैं; किसी के दो हाथ हो सकते हैं, किसी के पास एक सिंगल ग्रिपर हो सकता है, और तीसरा पहियों पर चल सकता है। एक प्रकार के रोबोट से एकत्र किया गया डेटा अक्सर दूसरे को भ्रमित कर देता है। इसके अलावा, केवल वीडियो देखने से मशीन यह नहीं सीख पाती कि यदि वह कोई गलती करती है तो आगे क्या होगा, या कार्य गलत होने पर सुधार कैसे किया जाए। सवाल यह था कि क्या हम एक ही स्मार्ट मस्तिष्क बना सकते हैं जो भाषा को समझ सके, दुनिया को देख सके और किसी भी प्रकार के रोबोट शरीर को नियंत्रित कर सके, और वह भी विभिन्न प्रकार के अनुभवों के विशाल मिश्रण से सीखते हुए।

शोधकर्ताओं की एक टीम ने GigaBrain-0.7 नामक एक प्रणाली के साथ एक महत्वपूर्ण प्रगति प्रस्तुत की है। यह केवल एक एकल प्रोग्राम नहीं है बल्कि एक समन्वित प्रणाली है जिसे वास्तविक दुनिया की जटिलताओं को संभालने के लिए डिज़ाइन किया गया है। रोबोट को एक ही अराजक झोंके में सब कुछ सीखने के लिए मजबूर करने के बजाय, शोधकर्ताओं ने सीखने की प्रक्रिया को तीन अलग-अलग लेकिन जुड़े हुए हिस्सों में व्यवस्थित किया जो एक साथ काम करते हैं। पहला हिस्सा हाथों और रिफ्लेक्सिस (reflexes) के रूप में कार्य करता है, जो क्रियाओं को निष्पादित करने के लिए रोबोट के मोटर्स पर तत्काल नियंत्रण लेता है। दूसरा हिस्सा योजनाकार (planner) और पर्यवेक्षक (observer) के रूप में कार्य करता है, जो दृश्य को देखता है, भाषा के निर्देश को समझता है, और "मेज साफ करो" जैसे बड़े लक्ष्य को "कप उठाओ" और "इसे सिंक तक ले जाओ" जैसे छोटे, प्रबंधनीय चरणों में तोड़ता है। तीसरा हिस्सा सबसे नवीन जुड़ाव है: यह एक भविष्यवक्ता (predictor) और निर्णायक (judge) के रूप में कार्य करता है। यह कल्पना करता है कि यदि रोबोट अपने वर्तमान पथ पर चलता रहा तो कुछ सेकंड बाद दृश्य कैसा दिखेगा, और यह उस भविष्य को एक स्कोर देता है ताकि यह तय किया जा सके कि रोबोट प्रगति कर रहा है या विफलता की ओर बढ़ रहा है।

इस प्रणाली को प्रशिक्षित करने के लिए, शोधकर्ताओं ने किसी एकल डेटा स्रोत पर भरोसा नहीं किया। उन्होंने 37,000 घंटों से अधिक के अनुभव का एक विशाल पुस्तकालय एकत्र किया। इस संग्रह में कारखानों और घरों में काम करने वाले वास्तविक रोबोटों के वीडियो, वस्तुओं को संचालित करने वाले मानव हाथों के प्रथम-व्यक्ति (first-person) परिप्रेक्ष्य से रिकॉर्ड किए गए वीडियो और कंप्यूटर सिमुलेशन से उत्पन्न डेटा शामिल था। उन्होंने कृत्रिम बुद्धिमत्ता का उपयोग करके नए प्रशिक्षण परिदृश्य भी बनाए, जिससे प्रभावी रूप से उन स्थितियों की विविधता बढ़ गई जिनसे रोबोट सीख सकता था। इस विविध डेटा के मिश्रण को सिस्टम में फीड करके, शोधकर्ताओं ने मॉडल को किसी एक विशिष्ट रोबोट के लिए विशिष्ट चालें रटने के बजाय गति और अंतःक्रिया के सामान्य सिद्धांतों को सीखने की अनुमति दी। सिस्टम को 16 अलग-अलग प्रकार के रोबोट शरीरों को संभालने के लिए प्रशिक्षित किया गया था, जिनमें दो हाथों वाली मशीन से लेकर ह्यूमनॉइड आकृतियाँ तक शामिल थीं, जिससे इसे अपने नियंत्रण में मौजूद शरीर के आधार पर "बाएं" और "दाएं" या "पकड़ने" (grasp) और "छोड़ने" (release) की अपनी समझ को अनुकूलित करना सिखाया गया।

इस दृष्टिकोण के परिणामों का परीक्षण औद्योगिक और घरेलू दोनों सेटिंग्स में वास्तविक रोबोटों पर किया गया। उन कार्यों को करने के लिए जिन्हें उसने पहले कभी नहीं देखा था, सिस्टम ने एक उल्लेखनीय सामान्यीकरण (generalize) क्षमता दिखाई। एक परीक्षण में, एक रोबोट को कपड़ों के ढेर में से एक कपड़ा मोड़ने के लिए कहा गया, जिसमें कपड़े के आकार बदलने के साथ लगातार उसकी पकड़ को समायोजित करने की आवश्यकता होती है। उस विशिष्ट शर्ट के लिए पुन: प्रशिक्षित हुए बिना, सिस्टम ने सफलतापूर्वक विकृत वस्तु (deformable object) का संचालन किया। एक अन्य परिदृश्य में, रोबोट को मिश्रित बर्तनों के समूह में से एक विशिष्ट रंग का चम्मच उठाने के लिए कहा गया, जिससे यह प्रदर्शित हुआ कि वह सूक्ष्म भाषा निर्देशों को समझ सकता है और नए ऑब्जेक्ट्स पर लागू कर सकता है। सिस्टम लंबे कार्यों के अनुक्रमों को भी संभालने में सक्षम सिद्ध हुआ, जैसे डेस्क को व्यवस्थित करना या चावल की सफाई करना, जहाँ रोबोट को कई छोटी गतिविधियों को निष्पादित करते समय समग्र लक्ष्य का बोध बनाए रखना था।

एक प्रमुख निष्कर्ष यह था कि सिस्टम की भविष्य की भविष्यवाणी करने और अपनी प्रगति का मूल्यांकन करने की क्षमता ने सफलता दर में ठोस अंतर पैदा किया। जब शोधकर्ताओं ने सिस्टम के प्रेडिक्टिव (predictive) हिस्से को हटा दिया, तो रोबोट जटिल कार्यों के साथ संघर्ष करने लगा, अक्सर दोहराव वाली गति के लूप में फंस गया या छोटी गलतियों से उबरने में विफल रहा। प्रेडिक्टिव घटक सक्रिय होने के साथ, रोबोट अनुमान लगा सकता था कि एक निश्चित गति टक्कर या गिरावट का कारण बनेगी, और वह गलती होने से पहले ही अपना रास्ता बदल लेगा। इस क्षमता ने रोबोट को उपहार लपेटने या क्यूब्स को छांटने जैसे कठिन कार्यों को पिछली मॉडलों की तुलना में बहुत उच्च विश्वसनीयता के साथ पूरा करने में सक्षम बनाया। शोधकर्ताओं ने पाया कि जैसे-जैसे उन्होंने प्रशिक्षण डेटा की मात्रा बढ़ाई, रोबोट का प्रदर्शन लगातार सुधरा, जिससे पता चलता है कि सिस्टम वास्तव में अपने अनुभवों की विशाल मात्रा और विविधता से सीख रहा था।

अध्ययन ने यह भी रेखांकित किया कि विभिन्न प्रकार के डेटा को कैसे संयोजित किया जाता है। सिस्टम तब सबसे अच्छा प्रदर्शन करता है जब वह वास्तविक रोबोट परीक्षणों, मानव प्रदर्शनों और सिम्युलेटेड वातावरण के मिश्रण से सीखता है। प्रत्येक स्रोत ने अलग तरह का सबक प्रदान किया: वास्तविक रोबोटों ने सिस्टम को विशिष्ट मशीनों के भौतिक प्रतिबंधों के बारे में सिखाया, मानव वीडियो ने दिखाया कि लोग स्वाभाविक रूप से वस्तुओं के साथ कैसे अंतःक्रिया करते हैं, और सिमुलेशन ने इसे सुरक्षित रूप से दुर्लभ या खतरनाक परिदृश्यों का अभ्यास करने की अनुमति दी। इन स्रोतों को मिलाकर, सिस्टम ने दुनिया के काम करने के तरीके की एक मजबूत समझ विकसित की जिसे विभिन्न रोबोट शरीरों पर लागू किया जा सकता था। शोधकर्ताओं ने नोट किया कि हालांकि सिस्टम पूर्ण नहीं है और अभी भी कुछ सबसे जटिल भौतिक अंतःक्रियाओं के साथ संघर्ष करता है, फिर भी यह एकल कार्यों के लिए विशेष रोबोट बनाने के बजाय एक सामान्य-उद्देश्य वाली बुद्धि (general-purpose intelligence) बनाने की ओर एक बदलाव का प्रतिनिधित्व करता है।

अंततः, GigaBrain-0.7 यह प्रदर्शित करता है कि प्रशिक्षण डेटा की मात्रा और विविधता को बढ़ाने के साथ, योजना बनाने (planning), कार्य करने (acting) और भविष्यवाणी करने (predicting) को अलग करने वाली एक संरचित वास्तुकला (architecture) को जोड़ने से रोबोट अधिक सक्षम और अनुकूलन योग्य बन सकते हैं। सिस्टम केवल एक स्क्रिप्ट का पालन नहीं करता है; यह किसी कार्य के संदर्भ को समझता है, अपने कार्यों के परिणामों का पूर्वानुमान लगाता है, और समय के साथ सुधार करने के लिए अपने अनुभव से सीखता है। हालांकि ऐसे सिस्टम को घर या कारखाने में हर संभव स्थिति को संभालने के लिए अभी भी बहुत काम करना बाकी है, यह शोध एक स्पष्ट मार्ग प्रदान करता है। यह सुझाव देता है कि रोबोटिक्स का भविष्य केवल बेहतर हार्डवेयर बनाने में नहीं है, बल्कि अधिक स्मार्ट, अधिक लचीले सॉफ्टवेयर बनाने में है जो भौतिक दुनिया के विशाल और विविध अनुभवों से सीख सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →