← नवीनतम पेपर
💻 computer science

GigaBrain-0.5M*: a VLA That Learns From World Model-Based Reinforcement Learning

यह शोधपत्र GigaBrain-0.5M* को प्रस्तुत करता है, जो एक विजन-लैंग्वेज-एक्शन मॉडल है जो दृश्य समझ और भविष्य के पूर्वानुमान की सीमाओं को दूर करने के लिए RAMP फ्रेमवर्क के माध्यम से वर्ल्ड मॉडल-आधारित सुदृढीकरण लर्निंग (reinforcement learning) का लाभ उठाता है, जिससे जटिल रोबोटिक मैनिपुलेशन कार्यों पर महत्वपूर्ण प्रदर्शन लाभ और विश्वसनीय लॉन्ग-होरिज़न निष्पादन प्राप्त होता है।

मूल लेखक: GigaBrain Team, Boyuan Wang, Bohan Li, Chaojun Ni, Guan Huang, Guosheng Zhao, Hao Li, Jie Li, Jindi Lv, Jingyu Liu, Lv Feng, Mingming Yu, Peng Li, Qiuping Deng, Tianze Liu, Xinyu Zhou, Xinze Chen, Xia
प्रकाशित 2026-02-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: GigaBrain Team, Boyuan Wang, Bohan Li, Chaojun Ni, Guan Huang, Guosheng Zhao, Hao Li, Jie Li, Jindi Lv, Jingyu Liu, Lv Feng, Mingming Yu, Peng Li, Qiuping Deng, Tianze Liu, Xinyu Zhou, Xinze Chen, Xiaofeng Wang, Yang Wang, Yifan Li, Yifei Nie, Yilong Li, Yukun Zhou, Yun Ye, Zhichao Liu, Zheng Zhu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कॉफी बनाना सिखा रहे हैं।

पुराना तरीका (पारंपरिक रोबोट):
आज के अधिकांश रोबोट उस छात्र की तरह हैं जो केवल अपने सामने की चीज़ों को देखता है। वे कॉफी बीन्स देखते हैं, तो उन्हें पीस देते हैं। फिर वे पानी देखते हैं, तो उसे डालते हैं। लेकिन उन्हें वास्तव में यह नहीं पता होता कि कॉफी का अंतिम कप कैसा दिखेगा। यदि वे थोड़ा सा पानी गिरा देते हैं, तो वे घबरा सकते हैं क्योंकि वे भविष्य की कल्पना नहीं कर सकते। वे प्रतिक्रियाशील (reactive) हैं, सक्रिय (proactive) नहीं। वे बिना मंजिल के नक्शे के, एक बार में एक कदम उठाते हैं।

नया तरीका (GigaBrain-0.5M):*
यह पेपर GigaBrain-0.5M* को पेश करता है, जो एक ऐसा रोबोटिक दिमाग है जो केवल वर्तमान को नहीं देखता; उसके पास एक क्रिस्टल बॉल (भविष्य देखने वाला गोला) है।

यह कैसे काम करता है, इसे सरल अवधारणाओं में विभाजित किया गया है:

1. "क्रिस्टल बॉल" (वर्ल्ड मॉडल - World Model)

रोबोट के हिलने-डुलने से पहले ही, उसके सिर के अंदर एक विशेष "वर्ल्ड मॉडल" होता है। इसे एक सुपर-स्मार्ट सिम्युलेटर के रूप में समझें।

  • यह क्या करता है: जब आप रोबोट को "कॉफी बनाओ" जैसा निर्देश देते हैं, तो यह मॉडल तुरंत उसके दिमाग में एक मानसिक फिल्म चलाता है। यह भविष्यवाणी करता है: "यदि मैं बीन्स को पकड़ता हूँ, फिर उन्हें पीसता हूँ, फिर पानी डालता हूँ, तो अंतिम स्थिति एक गर्म कॉफी का कप होगी।"
  • यह क्यों महत्वपूर्ण है: यह जानता है कि होने से पहले सफलता कैसी दिखेगी। यह यह भी अनुमान लगा सकता है, "ओह नहीं, अगर मैं कप को बहुत ज़ोर से पकड़ूँगा, तो यह टूट जाएगा," और कप को छूने से पहले ही रुक जाता है।

2. "कोच" (रीइन्फोर्समेंट लर्निंग - Reinforcement Learning)

रोबोट एक प्रक्रिया के माध्यम से सीखता है जिसे RAMP कहा जाता है। कल्पना कीजिए कि एक कोच रोबोट के बगल में खड़ा है।

  • पुराना कोच: पहले कोच केवल यह कहता था कि पूरा काम खत्म होने के बाद "अच्छा काम किया" या "बुरा काम किया"। यह धीमा और भ्रमित करने वाला था।
  • नया कोच (RAMP): यह कोच "क्रिस्टल बॉल" का उपयोग करता है। जब रोबोट काम कर रहा होता है, तो कोच कहता है, "हे, अपनी मानसिक फिल्म को देखो। यदि तुम अभी बाईं ओर मुड़ते हो, तो तुम कॉफी गिरा दोगे। यदि तुम दाईं ओर मुड़ते हो, तो तुम्हें एक बेहतरीन कप मिलेगा।"
  • रोबोट उस रास्ते का अनुसरण करना सीखता है जो क्रिस्टल बॉल द्वारा अनुमानित "परफेक्ट कप" की ओर ले जाता है।

3. "ह्यूमन-इन-द-लूप" (सुरक्षा जाल - Human-in-the-Loop)

क्रिस्टल बॉल होने के बावजूद, रोबोट कभी-कभी गलतियाँ करते हैं।

  • प्रक्रिया: रोबोट एक कार्य (जैसे कपड़े तह करना) करने की कोशिश करता है। यदि वह फंस जाता है या गड़बड़ी करने लगता है, तो एक इंसान उसे ठीक करने के लिए हस्तक्षेप करता है।
  • जादू: रोबिम केवल गलती को भूलता नहीं है। वह पूरे क्रम को रिकॉर्ड करता है: प्रयास, गलती, मानव सुधार, और सफल समापन। फिर वह अगली बार के लिए अपने क्रिस्टल बॉल और अपनी रणनीति को अपडेट करने के लिए इस "सुधार डेटा" का उपयोग करता है। यह एक छात्र की तरह है जो अगली बार के लिए अध्ययन करने के लिए उस परीक्षा की समीक्षा करता है जिसमें उसने गलतियाँ की थीं।

4. परिणाम: "अनाड़ी" से "मास्टर शेफ" तक

इस पेपर ने बहुत कठिन कार्यों पर इसका परीक्षण किया:

  • कपड़े तह करना: रोबोट आमतौर पर नरम और ढीले कपड़ों के साथ संघर्ष करते हैं। GigaBrain ने यह कल्पना करना सीखा कि कपड़ा कैसे गिरेगा और उसे पूरी तरह से तह करेगा।
  • एस्प्रेसो बनाना: इसके लिए चरणों के एक क्रम की आवश्यकता होती है (पीसना, दबाना, ब्रू करना, डालना)। रोबोट ने केवल एक-एक करके ये काम नहीं किए; उसने पूरे क्रम की योजना अपने दिमाग में बनाई ताकि यह सुनिश्चित हो सके कि कॉफी ओवरफ्लो न हो।
  • बक्से पैक करना: इसने वस्तुओं को कुशलतापूर्वक फिट करने का तरीका निकाला ताकि वे गिरें नहीं।

बड़ी तस्वीर का रूपक (Analogy)

पुराने रोबोटों को एक पर्यटक के रूप में सोचें जो बिना नक्शे के शहर में घूम रहा है, और हर मोड़ पर रास्ता पूछ रहा है। वे अंततः वहां पहुँच जाते हैं, लेकिन अक्सर रास्ता भटक जाते हैं या गलत मोड़ ले लेते हैं।

GigaBrain-0.5M* एक स्थानीय गाइड की तरह है जिसने वर्षों तक उस शहर में जीवन बिताया है। वे जानते हैं कि शॉर्टकट कहाँ हैं, वे जानते हैं कि निर्माण कार्य कहाँ चल रहा है, और वे घर से निकलने से पहले ही मंजिल की कल्पना कर सकते हैं। वे केवल सड़क के संकेतों पर प्रतिक्रिया नहीं देते; वे यात्रा का पूर्वानुमान लगाते हैं।

संक्षेप में: यह पेपर रोबोट को कार्य करने से पहले भविष्य की कल्पना करना सिखाता है, जिससे वे तेज़ी से सीख पाते हैं, कम गलतियाँ करते हैं, और उन जटिल, बहु-चरणीय कार्यों को संभाल पाते हैं जो पहले मशीनों के लिए असंभव थे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →