← नवीनतम पेपर
💻 computer science

Riemann-1.0: An Embodied World Action Model for Physical AI

Riemann-1.0 एक एकीकृत कारणत्मक ऑटोरेग्रेसिव वर्ल्ड एक्शन मॉडल है जो मल्टी-व्यू ऑब्जर्वेशन, रोबोट स्टेट्स और एक्शन्स को एक एकल फ्रेमवर्क में एकीकृत करता है, जो सिमुलेशन और वास्तविक दुनिया के लॉन्ग-होरइजन मैनिपुलेशन कार्यों में अत्याधुनिक प्रदर्शन प्राप्त करने के लिए 2,00,000 घंटों से अधिक विविध एम्बॉडीड डेटा पर एक प्रोग्रेसिव प्रीट्रेनिंग रणनीति का लाभ उठाता है।

मूल लेखक: Haofeng Sun, Jiangbo Pei, Fei Kang, Zexiang Liu, Yaokun Li, Boyi Jiang, Hua Xue, Cindy Zhou, Wei Li, Yichen Wei, Mengyin An, Fanliang Zhao, Biao Jiang, Zile Wang, Yang Liu, Yangguang Li

प्रकाशित 2026-08-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haofeng Sun, Jiangbo Pei, Fei Kang, Zexiang Liu, Yaokun Li, Boyi Jiang, Hua Xue, Cindy Zhou, Wei Li, Yichen Wei, Mengyin An, Fanliang Zhao, Biao Jiang, Zile Wang, Yang Liu, Yangguang Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस लंबे समय से डिजिटल जगत का स्वामी रहा है, जो कंप्यूटर स्क्रीन की सीमाओं के भीतर टेक्स्ट को पढ़ता है, छवियों को पहचानता है और पहेलियों को हल करता है। लेकिन मशीनों को वास्तव में हमारे साथ भौतिक दुनिया में शामिल होने के लिए, उन्हें केवल यह समझने से कहीं अधिक करना होगा कि वे क्या देख रही हैं; उन्हें यह भी सीखना होगा कि उसके भीतर कार्य कैसे किया जाए। यही 'एम्बोडीड इंटेलिजेंस' (embodized intelligence) की चुनौती है: रोबोट को उनके परिवेश को समझने, कारण और प्रभाव के बारे में तर्क करने और उसी सहजता के साथ शारीरिक गतिविधियों को निष्पादित करने के लिए प्रशिक्षित करना, जिसका उपयोग एक इंसान कप उठाने या शर्ट मोड़ने के लिए करता है। एक मशीन की सफलता के लिए, उसे दुनिया का एक ऐसा मॉडल चाहिए जो न केवल यह समझे कि वस्तुएं कैसी दिखती हैं, बल्कि यह भी कि छूने पर वे कैसे चलती और बदलती हैं। उसे यह सीखना होगा कि एक ब्लॉक को धकेलने से वह फिसल जाता है, और ढक्कन उठाने से उसके अंदर क्या है, यह प्रकट होता है। अब तक, एक ऐसा एकल सिस्टम बनाना जो इन भौतिक कार्यों की योजना बना सके और उन कार्यों के दृश्य परिणामों की भविष्यवाणी कर सके, एक कठिन बाधा रही है, जिसके लिए अक्सर सोचने और हिलने-डुलने के लिए अलग-अलग प्रणालियों की आवश्यकता होती थी।

शोधकर्ताओं की एक टीम ने 'रीमैन-1.0' (Riemann-1.0) नामक एक नई प्रणाली पेश की है, जिसे रोबोट के कार्यों और दुनिया में होने वाले परिवर्तनों को एक निरंतर कहानी के रूप में मानकर इस अंतर को पाटने के लिए डिज़ाइन किया गया है। यह मॉडल यह तय करने के लिए अलग उपकरण बनाने और यह कल्पना करने के लिए कि आगे क्या होगा, के बजाय दोनों काम एक साथ करने के लिए बनाया गया है। यह एक सरल लेकिन शक्तिशाली सिद्धांत पर काम करता है: वास्तविक दुनिया में, परिणाम दिखने से पहले एक क्रिया हमेशा होती है। यदि कोई रोबकट चम्मच की ओर हाथ बढ़ाता है, तो गति पहले होती है, और दृश्य परिवर्तन—चम्मच का हिलना—उसके बाद होता है। रीमैन-1.0 इस क्रम का सम्मान करने के लिए बनाया गया है, जो वीडियो और मूवमेंट डेटा के एक विशाल संग्रह से सीखता है कि अगली कार्रवाई क्या होनी चाहिए और उसे करने के बाद दुनिया कैसी दिखेगी।

इस प्रणाली को सिखाने के लिए, शोधकर्ताओं ने अनुभव का एक विशाल पुस्तकालय एकत्र किया, जो 2,0LOC,000 घंटों से अधिक की अंतःक्रियाओं का कुल योग है। यह संग्रह केवल रोबोटिक वीडियो का ढेर नहीं था; यह तीन अलग-अलग प्रकार की शिक्षण सामग्री का एक सावधानीपूर्वक क्यूरेट किया गया मिश्रण था। सबसे पहले, उन्होंने मानव के दृष्टिकोण से रिकॉर्ड किए गए हजारों घंटों के वीडियो शामिल किए, जो खाना पकाने या सफाई करने जैसे रोजमर्रा के कार्यों को करते हुए लोगों को दिखाते हैं। इन वीडियो ने वस्तुओं के बीच होने वाली अंतःक्रिया और कार्यों के समय के साथ कैसे आगे बढ़ते हैं, इसकी एक व्यापक समझ प्रदान की, भले ही उनमें विशिष्ट यांत्रिक डेटा की कमी थी। दूसरा, उन्होंने हैंडहेल्ड रोबिक ग्रिपर्स और पहनने योग्य उपकरणों से प्रदर्शनों को जोड़ा, जो एक सेतु के रूप में कार्य करते हैं, यह दिखाते हुए कि मानव हाथों की हरकतें मशीन जैसी नियंत्रणों में कैसे परिवर्तित होती हैं। अंत में, उन्होंने वास्तविक रोबोटिक गतिविधियों की सटीक रिकॉर्डिंग को शामिल किया, जिसने मशीन को अपने अंगों को हिलाने के निर्देश देने के लिए आवश्यक सटीक, निष्पादन योग्य निर्देश प्रदान किए। इन स्रोतों को जोड़कर, शोधकर्ताओं ने एक एकीकृत डेटासेट बनाया जिसने मॉडल को मानव अनुभव के व्यापक ज्ञान से सीखने और उस ज्ञान को रोबोट नियंत्रण की सटीक यांत्रिकी में स्थापित करने की अनुमति दी।

रीमैन-1.0 के लिए प्रशिक्षण प्रक्रिया एक स्कूल पाठ्यक्रम की तरह संरचित थी, जो सामान्य अवलोकन से विशिष्ट निष्पादन की ओर बढ़ती थी। पहले चरण में, मॉडल ने मानव वीडियो के विशाल पुस्तकालय का अध्ययन किया। चूंकि इन वीडियो में रोबोटिक मूवमेंट डेटा नहीं था, इसलिए सिस्टम ने एक सहायक उपकरण का उपयोग करके उन अदृश्य "कार्यों" का अनुमान लगाया जिन्होंने स्क्रीन पर देखे गए दृश्य परिवर्तनों को उत्पन्न किया होगा। इसने मॉडल को यह सीखने की अनुमति दी कि दुनिया कैसे चलती है, बिना किसी पूर्ण रोबोटिक डेटा के। दूसरे चरण में, मॉडल को मानव हाथों और रोबोटिक ग्रिपर्स के मिश्रित डेटा से परिचित कराया गया, जिससे वह अपनी गति की समझ को वास्तविक, भौतिक नियंत्रणों के साथ संरेखित करना सीख सका। अंत में, तीसरे चरण में, मॉडल ने विशेष रूप से रोबोट द्वारा किए जाने वाले कार्यों की उच्च-गुणवत्ता वाली रिकॉर्डिंग पर ध्यान केंद्रित किया। इस अंतिम चरण ने सटीक, निष्पादन योग्य कमांड उत्पन्न करने की इसकी क्षमता को तेज किया, यह सुनिश्चित करते हुए कि जो कार्य यह योजना बनाता है वे न केवल दृश्य रूप से प्रशंसनीय हों बल्कि एक वास्तविक मशीन के लिए भौतिक रूप से संभव भी हों।

इसके दृष्टिकोण के परिणाम आश्चर्यजनक थे। विभिन्न कार्यों पर परीक्षण करते समय, कंप्यूटर सिमुलेशन और वास्तविक रोबोट दोनों में, रीमैन-1.0 ने पिछले तरीकों से काफी बड़े अंतर से बेहतर प्रदर्शन किया। कई चरणों वाले लंबे, जटिल कार्यों के परीक्षण के लिए डिज़ाइन किए गए एक सिमुलेशन में, मॉडल 62.6% बार सफल रहा, जो मौजूदा सर्वोत्तम प्रणालियों की तुलना में एक उल्लेखनीय सुधार है। दो-हाथ वाले रोबोटों पर केंद्रित एक अन्य सिमुलेशन में, इसने 94.3% की सफलता दर हासिल की। शायद सबसे प्रभावशाली बात यह है कि जब वास्तविक दुनिया के रोबोटों पर रंगीन ब्लॉक को स्टैक करने, कपड़े मोड़ने, अव्यवस्थित डेस्क को व्यवस्थित करने या किचन की वस्तुओं को व्यवस्थित करने जैसे कार्यों को करने के लिए तैनात किया गया, तो सिस्टम ने 85% बार कार्यों को सफलतापूर्वक पूरा किया। इसने उन नई स्थितियों में अनुकूलित होने की भी उल्लेखनीय क्षमता दिखाई जिन्हें इसने पहले नहीं देखा था, जैसे कि रूबिक क्यूब को बॉक्स में रखना या तौलिया को बेसिन में रखना, जिसमें इसने 85% नए परीक्षणों में सफलता प्राप्त की।

केवल एक रोबोट नियंत्रक के रूप में कार्य करने के अलावा, रीमैन-1.0 एक सिम्युलेटर के रूप में भी कार्य कर सकता है। क्योंकि यह एक क्रिया और उसके दृश्य परिणाम के बीच के कारण संबंध को समझता है, शोधकर्ता इससे पूछ सकते हैं कि यदि एक रोबोट एक विशिष्ट गति करता है तो क्या होगा। मॉडल भविष्य का एक वीडियो उत्पन्न कर सकता है, जो दिखा सकता है कि दिए गए कार्य के आधार पर वस्तुएं कैसे हिलेंगी और वे कहां समाप्त होंगी। यह दोहरी क्षमता का अर्थ है कि सिस्टम एक ऐसे मस्तिष्क के रूप में कार्य कर सकता है जो यह तय करता है कि क्या करना है और एक ऐसी कल्पना के रूप में भी जो यह जांचती है कि रोबोट के हिलने से पहले क्या योजना काम करेगी। भौतिक दुनिया के भविष्य की भविष्यवाणी करने की यह क्षमता, जो क्रियाओं के कारण होने वाले परिवर्तनों की वास्तविकता पर आधारित है, मशीनों को भौतिक दुनिया में एक विश्वसनीय साथी बनाने की दिशा में एक महत्वपूर्ण कदम है। यह कार्य सुझाव देता है कि क्रिया करने के तरीके और दुनिया कैसे प्रतिक्रिया देती है, इसे एक साथ जोड़कर, मशीनें हमारे रोजमर्रा के कार्यों की अधिक मजबूत और सामान्यीकृत समझ विकसित कर सकती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →