← नवीनतम पेपर
💻 computer science

RoboStream: Weaving Spatio-Temporal Reasoning with Memory in Vision-Language Models for Robotics

रोबोस्ट्रीम (RoboStream) एक प्रशिक्षण-मुक्त ढांचा है जो स्पैटियो-टेम्पोरल फ्यूजन टोकन (Spatio-Temporal Fusion Tokens) और एक कॉज़ल स्पैटियो-टेम्पोरल ग्राफ (Causal Spatio-Temporal Graph) को एकीकृत करके लॉन्ग-होरिज़न रोबोटिक मैनिपुलेशन के लिए विजन-लैंग्वेज मॉडल्स को उन्नत करता है, ताकि निरंतर ज्यामितीय एंकरिंग (geometric anchoring) और कॉज़ल मेमोरी बनाए रखी जा सके, जिससे उन धारणात्मक त्रुटियों और स्टेट-ट्रैकिंग विफलताओं पर विजय प्राप्त की जा सके जो मौजूदा आइसोलेटेड-स्टेप प्लानर्स को प्रभावित करती हैं।

मूल लेखक: Yuzhi Huang, Jie Wu, Weijue Bu, Ziyi Xiong, Gaoyang Jiang, Ye Li, Kangye Ji, Shuzhao Xie, Yue Huang, Chenglei Wu, Jingyan Jiang, Zhi Wang

प्रकाशित 2026-03-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuzhi Huang, Jie Wu, Weijue Bu, Ziyi Xiong, Gaoyang Jiang, Ye Li, Kangye Ji, Shuzhao Xie, Yue Huang, Chenglei Wu, Jingyan Jiang, Zhi Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ RoboStream पेपर का हिंदी अनुवाद दिया गया है:

बड़ी समस्या: वह रोबोट जिसकी "शॉर्ट-टर्म मेमोरी लॉस" (याददाश्त की कमी) है

कल्पना कीजिए कि आप एक रोबोट को ब्लॉक्स से एक जटिल टावर बनाना सिखा रहे हैं।

  • चरण 1: रोबोट एक लाल ब्लॉक रखता है।
  • चरण 2: वह उसके ऊपर एक नीला ब्लॉक रखता है।
  • चरण 3: वह एक हरा ब्लॉक रखने की कोशिश करता है, लेकिन अचानक एक कप गिर जाता है और नीले ब्लॉक को ढक लेता है।

अब, वर्तमान रोबोटों (मानक AI का उपयोग करने वाले) के साथ समस्या यह है:
जब रोबोट चरण 4 में दृश्य को देखता है, तो उसे केवल कप दिखाई देता है। उसे कोई याद नहीं रहता कि नीचे एक नीला ब्लॉक है। उसे यह भी याद नहीं रहता कि लाल ब्लॉक ठीक कहाँ है, इसलिए वह केवल अनुमान लगाता है। क्योंकि उसका अनुमान गलत होता है, वह टावर को गिरा देता है।

वर्तमान रोबोट उन लोगों की तरह हैं जो एक कमरे की फोटो लेते हैं, आँखें बंद करते हैं, और केवल उस फोटो के आधार पर कमरे की बनावट बताने की कोशिश करते हैं। यदि वे एक कुर्सी हटा देते हैं, तो वे भूल जाते हैं कि कुर्सी हटाई गई थी। यदि कुछ छिप जाता है, तो वे ऐसा व्यवहार करते हैं जैसे उसका अस्तित्व ही कभी नहीं था। उन्हें हर एक सेकंड में पूरी दुनिया को फिर से "अनुमान" (re-infer) लगाना पड़ता है।

समाधान: RoboStream (एक "सुपर-ब्रेन" वाला रोबोट)

इस पेपर के लेखकों ने RoboStream बनाया है। RoboStream को केवल एक ऐसे रोबोट के रूप में न देखें जो केवल "देखता" और "कार्य करता" है, बल्कि एक ऐसे रोबोट के रूप में देखें जो इंसान की तरह सोचता और याद रखता है।

यह दो मुख्य शक्तियों (superpowers) के साथ इस समस्या को हल करता है:

1. "3D आईडी कार्ड" (Spatio-Temporal Fusion Tokens)

एक ब्लॉक की धुंधली तस्वीर देखने के बजाय, RoboStream हर वस्तु को एक स्थायी 3D आईडी कार्ड देता है।

  • उपमा (Analogy): कल्पना कीजिए कि कमरे के हर ब्लॉक के साथ एक छोटा, अदृश्य होलोग्राफिक टैग लगा हुआ है। यह टैग केवल यह नहीं कहता कि "मैं एक नीला क्यूब हूँ।" यह कहता है, "मैं एक नीला क्यूब हूँ, मेरी चौड़ाई ठीक 5 सेमी है, मेरा केंद्र (X, Y, Z) निर्देशांक पर है, और मेरा आकार एक पूर्ण गोले जैसा है।"
  • यह कैसे मदद करता है: भले ही रोबोट का कैमरा धुंधला हो या रोशनी बदल जाए, उसे अनुमान लगाने की ज़रूरत नहीं है। वह आईडी कार्ड पढ़ लेता है। यह रोबोट को "स्थानिक मतिभ्रम" (spatial hallucinations - यानी किसी चीज़ को वहां मान लेना जहाँ वह नहीं है) करने से रोकता है।

2. "स्टोरीबुक लॉग" (Causal Spatio-Temporal Graph)

यह रोबोट की याददाश्त की किताब है। यह केवल यह याद नहीं रखता कि वहाँ क्या है; इसे याद रहता है कि क्या हुआ था।

  • उपमा: कल्पना कीजिए कि रोबोट एक डायरी लिख रहा है।
    • प्रविष्टि 1: "मैंने नीले ब्लॉक को मेज पर रखा।"
    • प्रविष्टि 2: "मैंने नीले ब्लॉक के ऊपर एक कप रखा।"
    • प्रविष्टि 3: "नीला ब्लॉक अब छिप गया है, लेकिन मुझे पता है कि वह कप के नीचे है क्योंकि मैंने इसे अपनी डायरी में लिखा है।"
  • यह कैसे मदद करता है: यदि रोबोट को बाद में नीले ब्लॉक को हिलाने की आवश्यकता होती है, तो वह घबराता नहीं है क्योंकि वह देख नहीं पा रहा है। वह अपनी डायरी खोलता है, अंतिम प्रविष्टि पढ़ता है, और उसे पता होता है कि उसे कहाँ तक पहुँचना है। वह कारण और प्रभाव को समझता है: "क्योंकि मैंने वहां कप रखा, इसलिए ब्लॉक अब छिप गया है।"

यह वास्तविक जीवन में कैसे काम करता है

पेपर में इसका परीक्षण कुछ बहुत कठिन कार्यों पर किया गया:

  1. टावर बनाना: एक-एक करके ब्लॉक्स को स्टैक करना।
  2. उन्हें अलग करना: टावर को गिराए बिना सावधानी से ब्लॉक्स को हटाना।
  3. "लुका-छिपी" का परीक्षण: यह सबसे कठिन है। रोबोट को एक कप के नीचे एक ब्लॉक छिपाना होता है, कुछ अन्य भटकाने वाले कार्य करने होते हैं, और फिर छिपे हुए ब्लॉक को ढूँढकर ठीक उसी जगह वापस रखना होता है जहाँ वह शुरू में था।

परिणाम:

  • पुराने रोबोट (SoFar, Voxizer): वे बुरी तरह विफल रहे (लगभग 11% सफलता)। जैसे ही कोई ब्लॉक छिपा या टावर ऊँचा हुआ, वे भ्रमित हो गए।
  • RoboStream: यह सिमुलेशन में 90.5% बार सफल रहा और वास्तविक दुनिया में 44.4% बार (जो वास्तविक रोबोट के लिए बहुत बड़ा है!)।

यह क्यों महत्वपूर्ण है

इससे पहले, रोबोट उन अभिनेताओं की तरह थे जिन्हें केवल नाटक की अपनी वर्तमान पंक्ति पता थी। यदि स्क्रिप्ट बदल जाती या वे एक पंक्ति भूल जाते, तो वे जम जाते थे।

RoboStream एक ऐसे अभिनेता की तरह है जिसने पूरी स्क्रिप्ट पढ़ ली है, कथानक (plot) को समझ लिया है, पहले हुए हर दृश्य को याद रखता है, और जानता है कि हर प्रॉप (prop) कहाँ है, भले ही वह वर्तमान में किसी बॉक्स में छिपा हो।

रोबोटों को 3D स्पेस में वस्तुओं को स्थापित (anchor) करने और उनके द्वारा किए गए कार्यों की कहानी को ट्रैक (track) करने का तरीका देकर, हम एक बड़े कदम के करीब हैं—ऐसे रोबोट जो हमारे घरों, कारखानों और अस्पतालों में बिना चीज़ें तोड़े या भ्रमित हुए हमारी मदद कर सकें।

संक्षेप में: RoboStream रोबोटों को अनुमान लगाना बंद करने और याद रखना शुरू करने की शिक्षा देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →