← नवीनतम पेपर
💻 computer science

NativeMEM: Native Memory Compression for Long-Horizon Robotic Manipulation

NativeMEM एक नवीन विजन-लैंग्वेज-एक्शन (VLA) पॉलिसी है जो एक कुशल, नेटिव मेमोरी कंप्रेशन स्कीम को एकीकृत करती है ताकि बिना किसी बाहरी मेमोरी मॉड्यूल पर निर्भर हुए या पर्याप्त लेटेंसी ओवरहेड के बिना, काफी बेहतर सफलता दर और डेटा दक्षता के साथ रीयल-टाइम, लॉन्ग-होरिज़न रोबोटिक मैनिपुलेशन को सक्षम बनाया जा सके।

मूल लेखक: Ziye Wang, Modi Shi, Chaojun Ni, Jiazhi Yang, Mengdi Li, Zhizhong Su, Tianwei Lin, Hongyang Li

प्रकाशित 2026-07-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ziye Wang, Modi Shi, Chaojun Ni, Jiazhi Yang, Mengdi Li, Zhizhong Su, Tianwei Lin, Hongyang Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कोई जटिल काम सिखा रहे हैं, जैसे मेज सजाना या किराने के सामान को व्यवस्थित करना। आप रोबोट को एक कैमरा और निर्देशों का एक सेट देते हैं। समस्या यह है कि आज के अधिकांश रोबोट बहुत कम ध्यान देने वाले लोगों की तरह हैं: वे केवल उसी पर ध्यान देते हैं जो अभी हो रहा है। यदि आप उनसे कहते हैं, "लाल कप को वापस वहीं रख दो जहाँ वह शुरू में था," तो वे कप को तो देख सकते हैं, लेकिन अगर उन्हें याद नहीं है कि "शुरुआत" कहाँ थी क्योंकि उन्होंने केवल वर्तमान फ्रेम देखा था, तो वे असफल हो जाएंगे।

इसे ठीक करने के लिए, पिछले तरीकों ने रोबोट को एक नोटबुक देने की कोशिश की। लेकिन ये नोटबुक या तो पढ़ने में बहुत धीमी थीं, या बहुत भारी थीं, या इनके लिए एक दूसरे "मस्तिष्क" (एक बाहरी मॉड्यूल) की आवश्यकता थी, जिससे रोबोट का मुख्य मस्तिष्क भ्रमित हो जाता था।

NativeMEM रोबोट को बिना कोई अतिरिक्त वजन या भ्रम जोड़े दीर्घकालिक स्मृति (long-term memory) देने का एक नया तरीका है। यह इस प्रकार काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. समस्या: "भूलने वाला" (Amnesiac) रोबोट

वर्तमान रोबोट मस्तिष्क (जिन्हें VLA मॉडल कहा जाता है) एक तस्वीर देखने और यह कहने में अद्भुत हैं कि, "ठीक है, मैं एक कप देख रहा हूँ, मुझे इसे उठाना चाहिए।" लेकिन यदि कार्य के लिए यह याद रखने की आवश्यकता है कि 10 सेकंड पहले क्या हुआ था (जैसे, "मैंने नीला बटन दबा दिया है, इसलिए अब मुझे गुलाबी बटन दबाना चाहिए"), तो रोबोट खो जाता है। वह भूल जाता है कि उसने अभी-अभी क्या किया था।

2. पुराने समाधान: "भारी नोटबुक"

  • टेक्स्ट नोट दृष्टिकोण: कुछ शोधकर्ताओं ने कोशिश की कि एक दूसरा AI घटनाओं के बारे में टेक्स्ट नोट्स लिखे ("मैंने नीला दबाया") और उसे रोबोट को खिलाया जाए। यह एक रोबोट से चलते समय डायरी पढ़ने के लिए कहने जैसा है। यह धीमा है, और रोबोट उन सूक्ष्म विवरणों को मिस कर सकता है जिन्हें शब्दों में बताना कठिन होता है।
  • एक्सटर्नल हार्ड ड्राइव दृष्टिकोण: अन्य लोगों ने रोबोट के अंदर एक अलग मेमोरी चिप जोड़ने की कोशिश की। यह एक दूसरा मस्तिष्क जोड़ने जैसा है जिसे मुख्य मस्तिष्क को लगातार उससे बात करनी पड़ती है। यह रोबोट को धीमा और अधिक जटिल बनाता है, और मुख्य मस्तिष्क हमेशा उस नए चिप की भाषा नहीं समझ पाता है।

3. NativeMEM समाधान: "एक-शब्द का सारांश"

NativeMEM एक अलग दृष्टिकोण अपनाता है। एक नया नोटबुक या दूसरा मस्तिष्क जोड़ने के बजाय, यह रोबोट के मौजूदा मस्तिष्क को अपने ही अतीत का सारांश बनाना सिखाता है।

  • कंप्रेशन ट्रिक (Compression Trick): कल्पना कीजिए कि आप 1 घंटे की फिल्म देख रहे हैं। आमतौर पर, इसे याद रखने के लिए, आपको पूरी मूवी फ़ाइल (विशाल आकार) को सहेजना होगा। NativeMEM एक सुपर-कुशल संपादक की तरह है जो फिल्म देखता है और हर दृश्य के लिए एक एकल शब्द लिखता है जो उस दृश्य के सबसे महत्वपूर्ण हिस्से को पूरी तरह से पकड़ लेता है।
  • नेटिव भाषा (Native Language): क्योंकि यह "एक-शब्द का सारांश" रोबोट की अपनी आँखों (इसके विजन एनकोडर) द्वारा बनाया जाता है, इसलिए रोबोट इसे पूरी तरह से समझता है। इसे किसी विदेशी भाषा (जैसे टेक्स्ट नोट्स) में अनुवाद करने की आवश्यकता नहीं है या किसी नए चिप से बात करने की आवश्यकता नहीं है। सारांश उस वाक्य का एक और शब्द है जिसे रोबोट पहले से ही पढ़ रहा है।

4. उन्होंने इसे कैसे सिखाया: "दो-चरणीय प्रशिक्षण"

शोधकर्ताओं ने केवल इस फीचर को चालू नहीं किया; उन्होंने इसे दो चरणों में प्रशिक्षित किया:

  • चरण 1: सारांश बनाना सीखना। उन्होंने रोबोट के मुख्य मस्तिष्क को फ्रीज (freeze) कर दिया (ताकि वह जो पहले से जानता है उसे न भूले) और एक छोटे सहायक को प्रशिक्षित किया जो पिछले वीडियो को देखे और उन्हें उन "एक-शब्द के सारांशों" में बदल दे। उन्होंने इस सहायक को सिखाया कि, "यदि आप अतीत को इस तरह से सारांशित करते हैं, तो रोबोट सही कदम उठाएगा।"
  • चरण 2: काम पर लगाना। एक बार जब रोबोट ने इन सारांशों को पढ़ना सीख लिया, तो उन्होंने मुख्य मस्तिष्क को अनलॉक कर दिया और उसे इन सारांशों का उपयोग करके विशिष्ट कार्यों का अभ्यास करने दिया। यह रोबोट को उसके मौजूदा विचार प्रक्रिया में पूरी तरह फिट होने वाले 'चीट शीट' देने जैसा है।

5. परिणाम: सुपर मेमोरी, कोई धीमापन नहीं

पेपर दिखाता है कि यह तरीका गेम-चेंजर है:

  • सफलता दर (Success Rate): सिमुलेशन में, NativeMEM का उपयोग करने वाले रोबोट की सफलता दर 32% से बढ़कर 84% हो गई। वास्तविक रोबोट पर, वे 98.7% सफलता तक पहुँच गए।
  • गति (Speed): भले ही रोबोट मिनटों का इतिहास (सैकड़ों फ्रेम) याद रख रहा है, फिर भी यह धीमा नहीं होता है। यह केवल एक फ्रेम को देखने में लगने वाले समय में 160 फ्रेमों के इतिहास को देख सकता है।
  • डेटा दक्षता (Data Efficiency): रोबोट ने इन कौशलों को अन्य तरीकों की तुलना में केवल 20% प्रशिक्षण डेटा का उपयोग करके सीखा। यह एक पूरे सेमेस्टर के बजाय केवल कुछ घंटों के अभ्यास के बाद कार चलाना सीखने जैसा है।

संक्षेप में

NativeMEM रोबोट को बिना उसे धीमा या भ्रमित किए उसके पूरे इतिहास को याद रखने की एक "सुपरपावर" देने जैसा है। एक भारी बैकपैक में वीडियो फाइलों को ले जाने या एक धीमी टेक्स्ट डायरी पढ़ने के बजाय, रोबोट अपने पूरे अतीत को छोटे, कुशल "मेमोरी टोकन" में संकुचित कर देता है जिन्हें वह तुरंत पढ़ सकता है, जिससे वह उन जटिल, दीर्घकालिक पहेलियों को हल कर पाता है जिन्हें वह पहले नहीं संभाल सकता था।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →