← नवीनतम पेपर
💻 computer science

Try Once, Then Optimal: De-Redundified Procedure Memory for Cross-Episode Exploration Amortization

यह शोध पत्र इंस्टेंस-ओरिएंटेड मेमोरी (IOM) प्रस्तुत करता है, जो एक ऑब्जेक्ट-सेंट्रिक फ्रेमवर्क है जो विजन-लैंग्वेज मॉडल के माध्यम से लघु हेरफेर प्रक्रियाओं को रिकॉर्ड और पुन: उपयोग करके छिपी हुई अवस्थाओं वाले ऑब्जेक्ट्स के हेरफेर के लिए अन्वेषण लागतों को कम करता है, जिससे कार्य सफलता दरों को बनाए रखते हुए या सुधारते हुए अनावश्यक प्रोबिंग को महत्वपूर्ण रूप से कम किया जाता है।

मूल लेखक: Haizhou Ge, Haochen Ouyang, Zhixing Chen, Yufei Jia, Yue Li, Lu Shi, Lei Han, Guyue Zhou, Ruqi Huang

प्रकाशित 2026-07-28
📖 9 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haizhou Ge, Haochen Ouyang, Zhixing Chen, Yufei Jia, Yue Li, Lu Shi, Lei Han, Guyue Zhou, Ruqi Huang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक रोबोटिक हाथ माइक्रोवेव खोलने की कोशिश कर रहा है। उसे यह नहीं पता कि दरवाजा लॉक है या खुला है, जब तक कि वह वास्तव में उसे खींचने की कोशिश नहीं करता। यदि लैच (latch) फंसा हुआ है, तो रोबोट को पहले हैंडल के साथ कुछ छेड़छाड़ करनी होगी, और फिर खींचना होगा। यदि लैच पहले से ही मुक्त है, तो हैंडल घुमाना केवल बेकार की मेहनत होगी। यह उन "छिपी हुई अवस्थाओं" (hidden states) वाली दुनिया में रोबोटों का दैनिक संघर्ष है—जैसे कि बंद दरवाजे, बिना कुंडी वाले कैबिनेट, या पहले से ही खुले हुए ढक्कन। रोबोटों को यह समझने के लिए कि क्या हो रहा है, बार-बार चीजों को टटोलना पड़ता है, जो धीमा और अनाड़ी काम है। रोबकीिक्स के क्षेत्र के वैज्ञानिक मशीनों को अंदाज़ा लगाना छोड़ने और याद रखना सीखने के लिए प्रशिक्षित करने की कोशिश कर रहे हैं। बड़ा सवाल यह है: यदि एक रोबट एक पहेली को एक बार हल कर लेता है, तो क्या वह समाधान को याद रख सकता है ताकि उसे हर बार उसी पहेली को शून्य से हल न करना पड़े?

यह शोध पत्र एक चतुर नई तकनीक पेश करता है जिसे इंस्टेंस-ओरिएंटेड मेमोरी (IOM) कहा जाता है। इसे विशिष्ट वस्तुओं के लिए रोबोट के "स्टिकी नोट" सिस्टम की तरह समझें। आमतौर पर, रोबोट सामान्य नियम याद रखते हैं जैसे "दरवाजा कैसे खोलें।" लेकिन यह नया सिस्टम इस विशिष्ट दरवाजे को और यह वास्तव में कैसे व्यवहार करता है इसे याद रखता है। शोधकर्ताओं ने पाया कि एक बार किसी छिपी हुई अवस्था का पता लगाने के बाद एक छोटा, कुशल "चीट शीट" रिकॉर्ड करने से, वे भविष्य के प्रयासों में अनावश्यक गतिविधियों को 16% से 30% तक कम कर सकते हैं। इससे भी बेहतर बात यह है, उन्होंने इसे एक पूर्व-निर्मित AI टूल (एक विजन-लैंग्वेज मॉडल) का उपयोग करके परीक्षण किया, जिसे इस ट्रिक को सीखने के लिए किसी विशेष प्रशिक्षण की आवश्यकता नहीं थी। रोबोट ने एक बार सीखा, नोट लिखा, और फिर हर बार उस उबाऊ हिस्से को छोड़ दिया, और यह सब बिना कभी विफल हुए किया।

"एक बार प्रयास करें, फिर अनुकूलतम" की कहानी

कल्पना कीजिए कि आप एक रोबोट शेफ हैं जो माइक्रोवेव खोलने की कोशिश कर रहे हैं। पहली बार जब आप इसके पास जाते हैं, तो आपको नहीं पता कि लैच फंसा हुआ है या मुक्त है। इसलिए, आप सुरक्षित खेलते हैं: आप हाथ बढ़ाते हैं, हैंडल को घुमाने की कोशिश करते हैं, और फिर दरवाजा खींचते हैं। यदि लैच मुक्त था, तो वह घुमाव समय की पूरी बर्बादी थी। यदि वह फंसा हुआ था, तो आपको उसे करना ही था। दोनों ही मामलों में, आपने कुछ सीखा: "इस विशिष्ट माइक्रोवेव को घुमाने की आवश्यकता है।"

अब, कल्पना कीजिए कि आपको एक साल तक हर सुबह वही माइक्रोवेव खोलना है। एक "मूर्ख" रोबोट हर दिन, बस सावधानी के तौर पर, वही ट्विस्ट-एंड-पुल (घुमाओ और खींचो) की दिनचर्या दोहराएगा। यह ऐसा है जैसे आप हर सुबह अपनी जेबों में चाबियों के लिए चेक करते हैं, भले ही आप जानते हों कि आपने उन्हें मेज पर छोड़ा है। यह सुरक्षित है, लेकिन अक्षम है।

इस पेपर के पीछे के शोधकर्ताओं, हाइज़ोउ गे (Haizhou Ge) और उनकी टीम ने पूछा: "रोबोट बार-बार अन्वेषण (re-exploring) क्यों करता है?" उन्होंने महसूस किया कि मौजूदा रोबोट की याददाश्त "सफल कहानियों" के पुस्तकालय की तरह है। वे रोबोट को सफल होने का तरीका याद रखने में मदद करते हैं, लेकिन वे उसे यह याद रखने में मदद नहीं करते कि वह किस वस्तु के सामने है ताकि अनावश्यक चरणों को छोड़ा जा सके।

उनका समाधान इंस्टेंस-ओरिएंटेड मेमोरी (IOM) है। यह तीन चरणों वाली प्रक्रिया है जो रोबोट को एक भूलक्कड़ खोजकर्ता से एक स्मार्ट याद रखने वाले में बदल देती है।

चरण 1: "एक बार प्रयास करें" (अन्वेषण/Exploration)

रोबोट एक नई वस्तु का सामना करता है, मान लीजिए एक माइक्रोवेव जिसमें छिपा हुआ लैच है। उसे अवस्था का पता नहीं है, इसलिए उसे जांच करनी पड़ती है। वह गतिविधियों का एक क्रम आज़माता है। शायद वह विफल होता है, शायद सफल होता है, लेकिन महत्वपूर्ण रूप से, यह रहस्य को उजागर करता है। उसे पता चलता है, "आह, यह लैच फंसा हुआ है, मुझे पहले घुमाना होगा।"

चरण 2: "डी-रिडंडिफाइड" चीट शीट (डिस्टिलेशन/Distillation)

यही जादू है। रोबोट गतिविधियों के उस लंबे, बिखरे हुए क्रम (घुमाना, खींचना, शायद दोबारा कोशिश करना) को लेता है और उसमें से अनावश्यक चीज़ों को हटा देता है। वह महसूस करता है, "ओह, मुझे अब पता है कि यह माइक्रोवेव फंसा हुआ है। मुझे यह जांचने की ज़रूरत नहीं है कि यह मुक्त है या नहीं; मुझे बस घुमाना और खींचना है।" वह एक छोटा, सटीक निर्देश लिखता है: "घुमाएं, फिर खींचें।" वह इस नोट को एक विशेष मेमोरी बुक में सहेजता है, और इसे इस विशिष्ट माइक्रोवेव की तस्वीर के साथ लेबल करता है।

चरण 3: "रिकॉल" (एमोर्टाइजेशन/Amortization)

अगले दिन, रोबोट वही माइक्रोवेव देखता है। यह देखने के बजाय कि क्या लैच फंसा हुआ है, वह अपनी मेमोरी बुक को देखता है। वह माइक्रोवेव को पहचान लेता है, "घुमाएं, फिर खींचें" वाला नोट निकालता है, और सीधे काम पर लग जाता है। वह "चेकिंग" चरण को पूरी तरह से छोड़ देता है।

पेपर इसे "एमोर्टाइजिंग एक्सप्लोरेशन" कहता है। यह एक फिल्म का टिकट एक बार खरीदने और उसके बाद हर दिन बिना नया टिकट खरीदे फिल्म देखने जैसा है। "जानने की लागत" एक बार चुकाई जाती है, और बचत हर बार ली जाती है।

उन्होंने इसका परीक्षण कैसे किया (लैब बनाम वास्तविक दुनिया)

टीम ने केवल इस बारे में बात नहीं की; उन्होंने इसे बनाया और चार अलग-अलग परिदृश्यों में परीक्षण किया:

  1. माइक्रोवेव (कंप्यूटर सिमुलेशन में)
  2. दरवाजा (कंप्यूटर सिमुलेशन में)
  3. बोतल (एक वास्तविक रोबोटिक हाथ पर)
  4. कैबिनेट (एक वास्तविक रोबोटिक हाथ पर)

इन सभी कार्यों में, रोबोट को छिपी हुई अवस्थाओं से निपटना था: क्या दरवाजा लॉक है? क्या बोतल का ढक्कन पहले से ही खुला है? क्या कैबिनेट का लैच लगा हुआ है?

उन्होंने तीन प्रकार के रोबोटों की तुलना की:

  • "रैंडम" रोबोट: इसके पास कोई मेमोरी नहीं है। यह हर बार चीजों को शुरू से खोलने की कोशिश करता है, अक्सर अनावश्यक कदम उठाता है।
  • "ओरेकल" रोबोट: इस रोबोट के पास एक जादुई चीट शीट है जो उत्तर को पूरी तरह से जानती है। यह पूर्ण संभव प्रदर्शन का प्रतिनिधित्व करता है।
  • "VLM" रोबोट: यह मुख्य आकर्षण है। यह एक मानक, ऑफ-द-शेल्फ AI (एक विजन-लैंग्वेज मॉडल) का उपयोग करता है जो पहले प्रयास के वीडियो को देखता है, ट्रिक का पता लगाता है, और नोट लिखता है। इसे इस विशिष्ट कार्य के लिए कोई विशेष प्रशिक्षण नहीं मिला; इसने बस अपनी सामान्य बुद्धि का उपयोग किया।

परिणाम: कम हलचल, अधिक सफलता

संख्याएं काफी प्रभावशाली हैं। जब रोबables को बार-बार इन वस्तुओं को खोलना पड़ा:

  • ओरेकल रोबोट (परफेक्ट वाला) ने सब कुछ फिर से खोजने वाले रोबोट की तुलना में गतिविधियों की संख्या को 16% से 30% तक कम कर दिया।
  • VLM रोबोट (जो मानक AI का उपयोग कर रहा है) उस बचत का 69% से 88% हिस्सा हासिल करने में सफल रहा। दूसरे शब्दों में, एक पूर्व-निर्मित AI टूल का उपयोग करके, रोबोट बिना कुछ नया सीखे एक पूर्ण मेमोरी के लगभग सभी लाभ प्राप्त कर सका।

वास्तविक रोबोटिक हाथ पर, परिणाम सिमुलेशन की तुलना में और भी बेहतर थे। मेमोरी सिस्टम का उपयोग करने वाले रोबोट न केवल समय बचाने में सफल रहे; वे वास्तव में बिना मेमोरी वाले रोबोटों की तुलना में चीजों को खोलने में अधिक सफल रहे।

क्या होगा अगर मेमोरी गलत हो?

मेमोरी सिस्टम के बारे में एक बड़ी चिंता यह है: "क्या होगा अगर रोबोट गलत चीज़ याद रखता है?" क्या होगा अगर उसे लगता है कि माइक्रोवेव फंसा हुआ है, लेकिन वह वास्तव में मुक्त है? यदि रोबोट आँख बंद करके गलत नोट का पालन करता है, तो वह दरवाजे को तोड़ सकता है।

शोधकर्ताओं ने IOM को एक "सॉफ्ट बायस" (soft bias) के रूप में डिज़ाइन किया है। यह कहने का एक फैंसी तरीका है कि मेमोरी एक सुझाव है, आदेश नहीं। रोबोट अभी भी अपने सेंसरों की बात सुनता है। यदि नोट कहता है "घुमाएं," लेकिन दरवाजा आसानी से खुल जाता है, तो रोबोट का फीडबैक लूप सक्रिय हो जाता है और वह घुमाना बंद कर देता है।

उन्होंने लगभग 12% डोर इंस्टेंस पर रोबोट को गलत नोट देकर इसका परीक्षण किया। परिणाम? रोबोट विफल नहीं हुआ। उसने खुद को ठीक करने के लिए बस कुछ अतिरिक्त कदम उठाए। सफलता दर समान रही, जिससे साबित हुआ कि सिस्टम सुरक्षित है। यह एक ऐसे GPS की तरह है जो एक मार्ग का सुझाव देता है, लेकिन यदि आप सड़क अवरोध देखते हैं, तो आप बस मुड़ जाते हैं और चलते रहते हैं।

यह क्यों मायने रखता है

पेपर का तर्क है कि हमें केवल रोबोटों को कार्यों को बेहतर ढंग से करने के लिए ही नहीं, बल्कि विशिष्ट वस्तुओं को बेहतर ढंग से याद रखने के लिए भी सिखाना चाहिए। वर्तमान रोबोट मेमोरी "क्या मैं सफल हुआ?" पर ध्यान केंद्रित करती है, लेकिन यह नया सिस्टम "यह वस्तु क्या है, और मैं इसके साथ कैसे व्यवहार करूँ?" पर ध्यान केंद्रित करता है।

हर वस्तु को उसके अपने इतिहास वाले एक अद्वितीय व्यक्ति के रूप में मानकर, रोबोट उन चीजों को "प्रोब" (जांचने) में ऊर्जा बर्बाद करना बंद कर देता है जिन्हें वह पहले से जानता है। लेखकों ने पाया कि यह दृष्टिकोण कंप्यूटर सिमुलेशन और वास्तविक, भौतिक रोबोटों दोनों में काम करता है। उन्होंने यह भी नोट किया कि कुछ कठिन वस्तुओं के लिए, जैसे कि एक बोतल जहाँ ढक्कन लगा होने या न होने पर लगभग एक जैसा दिखता है, रोबोट अंतर को "देख" नहीं सकता है। लेकिन पहली बातचीत से अवस्था को याद रखकर, वह दृश्य अनुमान (visual guesswork) को पूरी तरह से छोड़ सकता है।

संक्षेप में, यह पेपर दिखाता है कि रोबोट एक सरल, ऑब्जेक्ट-विशिष्ट डायरी रखकर कुशल बनना सीख सकते हैं। वे एक बार प्रयास करते हैं, ट्रिक लिख देते हैं, और फिर अपने बाकी जीवन में आसानी से काम करते हैं। और सबसे अच्छी बात? वे यह सब मौजूदा उपकरणों का उपयोग करके कर सकते हैं, बिना हर काम के लिए एक नया दिमाग बनाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →