← नवीनतम पेपर
💻 computer science

Remember what you did?: Learning Behavioral Memories for Partially Observable Object Manipulation

यह शोध पत्र कंप्रेस्ड एक्शन मेमोरी पॉलिसी (CAMP) को प्रस्तुत करता है, जो एक नवीन दृष्टिकोण है जो रोबोटों को आंशिक दृश्यता (partial observability) के तहत अपने स्वयं के एक्शन इतिहास के स्व-पर्यवेक्षित, संकुचित प्रतिनिधित्व (compressed representation) को सीखकर प्रगति को स्पष्ट रूप से ट्रैक करने और बाहरी पर्यवेक्षण के बिना विफलताओं से उबरने में सक्षम बनाता है, जिससे वे लंबी अवधि के, संपर्क-समृद्ध हेरफेर कार्यों में महारत हासिल कर सकते हैं।

मूल लेखक: Kuancheng Wang, Seungho Yeom, Jinglin Cao, Yuheng Zhi, Nikhil Shinde, Michael Yip

प्रकाशित 2026-06-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kuancheng Wang, Seungho Yeom, Jinglin Cao, Yuheng Zhi, Nikhil Shinde, Michael Yip

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Remember what you did?: Learning Behavioral Memories for Partially Observable Object Manipulation" पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ हिंदी अनुवाद दिया गया है।

बड़ी समस्या: भूलने की बीमारी वाला रोबोट

कल्पना कीजिए कि आप एक पहेली सुलझाने की कोशिश कर रहे हैं, लेकिन हर बार जब आप कोई चाल चलते हैं, तो कोई एक सेकंड के लिए आपकी आँखों पर हाथ रख देता है। जब आप आँखें खोलते हैं, तो आप पहेली को देखते हैं, लेकिन आपको यह याद नहीं रहता कि आप वहाँ कैसे पहुँचे। क्या आपने अभी उस टुकड़े को बाईं ओर धकेलने की कोशिश की थी और असफल रहे? क्या आपने पहले ही उस टुकड़े को दाईं ओर खिसका दिया था?

यह वही समस्या है जिसका सामना "कॉन्टैक्ट-रिच" कार्यों (ऐसे कार्य जहाँ उन्हें चीजों को धकेलना, खिसकाना या छूना पड़ता है) में रोबोट करते हैं। एक रोबोट का कैमरा वर्तमान तस्वीर देखता है, लेकिन उसे यह नहीं पता होता कि उसने अभी-अभी क्या करने की कोशिश की थी (इतिहास/History)।

  • परिणाम: रोबोट भ्रमित हो जाता है। वह एक ब्लॉक को दीवार की ओर धकेल सकता है, महसूस कर सकता है कि वह फंस गया है, और फिर उसे फिर से दीवार की ओर धकेलेगा क्योंकि वह भूल गया कि उसने पहले ही ऐसा कर लिया था। उसे "भूलने की बीमारी" (Amnesia) हो गई है।

समाधान: CAMP (रोबोट की "मानसिक नोटबुक")

लेखकों ने CAMP (कंप्रेस्ड एक्शन मेमोरी पॉलिसी) नामक एक नई प्रणाली बनाई है। CAMP को एक ऐसे रोबोट के रूप में न सोचें जो बेहतर देख सकता है, बल्कि एक ऐसे रोबोट के रूप में सोचें जो बेहतर याद रख सकता है।

हर एक पिछले पिक्सेल को याद रखने की कोशिश करने के बजाय (जो बहुत अधिक डेटा है), CAMP अपने स्वयं के कार्यों की एक "मानसिक नोटबुक" रखता है। वह खुद से पूछता है: "मैंने अभी क्या करने की कोशिश की थी?"

यह कैसे काम करता है, इसे सरल चरणों में यहाँ दिया गया है:

1. "कंप्रेस्ड" मेमोरी (सारांश)

यदि आप अपने पूरे दिन में की गई हर एक हरकत को लिखने की कोशिश करते, तो आपकी नोटबुक बहुत बड़ी और अस्त-व्यस्त होती। CAMP इस मामले में स्मार्ट है। यह अपने पिछले कार्यों का एक सारांश लिखने के लिए एक गणितीय ट्रिक (जिसे DCT कहा जाता है) का उपयोग करता है।

  • उपमा: कल्पना कीजिए कि आप अपने दोस्त को एक फिल्म का वर्णन कर रहे हैं। आप उसके हर फ्रेम की सूची नहीं बनाते; आप कहते हैं, "पहले, नायक बाईं ओर भागा, फिर वह बाड़ के ऊपर से कूदा, फिर वह गिर गया।" आप कहानी के आकार को बनाए रखते हैं लेकिन छोटी-छोटी बारीकियों को हटा देते हैं।
  • यह क्यों मदद करता है: यह सारांश इतना छोटा है कि रोबोट के "दिमाग" में समा सके, लेकिन इतना विस्तृत है कि उसे बता सके, "हे, तुमने पहले ही उस ब्लॉक को बाईं ओर धकेलने की कोशिश की थी, इसलिए इसे दोबारा मत करो।"

2. प्रशिक्षण (गलतियों से सीखना)

CAMP को "सेल्फ-सुपरवाइज्ड" (स्व-पर्यवेक्षित) तरीके से प्रशिक्षित किया जाता है। इसका मतलब है कि रोबोट किसी मानव शिक्षक द्वारा बताए जाने के बजाय अपने स्वयं के अतीत को देखकर सीखता है।

  • खेल: रोबोट को एक वीडियो दिखाया जाता है जिसमें एक इंसान कोई कार्य कर रहा है। वह वर्तमान तस्वीर के आधार पर यह अनुमान लगाने की कोशिश करता है कि इंसान के पिछले कार्य क्या थे।
  • सबक: यदि रोबट गलत अनुमान लगाता है, तो वह सीखता है। समय के साथ, वह वर्तमान दृश्य को देखकर यह कहने में बहुत कुशल हो जाता है, "आह, जहाँ चीज़ें अब हैं, उसके आधार पर, मैंने पहले इस ब्लॉक को यहाँ धकेलने की कोशिश की होगी।"

3. "दो-चरणीय" प्रशिक्षण (वार्म-अप फिर फाइन-ट्यून)

पेपर ने पाया कि इसे सिखाने का एक विशिष्ट तरीका सबसे अच्छा काम करता है:

  1. वार्म-अप (Warm-up): पहले, रोबोट केवल पिछले कार्यों को याद करने का अभ्यास करता है। यह एक मजबूत मेमोरी बैंक बनाता है।
  2. फ्रीज और लर्न (Freeze & Learn): फिर, वे उस मेमोरी को लॉक कर देते हैं ताकि वह भ्रमित न हो।
  3. फाइन-ट्यून (Fine-tune): अंत में, वे रोबोट को उस मेमोरी का उपयोग करके वास्तव में अपना हाथ चलाने के लिए सीखते हैं।
  • उपमा: यह एक छात्र की तरह है जो पहले खेल के नियमों को रटता है (वार्म-अप), फिर बिना नियम बदले खेल का अभ्यास करता है (फ्रीज), और अंत में रणनीतिक रूप से खेलना सीखता है (फाइन-ट्यून)। यदि आप नियम सीखने और खेल खेलने की कोशिश एक साथ करते हैं, तो आप भ्रमित हो जाते हैं और नियम भूल जाते हैं।

परिणाम: 0% से 70% तक

शोधकर्ताओं ने रोबोट द्वारा कठिन कार्य करने पर इसका परीक्षण किया, जैसे कि एक "T" आकार के ब्लॉक को तीन अलग-अलग जगहों पर धकेलना बिना एक ही जगह को दोबारा छुए, या छिपे हुए बटन को ढूँढना।

  • बिना मेमोरी के (पुराने रोबोट): वे लगभग सब कुछ करने में विफल रहे। वे ब्लॉक को धकेलते, फंस जाते, और फिर से वही करते, जिससे वे एक चक्र में घूमते रहते। सफलता दर: 0%।
  • CAMP के साथ: रोबोट को याद आया, "मैंने पहले ही बाईं ओर वाली जगह आज़मा ली थी, यह काम नहीं किया। अब मैं बीच वाली जगह आज़माऊँगा।" सफलता दर: सिमुलेशन में 94% तक और वास्तविक रोबोट पर 70%।

यह क्यों महत्वपूर्ण है

अधिकांश रोबोट "विज़न-लैंग्वेज-एक्शन" मॉडल पर निर्भर करते हैं, जो एक इंसान से पूछने जैसा है, "याद रखना कि लाल ब्लॉक को धकेलना है।" लेकिन आपको उन्हें हर बार ठीक से बताना पड़ता है कि क्या याद रखना है।

CAMP अलग है। यह रोबोट को अपने आप याद रखने के लिए सिखाता है। यह सीखता है कि उसके अपने आंदोलनों का इतिहास ही पहेली सुलझाने के लिए सबसे महत्वपूर्ण सुराग है। यह एक "पार्शियली ऑब्जर्वेबल" (आंशिक रूप से दृश्य) समस्या को (जहाँ आप पूरी तस्वीर नहीं देख सकते) मेमोरी के माध्यम से खाली जगहों को भरकर एक "स्पष्ट" समस्या में बदल देता है।

सारांश

  • समस्या: रोबोट भूल जाते हैं कि उन्होंने अभी क्या करने की कोशिश की थी, इसलिए वे गलतियाँ दोहराते हैं।
  • समाधान: CAMP रोबोट को उसके पिछले कार्यों की "कंप्रेस्ड मेमोरी" देता है।
  • जादू: इसे यह बताने की ज़रूरत नहीं है कि क्या याद रखना है; यह अपने अतीत को फिर से बनाने की कोशिश करके याद रखना सीखता है।
  • परिणाम: रोबोट आखिरकार जटिल, बहु-चरणीय पहेलियाँ हल कर सकते हैं जहाँ उन्हें विफलता से सीखना होता है, ठीक वैसे ही जैसे एक इंसान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →