← नवीनतम पेपर
🤖 machine learning

RECALL: Recovery Experience Collection for Active Lifelong Learning in Vision-Language-Action Models

यह शोध पत्र विज़न-लैंग्वेज-एक्शन मॉडल्स के लिए एक सक्रिय, अनिश्चितता-निर्देशित निरंतर शिक्षण प्रतिमान (continual learning paradigm) प्रस्तावित करता है जो लक्षित रिकवरी प्रदर्शनों (recovery demonstrations) के माध्यम से अनुकूलन दक्षता में सुधार करता है, जबकि ऐसे डेटा को एकीकृत करने पर प्लास्टिसिटी और कैटास्ट्रोफिक फॉरगेटिंग के बीच के ट्रेडऑफ़ का अनुभवजन्य विश्लेषण करता है।

मूल लेखक: Ulas Berk Karli, Tesca Fitzgerald

प्रकाशित 2026-06-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ulas Berk Karli, Tesca Fitzgerald

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही स्मार्ट रोबोट सहायक है जिसने पहले से ही कई काम करना सीख लिया है, जैसे कपड़े तह करना या मेज सजाना। यह रोबोट एक "विज़न-लैंग्वेज-एक्शन" (VLA) मॉडल है—यह दुनिया को देखता है, आपकी आवाज़ के निर्देशों को समझता है, और काम पूरा करने के लिए अपने हाथों को चलाता है।

हालाँकि, जब आप इस रोबोट को किसी नए कमरे में रखते हैं या इसे थोड़ा अलग काम देते हैं, तो यह कभी-कभी लड़खड़ा जाता है। इसे ठीक करने का पुराना तरीका पैसिव लर्निंग (Passive Learning) था: आप तब तक इंतज़ार करते थे जब तक रोबोट विफल न हो जाए, फिर एक इंसान बीच में आता था, उसे शुरू से पूरा काम दिखाता था, और उम्मीद करता था कि इससे मदद मिलेगी।

यह पेपर एक स्मार्ट तरीके का प्रस्ताव देता है जिसे एक्टिव लर्निंग (Active Learning) कहा जाता है, और फिर यह एक कठिन समस्या को हल करता है जो इसके साथ आती है। यहाँ सरल उपमाओं (analogies) का उपयोग करके इसका विवरण दिया गया है:

1. "पुराने तरीके" के साथ समस्या (पैसिव लर्निंग)

कल्पना कीजिए कि आप एक छात्र को गाड़ी चलाना सिखा रहे हैं।

  • पैसिव तरीका: आप छात्र को तब तक गाड़ी चलाने देते हैं जब तक कि वह लगभग दुर्घटनाग्रस्त न हो जाए। फिर आप उसे रोकते हैं, स्टीयरिंग संभालते हैं, और शुरुआत से लेकर अंत तक का पूरा रास्ता खुद चलाते हैं, भले ही उसे पता हो कि वह पहला आधा हिस्सा बखूबी जानता था।
  • बर्बादी: यह अक्षम है। छात्र उन चीजों को दोबारा सीखने में समय बर्बाद करता है जो वह पहले से जानता है, और आपको मदद केवल तभी मिलती है जब कोई गलती होती है, जो कि खतरनाक है।

2. नया विचार: "अनसर्टेन्टी-गाइडेड" (अनिश्चितता-निर्देशित) एक्टिव लर्निंग

लेखक एक बेहतर दृष्टिकोण का सुझाव देते हैं जिसमें एक "हेल्प डिटेक्टर" (एक टूल जिसे INSIGHT कहा जाता है) का उपयोग किया जाता है।

  • उपमा: कल्पना कीजिए कि छात्र के पास एक 'पैनिक बटन' है। वह इसे केवल तभी दबाता है जब वह अनिश्चित महसूस करता है या कोई गलती करने वाला होता है।
  • समाधान: जब रोबोट "अनिश्चित" (जैसे कि एक छात्र जिसे नहीं पता कि अगला मोड़ क्या है) महसूस करता है, तो वह रुक जाता है। फिर एक इंसान केवल उसी विशिष्ट क्षण में आता है ताकि रोबोट को यह दिखा सके कि कैसे सुधार करना है और कार्य को पूरा करना है।
  • परिणाम: पेपर ने पाया कि यह बहुत अधिक कुशल है। केवल तब डेटा एकत्र करके जब रोबोट भ्रमित होता है, रोबोट हर कार्य को शुरू से रैंडम तरीके से डेटा एकत्र करने की तुलना में तेज़ी से और बेहतर सीखता है।

3. बड़ा जाल: "कैटास्ट्रोफिक फॉरगेटिंग" (Catastrophic Forgetting - विनाशकारी विस्मृति)

यहाँ एक मोड़ है। जब रोबोट केवल इन "पैनिक बटन" वाले क्षणों (रिकवरी डेटा) से सीखता है, तो वह गलतियों को सुधारने में बहुत अच्छा हो जाता है, लेकिन वह उन आसान हिस्सों को भूलने लगता है जिन्हें वह पहले से जानता था।

  • उपमा: यह एक ऐसे छात्र की तरह है जो अभ्यास टेस्ट पर केवल सबसे कठिन सवालों की पढ़ाई करता है। वे कठिन समस्याओं को हल करने में तो माहिर हो जाते हैं, लेकिन जब वे वास्तविक परीक्षा देते हैं, तो वे उन आसान सवालों के जवाब देना भूल जाते हैं जिन्हें वे हर बार सही करते थे।
  • पेपर का निष्कर्ष: यदि आप रोबोट को केवल "रिकवरी" डेटा पर प्रशिक्षित करते हैं, तो वह अपने पुराने कौशल भूल जाता है। इसे कैटास्ट्रोफिक फॉरगेटिंग कहा जाता है।

4. समाधान: पुराने कौशल को कैसे बनाए रखें

लेखकों ने भूलने की इस समस्या को ठीक करने के लिए कई तरीकों का परीक्षण किया ताकि रोबोट पुराने कौशल खोए बिना नए करतब सीख सके।

  • समाधान A: "लो लर्निंग रेट" (छोटे कदम उठाना)

    • उपमा: एक भारी वर्कआउट के बजाय जो आपकी मांसपेशियों को नाटकीय रूप से बदल देता है, आप हल्की स्ट्रेचिंग करते हैं। यह आपके वर्तमान आकार को खोए बिना अनुकूलित होने में मदद करता है।
    • परिणाम: यह थोड़ी मदद करता है, लेकिन रोबोट अभी भी नए करतब बहुत अच्छी तरह से नहीं सीख पाता है।
  • समाधान B: "इलास्टिक वेट कंसोलिडेशन" (इलास्टिक बैंड)

    • उपमा: कल्पना कीजिए कि रोबोट के मस्तिष्क में उसके पुराने ज्ञान को थामे रखने के लिए इलास्टिक बैंड लगे हैं। जब वह कुछ नया सीखने की कोशिश करता है, तो बैंड पीछे की ओर खींचते हैं यदि वह पुराने हिस्से को बहुत अधिक बदलने की कोशिश करता है।
    • परिणाम: यह पुराने कौशल को सुरक्षित रखता है, लेकिन यह रोबोट के लिए नए रिकवरी कौशल सीखना भी कठिन बना देता है। यह एक ट्रेड-ऑफ है: बहुत अधिक सुरक्षा, तो आप सीखते नहीं; बहुत कम सुरक्षा, तो आप भूल जाते हैं।
  • समाधान C: "रिप्ले" (सबसे अच्छा समाधान)

    • उपमा: यह एक छात्र की तरह है जो एक टेस्ट के लिए तैयारी कर रहा है, जिसमें वह नए कठिन सवालों को कुछ पुराने आसान सवालों के साथ मिला देता है जो वह पहले से जानता है।
    • परिणाम: इसने सबसे अच्छा काम किया। नए "रिकवरी" डेटा और रोबोट के पुराने "सफल" डेटा के मिश्रण को दिखाकर, इसने रोबोट को पुराने कौशल को भूले बिना नए करतब सिखाए।

5. एक आश्चर्यजनक खोज: "ऑनलाइन" बनाम "ऑफलाइन"

लेखकों ने यह भी पूछा: क्या हमें रोबोट के अनिश्चित होने के हर पल को रिकॉर्ड करने की आवश्यकता है, या केवल पहली बार जब वह फंस जाता है?

  • निष्कर्ष: आपको केवल पहली बार रिकॉर्ड करने की आवश्यकता है जब रोबोट फंस जाता है।
  • उपमा: यदि एक छात्र भूलभुलैया के पहले मोड़ पर रास्ता भटक जाता है, तो उसे उस एक मोड़ को ठीक करने का तरीका दिखाना ही उसे बाकी भूलभुलैया के माध्यम से ले जाने के लिए पर्याप्त है। आपको उस पहले गलती के बाद होने वाली हर गलत मोड़ को रिकॉर्ड करने की आवश्यकता नहीं है। यह मानवीय प्रयास की भारी बचत करता है।

पेपर के मुख्य बिंदुओं का सारांश

  1. डेटा के बारे में स्मार्ट बनें: डेटा को रैंडम तरीके से एकत्र न करें। इसे केवल तभी एकत्र करें जब रोबोट भ्रमित हो (अनिश्चित हो)। यह अधिक कुशल है।
  2. बुनियादी बातों को न भूलें: यदि आप केवल "फिक्स" (सुधार) पर प्रशिक्षण देते हैं, तो रोबोट आसान चीजें करना भूल जाता है।
  3. मिश्रण करें: रोबोट को सिखाने का सबसे अच्छा तरीका नए "फिक्स" डेटा को उसके कुछ पुराने "सफलता" डेटा के साथ मिलाना है (रिप्ले)।
  4. जल्दी रुकें: आपको केवल भ्रम के पहले क्षण से डेटा एकत्र करने की आवश्यकता है, उसके बाद के हर क्षण से नहीं।

मुख्य बात: निरंतर सीखने के लिए रोबोट बनाने के लिए, हमें उन्हें तब मदद माँगने देना होगा जब वे भ्रमित हों, लेकिन हमें उन्हें यह भी याद दिलाना होगा कि वे पहले से क्या जानते हैं जबकि वे नए चीजें सीख रहे होते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →