← नवीनतम पेपर
🤖 AI

Self-adapting Robotic Agents through Online Continual Reinforcement Learning with World Model Feedback

यह शोध पत्र ऑनलाइन निरंतर सुदृढीकरण शिक्षण (Continual Reinforcement Learning) के लिए एक जैविक रूप से प्रेरित ढांचे का प्रस्ताव करता है जो पर्यावरणीय परिवर्तनों का स्वतः पता लगाने और रोबोटिक एजेंटों में स्व-अनुकूलनशील फाइनट्यूनिंग को ट्रिगर करने के लिए वर्ल्ड मॉडल प्रेडिक्शन रेसिडुअल्स (world model prediction residuals) का लाभ उठाता है, जिससे वे बाहरी पर्यवेक्षण के बिना तैनाती के दौरान अपने प्रदर्शन में सुधार करने में सक्षम होते हैं।

मूल लेखक: Fabian Domberg, Georg Schildbach

प्रकाशित 2026-03-05
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Fabian Domberg, Georg Schildbach

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक बहुत ही स्मार्ट रोबोट कुत्ता खरीदा है। आप इसे एक परफेक्ट, वर्चुअल वीडियो गेम की दुनिया में चलने, दौड़ने और कूदने के लिए प्रशिक्षित करते हैं। आप उसे वह सब कुछ सिखाते हैं जो उसे जानने की आवश्यकता है, और वह एक चैंपियन बन जाता है। फिर, आप उसे वास्तविक दुनिया में ले जाते हैं।

अचानक, रोबोट का पैर थोड़ा सख्त हो जाता है, या फर्श फिसलन भरा हो जाता है, या हवा उम्मीद से अधिक तेज चल रही होती है। वास्तविक दुनिया में, चीजें बदल जाती हैं। लेकिन आज के अधिकांश रोबोट उस छात्र की तरह हैं जिसने एक पाठ्यपुस्तक रट ली है लेकिन जैसे ही शिक्षक ऐसा प्रश्न पूछता है जो किताब में नहीं था, वह असफल हो जाता है। वे जम जाते हैं, लड़खड़ाते हैं, या टकरा जाते हैं क्योंकि उनका "मस्तिष्क" पुराने, स्थिर नियमों में फंसा हुआ होता है।

यह शोध पत्र रोबोट को सिखाने का एक नया तरीका पेश करता है ताकि वे काम के दौरान ही सीख सकें, ठीक वैसे ही जैसे एक इंसान या कुत्ता करता है।

मुख्य विचार: रोबोट की "कल्पना"

शोधकर्ताओं ने अपना सिस्टम एक चतुर अवधारणा पर बनाया है जिसे वर्ल्ड मॉडल (World Model) कहा जाता है। इसे रोबोट की आंतरिक कल्पना के रूप में समझें।

  1. द ड्रीमर (सपना देखने वाला): रोबोट के हिलने-डुलने से पहले ही, वह "सपना" देखता है कि यदि वह कोई निश्चित क्रिया करता है तो क्या होगा। वह भविष्यवाणी करता है: "यदि मैं आगे कदम बढ़ाता हूँ, तो मेरा पैर यहाँ पड़ेगा, और मुझे इतना इनाम महसूस होगा।"
  2. द रियलिटी चेक (वास्तविकता की जाँच): रोबोट फिर वास्तव में एक कदम उठाता है।
  3. द सरप्राइज मीटर (आश्चर्य का पैमाना): सिस्टम सपना (जो उसने भविष्यवाणी की थी) और वास्तविकता (जो वास्तव में हुआ) के बीच तुलना करता है।
    • यदि वे मेल खाते हैं: सब कुछ सामान्य है। रोबोट जो कर रहा है, वही करता रहता है।
    • यदि वे मेल नहीं खाते: रोबोट को एक "आश्चर्य" (सरप्राइज) होता है। उसे एहसास होता है, "रुको, मेरा पैर वहां नहीं पड़ा जहां मैंने सोचा था! कुछ बदल गया है!"

इस शोध पत्र में, इस "आश्चर्य" को प्रेडिक्शन रेसिडुअल्स (prediction residuals) द्वारा मापा जाता है। इसे कार के "चेक इंजन" लाइट की तरह समझें। यदि इंजन सुचारू रूप से चल रहा है, तो लाइट बंद रहती है। यदि इंजन अजीब आवाज करने लगता है (कंप्यूटर जो उम्मीद करता है और जो वह सुनता है, उसके बीच बड़ा अंतर), तो लाइट जल जाती है।

यह कैसे काम करता है: स्वयं को ठीक करने वाला रोबोट

जब रोबोट की "चेक इंजन" लाइट जलती है, तो वह केवल रुक नहीं जाता। वह एडेप्टेशन मोड (अनुकूलन मोड) में चला जाता है।

  • ट्रिगर (प्रेरणा): रोबोट पता लगाता है कि उसकी भविष्यवाणियां गलत हैं (शायद कोई जोड़ टूट गया है, या जमीन बर्फीली है)।
  • फिक्स (सुधार): वह अभी भी चलते रहने के दौरान ही अपने मस्तिष्क को फिर से प्रशिक्षित करना शुरू कर देता है। वह अभी जो नया, अजीब डेटा एकत्र कर रहा है, उसका उपयोग अपने "वर्ल्ड मॉडल" और अपनी "पॉलिसी" (निर्णय लेने के नियम) को अपडेट करने के लिए करता है।
  • लक्ष्य: वह खुद को तब तक ट्यून करता रहता है जब तक कि "आश्चर्य" खत्म न हो जाए और उसकी भविष्यवाणियां वास्तविकता से मेल न खाने लगें।

शोध पत्र तीन अलग-अलग परिदृश्यों में इसे काम करते हुए दिखाता है:

  1. एक डिजिटल वॉकर: एक सिमुलेशन में एक स्टिक-फिगर रोबोट जिसके पैर अचानक टूट गए हैं। वह लड़खड़ाता है, त्रुटि का एहसास करता है, और फिर लंगड़ाते हुए फिर से चलना सीखता है, अंततः एक नया स्थिर तरीका खोज लेता है।
  2. एक रोबोट कुत्ता (ANYmal): एक सिमुलेशन में एक चार पैरों वाला रोबोट जहाँ एक पैर की मोटर कमजोर हो गई है। वह लड़खड़ाता है, भ्रमित होता है, लेकिन फिर तीन मजबूत और एक कमजोर पैर के साथ संतुलन बनाना सीख जाता है।
  3. एक असली कार: एक प्रयोगशाला में चलाई जाने वाली एक छोटी रिमोट-कंट्रोल कार। पहले, यह कंप्यूटर सिमुलेशन से वास्तविक दुनिया में जाती है (एक बड़ा झटका!)। यह कुछ बार टकराती है, लेकिन फिर सुचारू रूप से चलाना सीख जाती है। बाद में, शोधकर्ता इसके पिछले पहियों पर मोजे पहना देते हैं ताकि वे फिसलन भरे हो जाएं। कार फिसलती है, महसूस करती है कि घर्षण (friction) बदल गया है, और बिना फिसले सुरक्षित रूप से चलाने के लिए धीमी हो जाती है।

इसे कैसे पता चलता है कि कब रुकना है?

आप पूछ सकते हैं, "रोबोट को कैसे पता चलता है कि उसकी सीख पूरी हो गई है? क्या वह बस हमेशा के लिए ट्यूनिंग करता रहता है?"

शोधकर्ताओं ने रोबोट को आंतरिक मॉनिटर का एक सेट दिया है। यह एक छात्र की तरह है जो परीक्षा दे रहा है और अपने उत्तरों की स्वयं जांच कर रहा है। रोबोट देखता है कि:

  • क्या "आश्चर्य" कम हो रहा है? (क्या मेरी भविष्यवाणियां बेहतर हो रही हैं?)
  • क्या प्रदर्शन स्थिर हो रहा है? (क्या मैं फिर से स्थिरता से चल रहा हूँ?)
  • क्या आंतरिक गणितीय संकेत शांत हैं? (क्या सीखने की प्रक्रिया स्थिर हो रही है?)

एक बार जब ये सभी संकेत कहते हैं, "हाँ, हम फिर से स्थिर हैं," तो रोबोट गहन पुन: प्रशिक्षण को रोक देता है और वापस अपना काम कुशलतापूर्वक करने में लग जाता है।

यह क्यों महत्वपूर्ण है

यह एक बहुत बड़ा कदम है क्योंकि यह रोबोट को स्थिर (static) (फिक्स्ड प्रोग्राम) से गतिशील (dynamic) (स्वयं सुधारने वाले) में बदल देता है।

  • पुराना तरीका: यदि कोई रोबोट टूट जाता है, तो किसी इंसान को आकर उसे ठीक करना पड़ता है या पुन: प्रोग्राम करना पड़ता है।
  • नया तरीका: रोबोट नोटिस करता है कि वह टूट गया है, चलने का एक नया तरीका ढूंढता है, और काम करना जारी रखता है।

सावधानी (सुरक्षा)

शोध पत्र जोखिमों के बारे में ईमानदार है। सीखने के लिए, रोबोट को ऐसी चीजें आज़मानी पड़ती हैं जो विफल हो सकती हैं। वीडियो गेम में, विफल होना ठीक है। वास्तविक दुनिया में, यदि कोई रोबोट नाजुक फूलदान ले जा रहा है या लोगों के पास गाड़ी चला रहा है, तो "कोशिश करना और विफल होना" खतरनाक हो सकता है।

लेखक सुझाव देते हैं कि भविष्य में, हमें इसे "सुरक्षा गार्डों" (जैसे एक मानव पर्यवेक्षक या सख्त नियम) के साथ जोड़ने की आवश्यकता हो सकती है ताकि रोबोट दुर्घटनाओं का कारण बने बिना सीख सके।

निष्कर्ष

यह शोध रोबोट को जिज्ञासु और लचीला बनाने जैसा है। एक कठोर मशीन होने के बजाय जो दुनिया बदलने पर टूट जाती है, यह एक लचीला एजेंट बन जाता है जो कहता है, "हम्म, यह वैसा नहीं हुआ जैसा सोचा था। मुझे अपने मस्तिष्क को एडजस्ट करने दें और फिर से प्रयास करने दें।" यह उन रोबोटों की ओर एक बड़ा कदम है जो वास्तव में हमारी अप्रत्याशित, अव्यवस्थित, वास्तविक दुनिया में हमारे साथ रह और काम कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →