← नवीनतम पेपर
🤖 AI

Regularized Latent Dynamics Prediction is a Strong Baseline For Behavioral Foundation Models

यह शोध पत्र रेगुलराइज्ड लेटेंट डायनेमिक्स प्रेडिक्शन (RLDP) का प्रस्ताव करता है, जो एक ऐसी विधि है जो लेटेंट डायनेमिक्स प्रेडिक्शन में सरल ऑर्थोगोनैलिटी रेगुलराइजेशन जोड़कर बिहेवियरल फाउंडेशन मॉडल्स में ज़ीरो-शॉट रीइन्फोर्समेंट लर्निंग को बेहतर बनाती है, जिससे फीचर विविधता बनी रहती है और यह विशेष रूप से लो-कवरेज परिदृश्यों में जटिल अत्याधुनिक दृष्टिकोणों से बेहतर प्रदर्शन करती है।

मूल लेखक: Pranaya Jajoo, Harshit Sikchi, Siddhant Agarwal, Amy Zhang, Scott Niekum, Martha White

प्रकाशित 2026-03-18
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Pranaya Jajoo, Harshit Sikchi, Siddhant Agarwal, Amy Zhang, Scott Niekum, Martha White

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को वह सब कुछ करने के लिए सिखाने की कोशिश कर रहे हैं जो एक इंसान कर सकता है: चलना, दौड़ना, नाचना, या किराने का सामान ढोना। समस्या यह है कि आप हर उस कार्य के लिए एक विशिष्ट निर्देश पुस्तिका नहीं लिख सकते जिसका सामना भविष्य में रोबोट कर सकता है। यहीं पर बिहेवियरल फाउंडेशन मॉडल्स (BFMs) काम आते हैं।

एक BFM को एक सार्वभौमिक "मसल मेमोरी" लाइब्रेरी के रूप में सोचें। एक समय में एक विशिष्ट कौशल सीखने के बजाय, रोबलेट एक "प्री-ट्रेनिंग" चरण के दौरान दुनिया कैसे काम करती है, इसकी एक सामान्य समझ सीखता है। बाद में, जब आप इसे एक नया लक्ष्य देते हैं (जैसे "रसोई में जाओ"), तो यह बिना सब कुछ फिर से सीखे तुरंत समझ जाता है कि उसे कैसे हिलना-डुलना है।

हालाँकि, इसमें एक पेंच है। इस लाइब्रेरी को बनाने के लिए, रोबोट को दुनिया को "देखने" और समझने का एक अच्छा तरीका चाहिए। यदि वह दुनिया को एक धुंधले, विकृत लेंस के माध्यम से देखता है, तो वह नए कार्यों में विफल हो जाएगा।

समस्या: "धुंधला लेंस" और "स्टिकी नोट"

रोबोट को यह सामान्य समझ सिखाने के वर्तमान तरीके एक विशाल, जटिल गणितीय पहेली को आंखों पर पट्टी बांधकर हल करने की तरह हैं। वे हर उस संभावित पथ का अनुकरण (सिमुलेशन) करके भविष्य की भविष्यवाणी करने की कोशिश करते हैं जो एक रोबोट ले सकता है।

  • समस्या: ये तरीके गणनात्मक रूप से भारी (computationally heavy) हैं और त्रुटियों के प्रति संवेदनशील हैं। यदि रोबोट उस पथ की कल्पना करने की कोशिश करता है जो उसने पहले नहीं देखा है, तो सिमुलेशन गड़बड़ा जाता है, और "लेंस" (प्रतिनिधित्व/representation) विकृत हो जाता है।
  • पतन (The Collapse): एक सरल तरीका इसमें शामिल है कि केवल यह अनुमान लगाया जाए कि "यदि मैं क्रिया X करता हूँ, तो आगे क्या होता है?" लेकिन शोध में पाया गया कि यदि आप केवल ऐसा ही करते हैं, तो रोबलेट का मस्तिष्क आलसी होने लगता है। यह सोचने लगता है कि हर स्थिति एक जैसी ही दिखती है। यह ऐसा है जैसे एक छात्र जो पढ़ाई करना छोड़ देता है और तय करता है कि "सारा इतिहास बस तारीखों का एक धुंधला सा मिश्रण है।" रोबोट चलने और दौड़ने के बीच अंतर करने की क्षमता खो देता है क्योंकि उसका आंतरिक मानचित्र एक एकल, बेकार बिंदु में सिमट जाता है।

समाधान: RLDP (रेगुलराइज्ड लेटेंट डायनेमिक्स प्रेडिक्शन)

लेखक एक नया, सरल तरीका प्रस्तावित करते हैं जिसे RLDP कहा जाता है। वे "आलसी मस्तिष्क" की समस्या को ठीक करने के लिए एक चतुर उपमा का उपयोग करते हैं।

उपमा: जिम्नास्ट और स्ट्रेचिंग मैट

कल्पना कीजिए कि रोबोट का दुनिया का आंतरिक मानचित्र एक जिम्नास्ट है जो एक रूटीन सीखने की कोशिश कर रहा है।

  1. पुराना तरीका (जटिल विधियाँ): कोच जिम्नास्ट को हर उस संभावित रूटीन का वीडियो दिखाकर सिखाने की कोशिश करता है जो वह कभी कर सकता है, और प्रत्येक के लिए सटीक स्कोर की गणना करता है। यह थकाऊ, भ्रमित करने वाला है, और यदि वीडियो में कोई गड़बड़ी आती है, तो जिम्नास्ट भ्रमित हो जाता है।
  2. सरल तरीका (लेटेंट डायनेमिक्स): कोच बस कहता है, "यदि तुम यहाँ कूदते हो, तो तुम वहाँ उतरते हो।" यह समझने में आसान है।
  3. सरल तरीके के साथ समस्या: जिम्नास्ट ऊब जाता है। वह बार-बार एक ही तरह की हरकत करने लगता है क्योंकि यह एक "अच्छा" स्कोर पाने का सबसे आसान तरीका है। वह स्ट्रेचिंग करना बंद कर देता है, और उसकी मांसपेशियां (फीचर्स) एक जैसी दिखने लगती हैं। वह अब स्प्लिट (split) नहीं कर सकता क्योंकि वह स्ट्रेच करना भूल गया है।
  4. RLDP समाधान (ऑर्थोगोनैलिटी रेगुलराइज़र): कोच एक सरल नियम जोड़ता है: "तुम्हें खिंचाव बनाए रखना होगा (Stay stretched out)।"
    • वे उसे विभिन्न दिशाओं में अपने अंगों को रखने के लिए मजबूर करते हैं (ऑर्थोगोनैलिटी)।
    • वे कहते हैं, "अपने 'कूदने' को अपने 'दौड़ने' जैसा न दिखने दें। उन्हें अलग रखें।"
    • यह सरल नियम जिम्नास्ट को एक एकल, बेकार मुद्रा में ढहने से रोकता है। यह रोबोट को अपने आंतरिक मानचित्र को विविध और विस्तृत बनाए रखने के लिए मजबूर करता है।

यह क्यों मायने रखता है

शोध पत्र दिखाता है कि यह सरल "स्ट्रेचिंग नियम" (ऑर्थोगोनैलिटी रेगुलराइज़ेशन) जटिल, भारी-भरकम तरीकों की तुलना में बेहतर काम करता है।

  • यह मजबूत (Robust) है: भले ही रोबोट के पास एक छोटा, अव्यवस्थित डेटासेट हो (जैसे कि लो-कवरेज परिदृश्य जहाँ उसने बहुत कम चालें देखी हैं), RLDP फिर भी काम करता है। जटिल तरीके यहाँ अक्सर विफल हो जाते हैं क्योंकि वे छूटे हुए डेटा से भ्रमित हो जाते हैं।
  • यह सरल है: आपको जटिल गणित चलाने के लिए सुपरकंप्यूटर की आवश्यकता नहीं है। आपको बस भविष्यवाणी का नियम और "स्ट्रेचिंग" नियम की आवश्यकता है।
  • यह सामान्य (General) है: रोबोट एक ऐसा मानचित्र सीखता है जो इतना अच्छा है कि वह नए कार्यों (जैसे एक नया रिवॉर्ड फंक्शन) को तुरंत संभाल सकता है, बिल्कुल एक इंसान की तरह जो जानता है कि चलना जानता है तो वह बिना किसी नए सबक के रेत, बर्फ या सीढ़ियों पर चलने के लिए खुद को तुरंत ढाल सकता है।

निष्कर्ष

लेखकों ने खोजा है कि रोबोट को सामान्य कौशल सिखाने के लिए आपको एक जटिल, ओवर-इंजीनियर्ड सिस्टम की आवश्यकता नहीं है। आपको बस भविष्य की भविष्यवाणी करने का एक सरल तरीका चाहिए, और साथ में एक सरल नियम चाहिए जो यह सुनिश्चित करे कि रोबोट "आलसी" न हो जाए और चीजों के बीच के अंतर को न भूल जाए।

संक्षेप में: हर संभावित भविष्य के परिणाम की भविष्यवाणी करने की कोशिश करने के (जो कठिन और त्रुटिपूर्ण है) के बजाय, बस रोबोट को यह सिखाएं कि आगे क्या होता है, लेकिन उसे अपने मानसिक मानचित्र को विविध और विशिष्ट बनाए रखने के लिए मजबूर करें। यह एक भ्रमित छात्र और एक अनुशासित एथलीट के बीच का अंतर है जो जानता है कि किसी भी खेल के लिए स्ट्रेचिंग कैसे करनी है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →