← नवीनतम पेपर
💻 computer science

Lagrangian Perturbation Diffusion Steering: Latent Reinforcement Learning for Generative Policies

यह शोध पत्र लैग्रेंजियन पर्टर्बेशन डिफ्यूजन स्टीयरिंग (LP-DS) का प्रस्ताव करता है, जो एक हल्का (lightweight) तरीका है जो एक लैग्रेंजियन ट्रस्ट-रीजन ऑब्जेक्टिव के माध्यम से कॉम्पैक्ट नॉइज़-स्पेस पर्टर्बेशन्स को सीखकर फ्रोजन जेनरेटिव पॉलिसियों को फाइन-ट्यून करता है, जिससे एक्शन-स्पेस एंट्रॉपी को बनाए रखते हुए विविध रोबोटिक और लोकोमोशन बेंचमार्क में सैंपल दक्षता और प्रदर्शन में महत्वपूर्ण सुधार होता है।

मूल लेखक: Hikmet Simsir, Ozgur S. Oguz

प्रकाशित 2026-06-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hikmet Simsir, Ozgur S. Oguz

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक मास्टर शेफ है जिसने वर्षों तक विशिष्ट व्यंजनों (recipes) को सिद्ध करने में बिताया है। यह शेफ अविश्वसनीय रूप से प्रतिभाशाली है और विभिन्न प्रकार के स्वादिष्ट व्यंजन बना सकता है (यह एक फ्रोजन जेनेरेटिव पॉलिसी (frozen generative policy) है)। हालाँकि, शेफ केवल उन्हीं सामग्रियों और स्थितियों के आधार पर खाना बनाना जानता है जिन्हें उन्होंने पहले देखा है। यदि आप उनसे एक थोड़े नए किचन में या थोड़ी अलग सामग्री के साथ खाना बनाने के लिए कहते हैं, तो वे भ्रमित हो सकते हैं, या वे पुराने ढर्रे पर ही अड़े रह सकते हैं जो नई स्थिति में काम नहीं करते।

समस्या यह है कि यदि आप शेफ को नए तरीके सीखने के लिए शुरू से फिर से प्रशिक्षित (retrain) करने की कोशिश करते हैं, तो इसमें बहुत समय लगता है, बहुत पैसा खर्च होता है, और वे अपने मूल कौशल को भूल सकते हैं या अजीब, बेस्वाद चीजें बनाना शुरू कर सकते हैं।

समाधान: "जेंटल नज़ (Gentle Nudge)" (LP-DS)

यह पेपर एक नया तरीका प्रस्तावित करता है जिसे लैग्रेंजियन पर्टर्बेशन डिफ्यूजन स्टीयरिंग (Lagrangian Perturbation Diffusion Steering - LP-DS) कहा जाता है। मास्टर शेफ को निकालने और नया नियुक्त करने के बजाय, या उनकी पूरी कुकबुक को फिर से लिखने के बजाय, LP-DS एक स्मार्ट सू-शेफ (sous-chef) की तरह काम करता है जो मास्टर शेफ के ठीक बगल में खड़ा है।

यह कैसे काम करता है, सरल उपमाओं का उपयोग करके यहाँ दिया गया है:

1. "नॉइज़ (Noise)" शेफ का मूड है

AI की दुनिया में, जिस "रेसिपी" का शेफ पालन करता है, वह एक रैंडम तत्व से शुरू होती है, जैसे कि एक रैंडम मूड या प्रेरणा की एक रैंडम चिंगारी। इसे हम "नॉइज़ (The Noise)" कह सकते हैं।

  • सामान्य तौर पर, शेफ क्या पकाएगा यह तय करने के लिए एक मानक सूची (जैसे "खुश," "केंद्रित," या "रिलैक्स्ड") में से एक रैंडम मूड चुनता है।
  • नया तरीका शेफ के दिमाग को नहीं बदलता है। इसके बजाय, सू-शेफ (पर्टर्बेशन नेटवर्क) शेफ को अपना मूड चुनने से पहले एक छोटा सा सुझाव फुसफुसाता है।
  • उदाहरण: यदि शेफ "रिलैक्स्ड" चुनने वाला है, तो सू-शेफ फुसफुसा सकता है, "हे, शायद इसमें थोड़ा सा 'अलर्ट' भी जोड़ दें।" शेफ अभी भी एक मूड चुनता है, लेकिन यह वर्तमान स्थिति के लिए जो सबसे अच्छा काम करता है, उसकी ओर थोड़ा सा शिफ्ट (shift) हो जाता है।

2. "ट्रस्ट रीजन (Trust Region)" सुरक्षा जाल है

यहाँ बड़ा खतरा यह है कि सू-शेफ बहुत उत्साहित हो सकता है और चिल्लाकर कह सकता है, "रेसिपी को भूल जाओ! पागल हो जाओ! 'गुस्सैल' और 'भूखा' चुनो!"
यदि शेफ उसकी बात मान लेता है, तो वह कुछ ऐसा बनाने की कोशिश कर सकता है जिसके लिए किचन डिज़ाइन नहीं किया गया था, जिससे आपदा आ सकती है (इसे ऑफ-मैनिफोल्ड बिहेवियर (off-manifold behavior) या मोड कोलैप्स (mode collapse) कहा जाता है)। शेफ उन विविध व्यंजनों को बनाना बंद कर सकता है जिनके लिए वह प्रसिद्ध था और केवल एक अजीब, दोहराव वाला व्यंजन बना सकता है।

इसे रोकने के लिए, LP-DS एक लैग्रेंजियन ट्रस्ट-रीजन (Lagrangian Trust-Region) का उपयोग करता है।

  • उपमा: कल्पना कीजिए कि सू-शेफ एक पट्टे (leash) से बंधा हुआ है। यह पट्टा एडजस्टेबल है।
  • यदि सू-शेफ शेफ को उनके मूल, सुरक्षित मूड से बहुत दूर खींचने की कोशिश करता है, तो पट्टा कस जाता है (लैग्रेंज मल्टीप्लायर बढ़ जाता है)।
  • यह सू-शेफ को वापस खींचने और शेफ की मूल शैली के करीब रहने के लिए मजबूर करता है।
  • यदि सू-शेफ विनम्र है और सुरक्षित सीमाओं के भीतर है, तो पट्टा ढीला हो जाता है, जिससे वह शेफ को बेहतर प्रदर्शन की ओर धकेलने की अनुमति मिलती है।

3. यह अन्य तरीकों से बेहतर क्यों है

यह पेपर शेफ को ठीक करने के दो अन्य तरीकों के साथ इसकी तुलना करता है:

  • विधि A (डायरेक्ट रिट्रेनिंग): मास्टर शेफ को शुरू से नए तरीके सिखाने की कोशिश करना। यह धीमा, महंगा है, और अक्सर शेफ को अस्थिर या विस्मृत (forgetful) बना देता है।
  • विधि B (अनकन्स्ट्रेंड स्टीयरिंग): बिना किसी पट्टे के सू-शेफ को जो चाहे चिल्लाने देने से। इससे शेफ भ्रमित हो सकता है, अजीब व्यंजन बना सकता है, या केवल एक विशिष्ट व्यंजन ही बना सकता है (अपनी मल्टीमॉडल (multimodal) क्षमता खो देना)।

LP-DS इसलिए जीतता है क्योंकि:

  1. यह तेज़ है: यह केवल छोटे से सू-शेफ को प्रशिक्षित करता है, पूरे मास्टर शेफ को नहीं।
  2. यह सुरक्षित है: "पट्टा" यह सुनिश्चित करता है कि शेफ अपने मूल कौशल को न भूले या असंभव व्यंजन बनाने की कोशिश न करे।
  3. यह विविधता बनाए रखता है: क्योंकि पट्टा सू-शेफ को शेफ को किसी कोने में धकेलने से रोकता है, इसलिए शेफ अभी भी व्यंजनों की एक विस्तृत श्रृंखला बना सकता है (उच्च एंट्रॉपी (entropy)), बस वर्तमान कार्य के लिए थोड़ा अनुकूलित (optimized) होता है।

पेपर में उल्लेखित वास्तविक-दुनिया के परिणाम

लेखकों ने रोबोट्स पर इसका परीक्षण किया जो निम्नलिखित कार्य कर रहे थे:

  • रोबोमिमिक (RoboMimic): वस्तुओं को उठाने और हिलाने के लिए सीखते हुए रोबोट (जैसे ब्लॉक स्टैक करना)।
  • ओपनएआई जिम (OpenAI Gym): चलने या दौड़ने के लिए सीखते हुए रोबोट (जैसे डिजिटल चीता)।
  • एड्रॉइड (Adroit): मानव जैसी हथेलियों का उपयोग करके हेरफेर करने वाले बहुत कुशल रोबोट।

इन सभी मामलों में, LP-DS विधि ने रोबोट्स को अन्य विधियों की तुलना में अधिक बार सफल होने और उच्च स्कोर प्राप्त करने में मदद की, जबकि रोबोट्स की गतिविधियों को विविध और प्राकृतिक बनाए रखा, न कि रोबोटिक और दोहरावदार। उन्होंने एक वास्तविक भौतिक रोबोट (एक फ्रैंका आर्म) पर भी इसका परीक्षण किया और यह वहां भी काम कर गया।

मुख्य निष्कर्ष

LP-DS एक अत्यधिक कुशल AI रोबोट के प्रदर्शन को तोड़ने के बिना उसे अपग्रेड करने का एक तरीका है। यह ऐसा इसलिए करता है क्योंकि यह रोबोट के कार्य करने से पहले उसके "रैंडम विचारों" में सूक्ष्म, नियंत्रित समायोजन करता है, जबकि यह सख्ती से सुनिश्चित करता है कि वे समायोजन रोबोट को खतरनाक या भ्रमित क्षेत्र में न धकेल दें। यह एक मास्टर कलाकार को पेंटिंग के अंतिम स्पर्श के लिए एक छोटा ब्रश देने और पूरे कैनवास को फिर से बनाने के लिए हथौड़ा थमाने के बीच का अंतर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →