← नवीनतम पेपर
🤖 AI

Improving Diffusion Planners by Self-Supervised Action Gating with Energies

यह शोध पत्र सेल्फ-सुपरवाइज्ड एक्शन गेटिंग विद एनर्जीज़ (SAGE) का प्रस्ताव करता है, जो एक ट्रेनिंग-फ्री इन्फरेंस-टाइम विधि है जो लेटेंट कंसिस्टेंसी सिग्नल के आधार पर सैंपल्ड ट्राजेक्टरीज को पुन: रैंक करके डिफ्यूजन प्लानर्स को ऑफलाइन रीइन्फोर्समेंट लर्निंग के लिए बेहतर बनाता है ताकि डायनामिकली इनकंसिस्टेंट प्लान्स को दंडित किया जा सके और निष्पादन की मजबूती (execution robustness) में सुधार किया जा सके।

मूल लेखक: Yuan Lu, Dongqi Han, Yansen Wang, Dongsheng Li

प्रकाशित 2026-03-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuan Lu, Dongqi Han, Yansen Wang, Dongsheng Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल भूलभुलैया (maze) से गुजरना या कॉफी का कप उठाना सिखा रहे हैं। आप नहीं चाहते कि रोबोट दीवारों से टकराकर और चीजें तोड़कर सीखे (क्योंकि यह खतरनाक और महंगा है)। इसके बजाय, आप उसे काम करने वाले अन्य रोबोटों का एक वीडियो लाइब्रेरी देते हैं। इसे ऑफलाइन रीइन्फोर्समेंट लर्निंग (Offline Reinforcement Learning) कहा जाता है।

हाल ही में, रोबोटों के लिए एक नए प्रकार के "दिमाग" जिसे डिफ्यूजन प्लानर (Diffusion Planner) कहा जाता है, बहुत लोकप्रिय हुआ है। डिफ्यूजन प्लानर को एक रचनात्मक सपने देखने वाले (creative dreamer) की तरह समझें। जब रोबोट को चलने की आवश्यकता होती है, तो प्लानर केवल एक क्रिया नहीं चुनता; वह सैकड़ों संभावित भविष्य के रास्तों के सपने देखता है (जैसे "बाएं चलें," "ऊपर से कूदें," "दाएं फिसलें") और फिर उनमें से सबसे अच्छा चुनने की कोशिश करता है।

समस्या: "सपना देखने वाला" बनाम "वास्तविकता की जांच"

दिक्कत यह है कि डिफ्यूजन प्लानर इतना रचनात्मक है कि वह कभी-कभी ऐसे रास्तों के सपने देख लेता है जो कागज पर तो शानदार दिखते हैं, लेकिन शारीरिक रूप से असंभव होते हैं।

कल्पना कीजिए कि प्लानर एक ऐसा रास्ता बुनता है जहाँ रोबोट तुरंत फिनिश लाइन तक टेलीपोर्ट हो जाता है। एक "स्कोरकीपर" (वैल्यू फंक्शन) इस रास्ते को देखता है और कहता है, "वाह, यह लक्ष्य तक बहुत तेजी से पहुँच जाता है! यह 10/10 है!" तो, रोबोट इसे करने की कोशिश करता है। लेकिन क्योंकि रोबोट वास्तव में टेलीपोर्ट नहीं कर सकता, इसलिए वह दीवार से टकरा जाता है।

तकनीकी शब्दों में, प्लानर उच्च स्कोर के लिए अनुकूलित (optimizing for a high score) हो रहा है, लेकिन स्थानीय व्यवहार्यता (local feasibility) (कि क्या वर्तमान स्थिति और भौतिकी को देखते हुए अगला कदम वास्तव में संभव है) को नजरअंदाज कर रहा है।

समाधान: SAGE (एक "वास्तविकता की जांच" करने वाला गेटकीपर)

लेखकों ने एक नई विधि प्रस्तावित की है जिसे SAGE (Self-supervised Action Gating with Energies) कहा जाता है।

SAGE को एक सख्त बाउंसर या एक "वास्तविकता की जांच करने वाले संपादक" की तरह समझें जो "सपना देखने वाले" (प्लानर) और "करने वाले" (रोबोट) के बीच खड़ा होता है।

यहाँ बताया गया है कि SAGE कैसे काम करता है, एक सरल उपमा का उपयोग करते हुए:

1. प्रशिक्षण चरण: "भौतिकी के नियमों" को सीखना

इससे पहले कि रोबोट कभी हिले भी, SAGE पिछले सफलताओं के वीडियो लाइब्रेरी का अध्ययन करता है। यह केवल चालों को याद नहीं करता; यह सीखता है कि चीजें वास्तव में कैसे होती हैं, उनका लय और प्रवाह (rhythm and flow) क्या है।

  • उपमा: कल्पना कीजिए कि एक डांस इंस्ट्रक्टर हजारों घंटों के डांस वीडियो देख रहा है। वे केवल स्टेप्स को याद नहीं करते; वे सीखते हैं कि यदि आप अपना बायां पैर उठाते हैं, तो संतुलन बनाए रखने के लिए आपका दाहिना हाथ एक विशिष्ट तरीके से हिलना अनिवार्य है। यदि कोई डांसर अपना बायां पैर उठाता है और अपने दाहिने हाथ को स्थिर रखता है, तो इंस्ट्रक्टर तुरंत जान जाता है: "यह वास्तविक डांस मूव नहीं है; यह एक ग्लिच (glitch) है।"
  • तकनीक: SAGE इन "लयों" को एक छिपी हुई भाषा (latent space) में सीखने के लिए एक विशेष AI आर्किटेक्चर (JEPA) का उपयोग करता है। यह अनुमान लगाने के लिए सीखता है: "यदि रोबोट स्थिति A में है और क्रिया B करता है, तो अगली स्थिति C जैसी दिखनी चाहिए।"

2. इन्फरेंस चरण: "ऊर्जा" का परीक्षण

अब, रोबोट वास्तविक दुनिया में है। डिफ्यूजन प्लानर (सपना देखने वाला) 50 संभावित भविष्य के रास्तों को उत्पन्न करता है।

  • पुराना तरीका: रोबोट बस उच्चतम स्कोर वाला रास्ता चुन लेता है।
  • SAGE का तरीका: रास्ता चुनने से पहले, SAGE हर पथ के पहले कुछ कदमों पर एक त्वरित परीक्षण करता है।
    • यह पूछता है: "यदि रोबलो इस पथ के पहले कदम को आजमाने की कोशिश करता है, तो क्या यह उन वीडियो से मेल खाता है जो हमने सीखे थे?"
    • यदि पथ अजीब है (जैसे, टेलीपोर्ट करना, दीवारों के माध्यम से फिसलना), तो SAGE इसे उच्च "ऊर्जा" (Energy) स्कोर देता है। भौतिकी में, उच्च ऊर्जा का अर्थ आमतौर पर यह होता है कि कुछ अस्थिर या असंभव है।
    • यदि पथ स्वाभाविक और सुचारू दिखता है, तो इसे कम "ऊर्जा" स्कोर मिलता है।

3. अंतिम निर्णय

SAGE रोबोट को बताता है: "हे, इन शीर्ष 20% रास्तों को हटा दें क्योंकि इनमें उच्च ऊर्जा (जो शारीरिक रूप से असंभव है) है। शेष 80% रास्तों में से जो वास्तविक दिखते हैं, उनमें से सबसे अच्छे स्कोर वाला रास्ता चुनें।"

यह एक बड़ी बात क्यों है?

  1. यह एक 'प्लग-एंड-प्ले' अपग्रेड है: आपको मुख्य रोबोट मस्तिष्क (डिफ्यूजन प्लानर) को फिर से प्रशिक्षित करने की आवश्यकता नहीं है। आप बस इस "बाउंसर" (SAGE) को प्रवेश द्वार पर जोड़ सकते हैं। यह मौजूदा सिस्टम के साथ काम करता है।
  2. कोई नया ट्रेनिंग डेटा नहीं चाहिए: SAGE पूरी तरह से मौजूदा वीडियो लाइब्रेरी से सीखता है। इसे यह सीखने के लिए कि क्या नहीं करना है, रोबोट को चीजों से टकराने के लिए बाहर जाने की आवश्यकता नहीं है।
  3. यह "भंगुर" (Brittle) व्यवहार को रोकता है: SAGE के बिना, एक रोबोट एक पागलपन भरे प्लान के प्रति प्रतिबद्ध हो सकता है, तुरंत विफल हो सकता है, और फिर घबराकर पुन: योजना बनाने के लिए मजबूर हो सकता है। SAGE रोबोट को उन पागलपन भरे प्लान को कोशिश करने से पहले ही रोक देता है।

सारांश उपमा

  • डिफ्यूजन प्लानर एक पटकथा लेखक (screenwriter) की तरह है जो 100 रोमांचक मूवी स्क्रिप्ट लिखता है। कुछ बेहतरीन होती हैं, लेकिन कुछ में खामियां (plot holes) होती हैं (जैसे, नायक बिना पंखों के उड़ता है)।
  • वैल्यू फंक्शन वह निर्माता (producer) है जो सबसे अधिक विस्फोट और पैसे वाली स्क्रिप्ट चुनता है।
  • SAGE एक फिजिक्स कंसल्टेंट (physics consultant) है। निर्माता द्वारा स्क्रिप्ट चुनने से पहले, कंसल्टेंट कहता है, "स्क्रिप्ट #42 में बेहतरीन विस्फोट हैं, लेकिन नायक उड़ रहा है। यह असंभव है। इसे काट दें।"
  • परिणाम: फिल्म (रोबोट की क्रिया) अभी भी रोमांचक है, लेकिन इसे फिल्माना (निष्पादित करना) वास्तव में संभव है।

इस "वास्तविकता की जांच" को जोड़कर, रोबोट अधिक विश्वसनीय, टकराने की संभावना कम, और कमरे में चलने या फर्नीचर जोड़ने जैसे लंबे, जटिल कार्यों को पूरा करने में बेहतर हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →