← नवीनतम पेपर
💻 computer science

DiSPo: Diffusion-SSM based Policy Learning for Coarse-to-Fine Action Discretization

यह शोध पत्र DiSPo का प्रस्ताव करता है, जो एक नवीन डिफ्यूजन-स्टेट स्पेस मॉडल (SSM) आधारित पॉलिसी है जो विविध कोर्स (coarse) प्रदर्शनों से सीखने और विभिन्न नियंत्रण पैमानों के कार्यों को उत्पन्न करने के लिए Mamba का लाभ उठाता है, जिससे पारंपरिक बेसलाइनों की तुलना में कोर्स-टू-फाइन (coarse-to-fine) कौशल शिक्षण में बेहतर सफलता दर और अनुमान दक्षता प्राप्त होती है।

मूल लेखक: Nayoung Oh, Jaehyeong Jang, Moonkyeong Jung, Daehyung Park

प्रकाशित 2026-02-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nayoung Oh, Jaehyeong Jang, Moonkyeong Jung, Daehyung Park

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक नाजुक कार्य करना सिखाने की कोशिश कर रहे हैं, जैसे कि सुई में धागा पिरोना या एक छोटे पाइप के माध्यम से क्लैंप पास करना।

समस्या: "धुंधला" बनाम "साफ" वीडियो का द्वंद्व
पारंपरिक रूप से, एक रोबोट को ये कौशल सिखाने के लिए, आपको उसे किसी इंसान द्वारा पूरी तरह से किए गए काम का एक हाई-डेफिनिशन, स्लो-मोशन वीडियो दिखाना पड़ता है। यदि आप केवल रोबोट को एक लो-रिज़ॉल्यूशन, फास्ट-फॉरवर्ड किया हुआ वीडियो (कोर्स डेटा) दिखाते हैं, तो रोबोट भ्रमित हो जाता है। वह बड़ी तस्वीर तो देख लेता है लेकिन टकराने से बचने के लिए आवश्यक सूक्ष्म, महत्वपूर्ण विवरणों को मिस कर देता है।

वर्तमान में अधिकांश AI विधियाँ एक ऐसे कैमरे की तरह हैं जिसका केवल एक ही ज़ूम स्तर होता है। यदि आप इसे एक धुंधला वीडियो देते हैं, तो यह विवरणों का अनुमान लगाने की कोशिश करता है, लेकिन अक्सर यह अस्थिर हो जाता है या टकरा जाता है। यदि आप इसे एक साफ वीडियो देते हैं, तो यह अच्छा काम करता है, लेकिन इतने उच्च-गुणवत्ता वाले डेटा को रिकॉर्ड करना महंगा, धीमा और स्टोर करने में कठिन होता है।

समाधान: DiSPo (द "स्मार्ट ज़ूम" रोबोट)
यह पेपर DiSPo (डिफ्यूजन-SSM आधारित पॉलिसी) पेश करता है। DiSPo को एक ऐसे रोबोट के रूप में सोचें जिसके पास एक जादुई, अनुकूली ज़ूम लेंस (adaptive zoom lens) और एक सुपर-मेमोरी है।

यह कैसे काम करता है, यहाँ सरल रूपकों में दिया गया है:

1. "स्मार्ट ज़ूम" (कोर्स-टू-फाइन)

कल्पना कीजिए कि आप एक मानचित्र देख रहे हैं।

  • पुराने रोबोट: यदि आप उन्हें पूरे देश का नक्शा देते हैं, तो वे तब खो जाते हैं जब उन्हें किसी विशिष्ट सड़क पर मुड़ने की आवश्यकता होती है। यदि आप उन्हें केवल एक सड़क का नक्शा देते हैं, तो उन्हें पता नहीं चलता कि वे देश में कहाँ हैं।
  • DiSPo: DiSPo एक ज़ूम-आउट किए हुए मानचित्र (कोर्स डेटा) को देख सकता है ताकि सामान्य मार्ग को समझा जा सके, और फिर ठीक उसी समय जब इसे एक सटीक चाल चलने की आवश्यकता होती है, यह बारीक विवरण देखने के लिए तुरंत "ज़ूम इन" कर सकता है। इसे पूरी यात्रा के लिए हाई-डेफिनिशन वीडियो की आवश्यकता नहीं है; इसे केवल कठिन हिस्सों के लिए हाई-डेफिनिशन डेटा की आवश्यकता है।

2. "दो सुपरपावर" (डिफ्यूजन + SSM)

DiSPo दो अलग-अलग प्रकार के AI दिमागों को जोड़ता है:

  • डिफ्यूजन आर्टिस्ट (द "डिनॉइज़र"): कल्पना कीजिए कि एक मूर्तिकार शोर-शराबे वाली, बिखरी हुई मिट्टी के ब्लॉक से शुरुआत करता है। वे धीरे-धीरे शोर को हटाते हैं ताकि एक आदर्श मूर्ति प्रकट हो सके। AI के संदर्भ में, DiSPo क्या करना है इसके एक रैंडम अनुमान से शुरू होता है और धीरे-धीरे इसे "साफ" करता जाता है जब तक कि इसे एकदम सही मूवमेंट न मिल जाए। यह इसे जटिल, कलात्मक गतिविधियों को सीखने में बहुत अच्छा बनाता है।
  • एसएसएम लाइब्रेरियन (द "मेमोरी कीपर"): यह "माम्बा" वाला हिस्सा है। कल्पना कीजिए कि एक लाइब्रेरियन जो एक किताब पढ़ सकता है और बिना हर पन्ना दोबारा पढ़े उसके कथानक को पूरी तरह से याद रख सकता है। पारंपरिक AI को यह याद रखने के लिए कि क्या हुआ था, पूरी हिस्ट्री को दोबारा पढ़ने की आवश्यकता होती है। SSM कुशल है; यह क्रिया के "प्रवाह" को बहुत अच्छी तरह से याद रखता है, भले ही क्रिया अलग-अलग गति से हो रही हो।

3. "मैजिक डायल" (स्टेप-स्केल फैक्टर)

यह इस पेपर का सबसे बड़ा नवाचार है।

  • उपमा: कल्पना कीजिए कि आप कार चला रहे हैं। कभी-कभी आप एक लंबे, सीधे हाईवे पर होते हैं (आप तेज़ चल सकते हैं और बड़े कदम ले सकते हैं)। कभी-कभी आप एक भीड़भाड़ वाले पार्किंग लॉट में होते हैं (आपको धीरे और बहुत सावधानी से छोटे कदम लेने की आवश्यकता होती है)।
  • DiSPo इसका उपयोग कैसे करता है: DiSPo के पास एक "स्पीड डायल" है।
    • जब रोबोट खुले स्थान में होता है, तो वह डायल को "कोर्स" (बड़े कदम, तेज़ प्रोसेसिंग) पर घुमा देता है।
    • जब वह किसी दीवार या बटन के करीब पहुँचता है, तो वह डायल को "फाइन" (छोटे कदम, उच्च सटीकता) पर घुमा देता है।
    • महत्वपूर्ण बात: यह एक ऐसे वीडियो से सीख सकता है जो धीमी, कम-गुणवत्ता वाली गति पर रिकॉर्ड किया गया था, और फिर यह खुद तय कर सकता है कि सुरक्षित क्षेत्रों में तेज़ी से और खतरनाक क्षेत्रों में धीरे चलना है।

4. "फेक प्रैक्टिस" ट्रिक (स्यूडो-डेमोंस्ट्रेशन)

रोबोट कैसे बारीकी से चलना सीखता है यदि उसे केवल धीमी, कोर्स वीडियो दिखाई गई थीं?

  • उपमा: कल्पना कीजिए कि आप पियानो का एक टुकड़ा सीख रहे हैं। आपके पास केवल एक मास्टर द्वारा बजाए गए धीमे, दबे हुए रिकॉर्डिंग है।
  • ट्रिक: DiSPo उस धीमी रिकॉर्डिंग को सुनता है, अनुमान लगाता है कि तेज़ नोट्स कैसे होने चाहिए थे, और अपने लिए एक "अभ्यास संस्करण" बनाता है। फिर यह अपने अनुमान की जांच धीमी रिकॉर्डिंग के साथ करता है ताकि यह सुनिश्चित हो सके कि यह पटरी से नहीं उतरा है। यह इसे तब तक दोहराता है जब तक कि यह धीमी रिकॉर्डिंग होने के बावजूद पूरी गति से गाना बजाने में सक्षम न हो जाए। यह स्टोरेज स्पेस और समय की भारी बचत करता है।

वास्तविक दुनिया का परिणाम

शोधकर्ताओं ने एक वास्तविक रोबोटिक आर्म (UR5e) पर इसका परीक्षण किया।

  • कार्य: एक क्लैंप को बिना किनारों को छुए एक छोटे पाइप से गुजारना, और दीवार से टकराए बिना एक बटन दबाना।
  • परिणाम:
    • पुराने रोबोट: वे या तो पाइप से टकरा जाते या अजीब तरह से रुक जाते क्योंकि वे कोर्स डेटा से सूक्ष्म विवरणों को समझ नहीं पाते थे।
    • DiSPo: इसने उच्च सटीकता के साथ क्लैंप को सफलतापूर्वक पास किया और बटन दबाया। यह सुरक्षित होने पर तेज़ चला, और बाधा के पास सूक्ष्म सटीकता के साथ धीमा हो गया।

सारांश

DiSPo एक ऐसे रोबोट की तरह है जो एक "स्केच" से सीखता है लेकिन एक "फोटोग्राफ" खींचता है।
यह रफ, लो-क्वालिटी डेमोंस्ट्रेशन लेता है, बड़ी तस्वीर को समझता है, और अपनी विशेष "ज़ूम" क्षमता का उपयोग करके ऑन-द-फ्लाई हाई-स्पीड, हाई-प्रिसिजन विवरणों को भर देता है। इसका मतलब है कि हमें रोबोटों को सिखाने के लिए घंटों तक परफेक्ट, स्लो-मोशन वीडियो रिकॉर्ड करने की आवश्यकता नहीं है; हम उन्हें रफ, तेज़ डेटा से सिखा सकते हैं, और वे सूक्ष्म विवरणों को खुद ही समझ लेंगे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →