← नवीनतम पेपर
🤖 machine learning

\textit{Stochastic} MeanFlow Policies: One-Step Generative Control with Entropic Mirror Descent

यह शोध पत्र स्टोकेस्टिक मीनफ्लो पॉलिसीज़ (SMFP) को प्रस्तुत करता है, जो एक वन-स्टेप जनरेटिव पॉलिसी क्लास है जो मल्टीमॉडल एक्शन डिस्ट्रीब्यूशन को प्रभावी ढंग से संभालने के लिए ट्रैक्टेबल एंट्रॉपी एस्टीमेशन को ऑफ-पॉलिसी मिरर डिसेंट के साथ जोड़ता है, जबकि MuJoCo बेंचमार्क में इन्फरेंस दक्षता और ट्रेनिंग स्थिरता बनाए रखता है।

मूल लेखक: Zeyuan Wang, Da Li, Yulin Chen, Yuehu Gong, Yanming Guo, Ye Shi, Liang Bai, Tianyuan Yu, Yanwei Fu

प्रकाशित 2026-05-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zeyuan Wang, Da Li, Yulin Chen, Yuehu Gong, Yanming Guo, Ye Shi, Liang Bai, Tianyuan Yu, Yanwei Fu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को चलना, दौड़ना या नाचना सिखा रहे हैं। ऐसा करने के लिए, रोबोट को एक "दिमाग" (एक पॉलिसी) की आवश्यकता होती है जो यह तय कर सके कि उसे आगे क्या कदम उठाना है, जो उसने देखा है उसके आधार पर। यह शोध पत्र उस दिमाग को बनाने का एक नया, अधिक स्मार्ट तरीका पेश करता है, जिसे Stochastic MeanFlow Policies (SMFP) कहा जाता है।

यहाँ इस नए तरीके के काम करने का विवरण सरल उपमाओं के माध्यम से दिया गया है।

समस्या: "एक ही आकार सबके लिए" बनाम "धीमा कलाकार"

रोबोट लर्निंग की दुनिया में, पारंपरिक रूप से दो मुख्य प्रकार के दिमाग रहे हैं, और दोनों में एक बड़ी खामी है:

  1. द गॉसियन ब्रेन (The Gaussian Brain - तेज़, सरल विचारक):

    • यह कैसे काम करता है: यह एक ऐसे रोबोट की तरह है जो हमेशा "औसत" चाल चुनता है। यदि इसे कूदने की आवश्यकता है, तो यह सटीक ऊँचाई की गणना करता है और कूद जाता है।
    • अच्छी बात: यह अविश्वसनीय रूप से तेज़ है और इसकी गणना करना आसान है।
    • बुरी बात: यह बहुत सरल है। यदि किसी कार्य में सफल होने के कई तरीके हैं (जैसे बाधा के ऊपर से बाईं ओर या दाईं ओर से कूदना), तो यह दिमाग भ्रमित हो जाता है। यह दोनों विकल्पों का औसत निकालने की कोशिश करता है और अंततः बाधा के बीच में ही कूद जाता है। यह एक समय में केवल एक ही प्रकार के व्यवहार (mode) को संभाल सकता है।
  2. द जनरेटिव ब्रेन (The Generative Brain - धीमा, रचनात्मक कलाकार):

    • यह कैसे काम करता है: यह एक ऐसे रोबोट की तरह है जो हजारों संभावित चालों की कल्पना करता है, उनके रेखाचित्र बनाता है, और सबसे अच्छी को चुनता है। यह जटिल स्थितियों को संभाल सकता है जिनमें कई अलग-अलग समाधान होते हैं (मल्टीमॉडल)।
    • अच्छी बात: यह बहुत अभिव्यंजक है और रचनात्मक समाधान खोज सकता है।
    • बुरी बात: यह धीमा है। हर चाल को "बनाने" में इसे बहुत समय लगता है क्योंकि इसे कई चरणों से गुजरना पड़ता है। साथ ही, यह मापना कठिन है कि यह कितना "रचनात्मक" या "खोजी" (exploratory) है, जिससे रोबोट को सुरक्षित रूप से नई चीजें आज़माने के लिए सिखाना मुश्किल हो जाता है।

लक्ष्य: दोनों दुनियाओं का सर्वश्रेष्ठ संगम

शोधकर्ताओं चाहते थे कि वे सरल विचारक की गति और रचनात्मक कलाकार की रचनात्मकता को मिला सकें। वे भी दो विशिष्ट शिक्षण रणनीतियों का उपयोग करना चाहते थे:

  • एक्सप्लोरेशन (SAC - अन्वेषण): रोबोट को तेज़ी से सीखने के लिए यादृच्छिक (random), जोखिम भरे कदम उठाने के लिए प्रोत्साहित करना।
  • स्टेबिलिटी (Mirror Descent - स्थिरता): यह सुनिश्चित करना कि रोबोट अपनी आदतों को बहुत नाटकीय रूप से न बदले, ताकि वह जो पहले से जानता है उसे भूल न जाए।

समस्या क्या है? जब आप इन दोनों शिक्षण रणनीतियों को मिलाते हैं, तो वह "परफेक्ट" चाल जिसे रोबोट को लक्षित करना चाहिए, एक जटिल, बहु-शिखर वाली आकृति बन जाती है (जैसे पहाड़ों की एक श्रृंखला जिसमें कई चोटियाँ हों)। सरल विचारक (गॉसियन) केवल एक शिखर देख पाता है, इसलिए वह विफल हो जाता है। रचनात्मक कलाकार सभी शिखरों को देख सकता है लेकिन वह बहुत धीमा है और उसे नियंत्रित करना कठिन है।

समाधान: SMFP (एक "एक-चरण" वाला जादुई ट्रिक)

लेखकों ने SMFP बनाया, जो एक नया प्रकार का दिमाग है जो इस पहेली को हल करता है। यह यहाँ बताया गया है कि यह कैसे काम करता है:

"मीनफ्लो" (MeanFlow) की अवधारणा:
कल्पना कीजिए कि आप एक नाव को एक शांत झील (शोर/noise) से एक विशिष्ट गंतव्य (एक्शन) तक ले जाने की कोशिश कर रहे हैं।

  • पुराने जनरेटिव तरीके: नाव को वहां तक पहुँचने के लिए एक घुमावदार नदी से गुजरना पड़ता है, और समय के साथ कई छोटे समायोजन करने पड़ते हैं। यह धीमा है।
  • SMFP: शोधकर्ताओं ने महसूस किया कि वे झील से गंतव्य तक पहुँचने के लिए आवश्यक औसत गति और दिशा की गणना एक ही छलांग में कर सकते हैं। यह एक कदम में नाव को सीधे सही जगह पर टेलीपोर्ट करने जैसा है, न कि धीरे-धीरे नौकायन करने जैसा।

"स्टोकेस्टिक" (Stochastic) ट्विस्ट:
आमतौर पर, यह "टेलीपोर्ट" विधि नियत (deterministic) होती है (यह हमेशा एक ही सटीक स्थान पर जाती है)। लेकिन रोबोट को खोजने (explore करने) के लिए सिखाने हेतु, हमें इसे थोड़ा अप्रत्याशित होना चाहिए।

  • SMFP एक "फजीनेस" (धुंधलापन/अनिश्चितता) कारक जोड़ता है। यह कहने जैसा है कि, "गंतव्य तक टेलीपोर्ट करें, लेकिन थोड़े लचीलेपन (wiggle room) के साथ।"
  • महत्वपूर्ण बात यह है कि यह "लचीलापन" गणितीय रूप से मापने में सरल है। यह रोबोट को यह जानने की अनुमति देता है कि वह बिना जटिल गणनाओं के कितनी खोज (exploration) कर रहा है।

यह क्यों महत्वपूर्ण है

  1. गति: क्योंकि यह एक चाल तय करने के लिए केवल एक चरण लेता है (पुराने जनरेटिव तरीकों की तरह 20 चरणों के बजाय), रोबोट लगभग तुरंत सोच सकता है। यह पुराने "सरल विचारक" जितना ही तेज़ है।
  2. समझदारी: क्योंकि यह "टेलीपोर्ट" तर्क का उपयोग करता है, यह कई समाधानों वाली जटिल स्थितियों को संभाल सकता है (जैसे रचनात्मक कलाकार)।
  3. स्थिरता: यह "नई चीजें आज़माने" (Exploration) और "बहुत तेज़ी से न बदलने" (Stability) दोनों शिक्षण विधियों को सफलतापूर्वक जोड़ता है। यह एक ऐसा लक्ष्य बनाता है जो कठिन कार्यों को सीखने के लिए पर्याप्त जटिल है, फिर भी रोबोट कुशलतापूर्वक वहां तक पहुँच सकता है।

परिणाम

शोधकर्ताओं ने सात अलग-अलग रोबोट सिमुलेशन कार्यों (जैसे रोबोट का दौड़ना, चलना या खड़ा होना) पर इस नए दिमाग का परीक्षण किया।

  • प्रदर्शन: SMFP ने मौजूदा सर्वोत्तम तरीकों को भी पीछे छोड़ दिया या उनके बराबर प्रदर्शन किया, जिसमें धीमे और जटिल तरीके भी शामिल थे।
  • दक्षता: इसने उच्च स्कोर प्राप्त करते हुए भी अविश्वसनीय रूप से तेज़ प्रदर्शन किया, निर्णय लेने में लगभग कोई देरी नहीं हुई।

संक्षेप में: SMFP रोबोट को सिखाने का एक नया तरीका है जो वास्तविक समय के उपयोग के लिए तेज़ है लेकिन जटिल, बहु-विकल्प समस्याओं को संभालने के लिए पर्याप्त स्मार्ट भी है, और साथ ही सीखने की प्रक्रिया के दौरान रोबोट को स्थिर और सुरक्षित रखता है। यह "तेज़ लेकिन सरल" और "स्मार्ट लेकिन धीमा" के बीच के अंतर को पाटता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →