← नवीनतम पेपर
🤖 machine learning

Mollified Value Learning

यह शोध पत्र मॉलिफाइड वैल्यू लर्निंग (MVL) को प्रस्तुत करता है, जो एक नवीन ऑफलाइन गोल-कंडीशन्ड सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) दृष्टिकोण है जो अस्थिर पॉइंटवाइज डिफरेंशियल बाधाओं को एक स्थानिक रूप से एकत्रित अपेक्षा (स्पेशियली एग्रीगेटेड एक्सपेक्टेशन) से प्रतिस्थापित करता है ताकि मजबूत, दूरी-समान वैल्यू ज्योमेट्री प्रेरित की जा सके और उच्च-आयामी कार्यों में प्रदर्शन में सुधार किया जा सके।

मूल लेखक: Hrishikesh Viswanath, Juanwu Lu, S. Talha Bukhari, Mihir Chauhan, Damon Conover, Ziran Wang, Aniket Bera

प्रकाशित 2026-06-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hrishikesh Viswanath, Juanwu Lu, S. Talha Bukhari, Mihir Chauhan, Damon Conover, Ziran Wang, Aniket Bera

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को भूलभुलैया (maze) में रास्ता खोजना या एक कप उठाना सिखाने की कोशिश कर रहे हैं, लेकिन आप रोबोट को वास्तविक दुनिया में अभ्यास करने की अनुमति नहीं दे सकते। इसके बजाय, आपके पास केवल अन्य रोबोटों द्वारा इन कार्यों को करने के (कभी सफल और कभी असफल होने के) प्रयासों का एक विशाल, स्थिर फोटो एल्बम है। इसे ऑफलाइन गोल-कंडीशन्ड रिइन्फोर्समेंट लर्निंग (Offline Goal-Conditioned Reinforcement Learning) कहा जाता है। रोबोट को इस "फोटो एल्बम" से सीखना होगा बिना कोई नया कदम उठाए।

बड़ी समस्या यह है कि रोबोट अक्सर इस बात को लेकर भ्रमित हो जाता है कि वह अपने लक्ष्य से कितनी दूर है। उसे लग सकता है कि वह करीब है जबकि वास्तव में वह दूर है, या वह एक लूप में फंस सकता है।

पुराना तरीका: "परफेक्ट मैप" की समस्या

पिछले तरीकों ने रोबोट को सख्त गणितीय नियमों का पालन करने के लिए मजबूर करके इसे ठीक करने की कोशिश की, जो एक सटीक मानचित्र बनाने जैसा है जहाँ प्रत्येक बिंदु की लक्ष्य से सटीक दूरी होती है। उन्होंने जटिल समीकरणों (जैसे ईकोनल समीकरण - Eikonal equation) का उपयोग किया ताकि यह सुनिश्चित हो सके कि रोबोट को सबसे छोटा रास्ता पता हो।

इसे ऐसे समझें जैसे कि आप एक घने कोहरे के बीच एक रूलर (पैमाना) पकड़कर चलने की कोशिश कर रहे हैं। आपको अगला कदम उठाने से पहले सटीक रूप से अगले स्थान की दूरी मापनी होगी। यदि कोहरा घना है (डेटा अव्यवस्थित है या रोबोट जटिल है), तो हर एक कदम को पूरी तरह से मापने की कोशिश करने से रूलर हिलने लगता है, गणित टूट जाता है, और रोबोट जम जाता है। यह छोटी त्रुटियों के प्रति बहुत संवेदनशील है।

नया तरीका: मोलिफाइड वैल्यू लर्निंग (MVL)

लेखक इस पेपर में एक स्मार्ट और अधिक सहज दृष्टिकोण प्रस्तावित करते हैं जिसे मोलिफाइड वैल्यू लर्निंग (Mollified Value Learning) कहा जाता है।

उपमा: "फजी फ्लैशलाइट" (धुंधली टॉर्च)
एक एकल, सटीक बिंदु पर रूलर से लक्ष्य की दूरी मापने के बजाय, कल्पना करें कि रोबलेट अपने वर्तमान स्थान के चारों ओर एक फजी फ्लैशलाइट जलाता है।

  1. प्रकाश की किरण: फ्लैशलाइट केवल उस स्थान को नहीं देखती जहाँ रोबोट खड़ा है; यह उसके आसपास के छोटे पड़ोस (neighborhood) को देखती है।
  2. औसत (The Average): "क्या यह सटीक पिक्सेल लक्ष्य से 5 मीटर दूर है?" पूछने के बजाय, रोबोट पूछता है, "क्या मेरे आसपास के स्थान औसतन लक्ष्य के करीब जा रहे हैं?"
  3. स्मूथिंग प्रभाव (The Smoothing Effect): यह "फजी" दृश्य एक मोलिफायर (एक गणितीय उपकरण जो खुरदरे किनारों को चिकना करता है) के रूप में कार्य करता है। यदि डेटा में कोई अजीब गड़बड़ी या शोर वाला माप है (जैसे कि एक फोटो जहाँ रोबोट फिसल गया), तो फ्लैशलाइट आस-पास के "अच्छे" डेटा के साथ उसे औसत निकाल देती है। यह छोटी, टेढ़ी-मेढ़ी त्रुटियों को अनदेखा करती है और बड़े चित्र पर ध्यान केंद्रित करती है: "क्या मैं सामान्य रूप से सही दिशा में बढ़ रहा हूँ?"

यह बेहतर क्यों काम करता है

पेपर का दावा है कि "सटीक बिंदु" वाले गणित के बजाय इस "औसत पड़ोस" वाले दृष्टिकोण का उपयोग करने से:

  • यह अधिक स्थिर है: जब डेटा अव्यवsted होता है या वातावरण जटिल होता है (जैसे कई जोड़ों वाला एक उच्च-आयामी रोबोटिक हाथ), तो रोबोट क्रैश नहीं होता है।
  • यह पथ का आकार सीखता है: रोबोट एक चिकना "टेरेन" (terrain) सीखता है जहाँ लक्ष्य एक घाटी की तरह होता है। भले ही जमीन ऊबड़-खाबड़ हो, रोबोट समग्र ढलान को देख सकता है और लक्ष्य की ओर फिसल सकता है।
  • यह शोर (Noise) को संभालता है: वास्तविक दुनिया के परीक्षणों में (जैसे सेब पकड़ने की कोशिश करने वाला रोबोटिक हाथ), पुराने तरीके शोर वाले डेटा के साथ अक्सर पूरी तरह विफल हो जाते थे। नया तरीका (MVL) काम करता रहा, और डेटा "झटकेदार" होने के बावजूद सेब तक पहुँचने के लिए सफलतापूर्वक मार्गदर्शन करता रहा।

परिणाम

शोधकर्ताओं ने सरल 2D भूलभुलैया से लेकर वस्तुओं को व्यवस्थित करने और पहेलियाँ सुलझाने वाले जटिल 3D रोबोटिक हाथों तक विभिन्न कार्यों पर इनका परीक्षण किया।

  • नेविगेशन (Navigation): भूलभुलैया के कार्यों में, रोबोट लक्ष्य को अधिक बार पाता है और अधिक सुचारू पथ अपनाता है।
  • मैनिपुलेशन (Manipulation): ब्लॉक को व्यवस्थित करने या चीजों को दराजों में रखने जैसे कार्यों के लिए, यह पिछले तरीकों की तुलना में काफी अधिक सफल रहा।
  • वास्तविक दुनिया: एक वास्तविक रोबोटिक हाथ (फ्रैंका पांडा) पर परीक्षण करते समय, इस पद्धति ने रोबोट को वस्तुओं तक पहुँचने और उन्हें पकड़ने में मदद की, जबकि अन-रेगुलराइज्ड वर्जन अक्सर खुद को सही स्थिति में रखने में विफल रहा।

संक्षेप में

यह पेपर रोबोट को सिखाने का एक तरीका पेश करता है कि वे सटीक, बिंदु-दर-बिंदु माप के पीछे पड़ने के बजाय अपने परिवेश के "बड़े चित्र" को देखकर अपने लक्ष्यों को कैसे खोजें। यह एक खोए हुए यात्री को बताने जैसा है, "अगले पेड़ तक की सटीक दूरी की चिंता मत करो; बस पहाड़ी की सामान्य ढलान को देखो और नीचे की ओर चलना जारी रखो," जो कि ऊबड़-खाबड़ इलाके में बहुत अधिक विश्वसनीय साबित होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →