← नवीनतम पेपर
🤖 machine learning

RS-Diffuser: Risk-Sensitive Diffusion Planning with Distributional Value Guidance

यह शोध पत्र RS-Diffuser को प्रस्तुत करता है, जो एक जोखिम-संवेदनशील ऑफलाइन डिफ्यूजन प्लानिंग फ्रेमवर्क है जो डिस्ट्रीब्यूशनल वैल्यू क्रिटिक्स को टेल-अवेयर गाइडेंस के साथ एकीकृत करता है ताकि एक एकल मॉडल को लचीले ढंग से जोखिम-विमुख, तटस्थ, या जोखिम-खोजने वाले व्यवहार उत्पन्न करने में सक्षम बनाया जा सके, जबकि सुरक्षा-महत्वपूर्ण अनुप्रयोगों में मजबूती में सुधार और सुरक्षा उल्लंघनों को कम किया जा सके।

मूल लेखक: Shiqiang Gong

प्रकाशित 2026-06-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shiqiang Gong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल शहर में नेविगेट करना सिखा रहे हैं। आपके पास एक विशाल वीडियो लाइब्रेरी है कि कैसे अन्य रोबोटों (या मनुष्यों) ने अतीत में उस शहर में ड्राइविंग की थी, लेकिन आप रोबोट को सीखने के लिए वास्तविक दुनिया में गाड़ी चलाने की अनुमति नहीं दे सकते, क्योंकि एक भी गलती दुर्घटना का कारण बन सकती है। यह ऑफलाइन रीइन्फोर्समेंट लर्निंग (Offline Reinforcement Learning) की दुनिया है: बिना नए प्रयोगों के एक निश्चित डेटासेट से सीखना।

कई वर्तमान AI प्लानर्स की समस्या यह है कि वे "रिस्क-न्यूट्रल" (जोखिम-तटस्थ) होते हैं। वे एक ऐसे GPS की तरह हैं जिसे केवल औसत सबसे तेज़ मार्ग की परवाह है। यदि किसी मार्ग में 99% संभावना तेज़ होने की है और 1% संभावना कार को नष्ट करने वाले बड़े गड्ढे में गिरने की है, तो एक रिस्क-न्यूट्रल प्लानर अभी भी उस मार्ग को चुन सकता है क्योंकि उसका औसत समय अच्छा है। सुरक्षा-महत्वपूर्ण स्थितियों में (जैसे सेल्फ-ड्राइविंग कार या मेडिकल रोबोट), आपदा की वह 1% संभावना अस्वीकार्य है।

यहाँ RS-Diffuser आता है, जो एक "सुरक्षा-सचेत सह-पायलट" की तरह कार्य करता है। यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. "द ड्रीमर" (द डिफ्यूजन प्लानर)

इस सिस्टम के मूल को एक ड्रीमर (सपना देखने वाला) के रूप में सोचें। अतीत में, AI प्लानर्स अक्सर अगले एकल कदम का अनुमान लगाने की कोशिश करते थे (जैसे एक शतरंज खिलाड़ी जो एक कदम आगे की सोचता है)। RS-Diffuser अलग है; यह एक साथ पूरे भविष्य के परिदृश्यों को "सपना" देखता है।

यह डिफ्यूजन (Diffusion) तकनीक का उपयोग करता है, जो इस तरह है जैसे एक कलाकार स्टैटिक नॉइज़ (शोर) से भरे कैनवास से शुरू करता है और धीरे-धीरे उसे एक स्पष्ट चित्र में बदल देता है।

  • प्रक्रिया: AI भविष्य के पथ के एक अराजक, शोर भरे अनुमान के साथ शुरू करता है। फिर यह इस पथ को बार-बार "डीनॉइज़" (शोर हटाना) करता है, इसे चरण-दर-चरण साफ करता है जब तक कि यह एक सुचारू, तार्किक प्रक्षेपवक्र (trajectory) प्रकट न कर दे कि रोबोट को कहाँ जाना चाहिए।
  • लाभ: क्योंकि यह पूरे पथ को एक साथ उत्पन्न करता है, यह केवल अगले सेकंड को देखने वाले तरीकों की तुलना में दीर्घकालिक परिणामों को बेहतर ढंग से समझता है।

2. "द रिस्क ऑडिटर" (द डिस्ट्रीब्यूशनल वैल्यू क्रिटिक)

यही इस पेपर का असली मंत्र है। अधिकांश AI क्रिटिक्स (जज) केवल एक स्कोर देते हैं: "यह पथ 100 अंक का है।"
RS-Diffuser का क्रिटिक एक रिस्क ऑडिटर (जोखिम लेखा परीक्षक) है। एक एकल स्कोर देने के बजाय, यह संभावनाओं की एक पूरी रिपोर्ट कार्ड देता है।

  • यह पूछता है: "सबसे अच्छा मामला क्या है? सबसे खराब मामला क्या है? 90% समय क्या होता है? दुर्लभ 1% आपदाओं में क्या होता है?"
  • यह पूरे परिणामों के स्पेक्ट्रम को मैप करने के लिए क्वांटाइल रिग्रेशन (Quantile Regression) नामक एक सांख्यिकीय उपकरण का उपयोग करता है, न कि केवल औसत का।

3. "द स्टीयरिंग व्हील" (रिस्क-सेंसिटिव गाइडेंस)

यहीं जादू होता है। आमतौर पर, एक बार जब एक AI मॉडल प्रशिक्षित हो जाता है, तो उसका व्यक्तित्व तय हो जाता है। यदि आप इसे सुरक्षित बनाना चाहते हैं, तो आपको इसे शुरू से फिर से प्रशिक्षित करना होगा।

RS-Diffuser नियमों को बदल देता है। यह ड्रीमर (प्लानर) को ऑडिटर (क्रिटिक) से अलग करता है।

  • ट्रेनिंग के समय: मॉडल पथों का सपना देखना सीखता है और ऑडिटर सभी संभावित परिणामों के आधार पर उन्हें ग्रेड करना सीखता है।
  • टेस्ट के समय (जब रोबोट वास्तव में चल रहा होता है): आप बिना कुछ पुन: प्रशिक्षित किए एक "रिस्क डायल" (जोखिम डायल) घुमा सकते हैं।
    • रिस्क-अवर्स मोड (जोखिम-विरोधी मोड): आप सिस्टम को बताते हैं, "मुझे सबसे खराब स्थिति की परवाह है।" सिस्टम ऑडिटर के डेटा का उपयोग करके उस पथ से दूर हट जाता है जो हो सकता है कि वहां ले जाए। यह बहुत रूढ़िवादी हो जाता है।
    • रिस्क-न्यूट्रल मोड (जोखिम-तटस्थ मोड): आप इसे कहते हैं, "बस औसत सबसे अच्छा पथ दें।" यह आपदाओं को अनदेखा करता है और माध्य (mean) पर ध्यान केंद्रित करता है।
    • रिस्क-सीकिंग मोड (जोखिम-खोज मोड): आप इसे कहते हैं, "उच्च इनाम के लिए जाओ, भले ही यह खतरनाक हो।" यह उच्च लाभ वाले पथों की ओर मुड़ जाता है, संभावित नुकसानों को अनदेखा करते हुए।

उपमा: मौसम का पूर्वानुमान

कल्प laइए कि आप पिकनिक की योजना बना रहे हैं।

  • पुराना AI (रिस्क-न्यूट्रल): मौसम के पूर्वानुमान को देखता है और कहता है, "औसत तापमान 75°F है। चलिए चलते हैं!" यह 1% टोरनेडो (बवंडर) की संभावना को अनदेखा करता है।
  • RS-Diffuser (रिस्क-सेंसिटिव): "ऑडिटर" आपको पूरा पूर्वानुमान देता है: "75°F औसत, लेकिन 1% टोरनेडो की संभावना और 10% भारी बारिश की संभावना है।"
    • यदि आप डायल को "सुरक्षा प्रथम" पर सेट करते हैं, तो सिस्टम कहता है, "नहीं, टोरनेडो का जोखिम बहुत अधिक है। घर पर ही रहते हैं।"
    • यदि आप डायल को "एडवेंचर" पर सेट करते हैं, तो यह कहता है, "औसत शानदार है, चलिए चलते हैं!"
    • महत्वपूर्ण बात यह है कि सिस्टम को मौसम की भविष्यवाणी करने का नया तरीका सीखने की आवश्यकता नहीं पड़ी; इसने केवल आपके सेटिंग्स के आधार पर उसी भविष्यवाणी डेटा का अलग तरह से उपयोग किया।

यह पेपर क्या दावा करता है

लेखकों ने दो मुख्य प्रकार की चुनौतियों पर इसका परीक्षण किया:

  1. सिम्युलेटेड रोबोट कंट्रोल (D4RL): रोबोट जैसे "Half-Cheetah" या "Walker2D" जिन्हें तेजी से चलना होता है लेकिन यदि वे बहुत आक्रामक रूप से चलते हैं तो गिर सकते हैं या टूट सकते हैं।
  2. जोखिम भरी नेविगेशन: रोबोट जो लक्ष्य तक पहुँचने की कोशिश कर रहे हैं जबकि "खतरे वाले क्षेत्रों" से बच रहे हैं जो भारी दंड (penalties) देते हैं।

परिणाम:

  • बेहतर सुरक्षा: पिछले तरीकों की तुलना में RS-Diffuser ने कम दुर्घटनाएं और सुरक्षा उल्लंघन किए।
  • बेहतर प्रदर्शन: यह केवल सुरक्षित नहीं खेला; इसने अन्य जोखिम-संवेदनशील तरीकों की तुलना में उच्च स्कोर (रिटर्न) भी प्राप्त किया क्योंकि यह सुरक्षा और इनाम के बीच बेहतर संतुलन बना सका।
  • लचीलापन: एक ही प्रशिक्षित मॉडल निर्णय के समय केवल एक नंबर बदलकर सतर्क ड्राइवर, सामान्य ड्राइवर या लापरवाह ड्राइवर के बीच स्विच कर सकता था, बिना किसी पुन: प्रशिक्षण के।

संक्षेप में, RS-Diffuser एक प्लानिंग सिस्टम है जो न केवल भविष्य का अनुमान लगाता है; यह भविष्य के जोखिमों को समझता है और आपको यह तय करने देता है कि आप कितना जोखिम उठाने के लिए तैयार हैं, वह भी एक ही, पूर्व-प्रशिक्षित मॉडल से।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →