← नवीनतम पेपर
🤖 machine learning

Decoupled Guidance Diffusion for Adaptive Offline Safe Reinforcement Learning

यह शोध पत्र सेफ डिकपल्ड गाइडेंस डिफ्यूजन (SDGD) को प्रस्तुत करता है, जो एक नवीन ऑफलाइन सेफ रीइन्फोर्समेंट लर्निंग फ्रेमवर्क है जो लागत-सशर्त क्लासिफायर-फ्री गाइडेंस को फिजिबल ट्रेजेक्टरी रिलेबलिंग के साथ जोड़कर सुरक्षा बाधाओं को रिवॉर्ड ऑप्टिमाइजेशन से प्रभावी ढंग से अलग करता है, जिससे एडेप्टिव बजट परिदृश्यों में बेहतर सुरक्षा अनुपालन और उच्च रिटर्न प्राप्त होता है।

मूल लेखक: Rufeng Chen, Zhaofan Zhang, Zhejiang Yang, Hechang Chen, Sihong Xie

प्रकाशित 2026-05-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rufeng Chen, Zhaofan Zhang, Zhejiang Yang, Hechang Chen, Sihong Xie

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कार चलाना सिखा रहे हैं, लेकिन आपके पास केवल पुराने वीडियो रिकॉर्डिंग हैं कि अन्य कारों ने अतीत में कैसे गाड़ी चलाई थी। आप रोबोट को सीखने के लिए इधर-उधर चलाने और दुर्घटनाग्रस्त होने की अनुमति नहीं दे सकते; उसे केवल उस पुराने फुटेज से ही सीखना होगा। यह ऑफलाइन रीइन्फोर्समेंट लर्निंग (Offline Reinforcement Learning) है।

अब, एक मोड़ जोड़ें: कभी-कभी आप चाहते हैं कि रोबोट बहुत सावधान रहे (जैसे स्कूल ज़ोन में गाड़ी चलाते समय), और कभी-कभी आप चाहते हैं कि वह थोड़ा आक्रामक हो (जैसे खुले हाईवे पर ड्राइविंग के दौरान)। "सुरक्षा बजट" (safety budget) स्थिति के आधार पर बदलता रहता है। यह एडेप्टिव सेफ रीइन्फोर्समेंट लर्निंग (Adaptive Safe Reinforcement Learning) है।

समस्या यह है कि अधिकांश मौजूदा तरीके एक ऐसे छात्र की तरह हैं जो एक विशिष्ट गति सीमा के लिए एक विशिष्ट मार्ग को रटने की कोशिश कर रहा है। यदि गति सीमा बदल जाती है, तो वे भ्रमित हो जाते हैं या दुर्घटनाग्रस्त हो जाते हैं।

यहाँ इस पेपर का नया तरीका, SDGD, इसे सरल उपमाओं के माध्यम से समझाता है:

1. पुराना तरीका: "चरण-दर-चरण" बनाम "धुंधली फोटो"

  • पुराना तरीका (ऑटोरेग्रेसिव मॉडल्स): कल्पना कीजिए कि आप एक लंबा, घुमावदार रास्ता बनाने की कोशिश कर रहे हैं, पहले एक छोटा सा हिस्सा बनाते हैं, फिर अगला, फिर अगला। यदि आप पहले हिस्से में एक छोटी सी गलती करते हैं, तो अगले हिस्से को उसकी भरपाई करनी पड़ती है, और अंत तक, आपका रास्ता नक्शे से पूरी तरह बाहर हो जाता है। पुराने AI प्लानर्स इसी तरह काम करते थे; वे छोटी गलतियाँ करते थे जो जमा होती जाती थीं, जिससे रोबोट सुरक्षा नियमों का उल्लंघन कर देता था।
  • नया तरीका (डिफ्यूजन मॉडल्स): कल्पना कीजिए कि आप एक साथ पूरे रास्ते की एक धुंधली, शोर वाली फोटो लेते हुए उसे धीरे-धीरे साफ कर रहे हैं जब तक कि पूरा रास्ता स्पष्ट न हो जाए। डिफ्यूजन (Diffusion) यही करता है। यह पूरी यात्रा को एक साथ बनाता है, ताकि छोटी गलतियाँ जमा न हो सकें।

2. मुख्य समस्या: "सुरक्षा" और "गति" का मिश्रण

अतीत में, AI ने सुरक्षा और गति को दो विपरीत ताकतों के रूप में व्यवहार करके संतुलित करने की कोशिश की जो रोबोट को अलग-अलग दिशाओं में खींच रही थीं।

  • उपमा: कल्पना कीजिए कि एक ड्राइवर को कहा गया है, "जितनी हो सके उतनी तेज़ चलो, लेकिन दीवार से मत टकराना।" AI उस सटीक कोण की गणना करने की कोशिश करेगा जिससे वह तेज़ भी जा सके और सुरक्षित भी रहे। लेकिन यदि "दीवार" (सुरक्षा सीमा) हिल जाती है, तो AI भ्रमित हो जाता है। वह अक्सर तेज़ चलने की कोशिश करता है और गलती से दीवार से टकरा जाता है क्योंकि उसने सोचा था कि दीवार कहीं और है।

3. SDGD समाधान: "दो कोच" वाला सिस्टम

लेखकों ने महसूस किया कि सुरक्षा और गति को एक-दूसरे से लड़ना नहीं चाहिए; उनके पास अलग-अलग काम होने चाहिए। उन्होंने दो अलग-अलग "कोच" वाला एक सिस्टम बनाया:

  • कोच 1: सुरक्षा प्रवर्तक (क्लासिफायर-फ्री गाइडेंस)

    • काम: यह कोच "सुरक्षा बजट" को देखता है (जैसे, "आज आप जोखिम पर केवल 10 अंक खर्च कर सकते हैं")।
    • कार्रवाई: यह सटीक कोण की गणना करने की कोशिश नहीं करता। इसके बजाय, यह बस कहता है, "यदि आपके द्वारा बनाया गया रास्ता 'खतरे के क्षेत्र' में जाता है (बजट से ऊपर), तो इसे मिटा दें और दोबारा बनाएं।" यह एक फिल्टर की तरह काम करता है जो केवल सुरक्षित रास्तों को ही अस्तित्व में रहने देता है। इसे इससे फर्क नहीं पड़ता कि आप कितनी तेज़ चलते हैं, बस इससे फर्क पड़ता है कि आप सीमाओं के भीतर रहें।
  • कोच 2: स्पीड कोच (रिवॉर्ड-ग्रेडिएंट गाइडेंस)

    • काम: यह कोच सुरक्षित रास्तों को देखता है और कहता है, "इन सभी सुरक्षित रास्तों में से, कौन सा आपको सबसे तेज़ी से फिनिश लाइन तक पहुँचाएगा?"
    • कार्रवाई: यह रोबोट को सबसे तेज़ सुरक्षित मार्ग की ओर धकेलता है।

जादू: इन दोनों कामों को अलग करके, रोबोट तुरंत "स्कूल ज़ोन मोड" (सख्त सुरक्षा बजट) से "हाईवे मोड" (ढीला बजट) में स्विच कर सकता है, बस कोच 1 को नियम बदलने के लिए कहकर। इसे फिर से सीखने की आवश्यकता नहीं है।

4. चालाक जाल: "फिजिबल ट्रेजेक्टरी रिलेबलिंग" (FTR)

एक पेच था। दो कोचों के साथ भी, "स्पीड कोच" लालची हो सकता है।

  • समस्या: कभी-कभी, उच्च स्कोर प्राप्त करने का सबसे तेज़ तरीका यात्रा की शुरुआत में एक बड़ा जोखिम लेना होता है। यदि रोबोट वह जोखिम लेता है, तो वह तुरंत दुर्घटनाग्रस्त हो सकता है, लेकिन "स्पीड कोच" उच्च संभावित स्कोर देखता है और कहता है, "इसके लिए जाओ!"
  • समाधान (FTR): लेखकों ने फिजिबल ट्रेजेक्टरी रिलेबलिंग (Feasible Trajectory Relabeling) नामक एक नियम पेश किया।
    • उपमा: कल्पना कीजिए कि एक छात्र टेस्ट में 'A' ग्रेड पाता है लेकिन उसने पहले प्रश्न पर नकल की थी। शिक्षक (FTR) कहता है, "भले ही तुम्हें 'A' मिला हो, क्योंकि तुमने पहले भाग में नकल की है, हम तुम्हारे पूरे टेस्ट को 'F' मार्क करेंगे।"
    • यह कैसे काम करता है: सिस्टम रोबोट की योजना के पहले कुछ चरणों को देखता है। यदि वे शुरुआती कदम खतरनाक हैं (भले ही बाकी की योजना शानदार दिख रही हो), तो सिस्टम "स्पीड कोच" को बताता है, "इस रास्ते के लिए क्रेडिट मत दो।" यह रोबोट को उच्च स्कोर पाने के लिए खतरनाक शॉर्टकट लेने से रोकता है।

5. परिणाम: सही संतुलन

शोधकर्ताओं ने इसका परीक्षण 38 विभिन्न ड्राइविंग और रोबोटिक्स कार्यों पर किया (जैसे एक कार जो बटन दबाने की कोशिश कर रही है या एक ड्रोन जो कोर्स के बीच से उड़ रहा है)।

  • स्कोर: उनका तरीका (SDGD) 38 में से 36 कार्यों में नियमों को पास करने के लिए पर्याप्त सुरक्षित था।
  • प्रदर्शन: सभी तरीकों में से जो सुरक्षित थे, उनमें से SDGD 21 कार्यों में सबसे तेज़ (उच्चतम रिवॉर्ड) था।
  • लचीलापन: वे रोबोट के चलते समय सुरक्षा नियमों को बदल सकते थे, और रोबोट बिना पुन: प्रशिक्षित हुए तुरंत अनुकूलित हो गया।

सारांश

SDGD को एक स्मार्ट नेविगेशन सिस्टम के रूप में सोचें जो केवल सबसे तेज़ रास्ता ही नहीं निकालता।

  1. यह पहले एक ऐसा नक्शा बनाता है जिसमें केवल वे सड़कें शामिल हैं जो आपकी वर्तमान गति सीमा के लिए कानूनी हैं (सुरक्षा कोच)।
  2. फिर, यह उस कानूनी नक्शे में से सबसे तेज़ मार्ग चुनता है (स्पीड कोच)।
  3. इसमें एक विशेष नियम है जो कहता है, "यदि पहला मोड़ अवैध है, तो पूरा मार्ग अवैध है," जो सिस्टम को तेज़ समय पाने के लिए धोखाधड़ी करने से रोकता है।

यह रोबोट को सुरक्षित और कुशल बनाता है, भले ही सड़क के नियम चलते समय बदल रहे हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →