← नवीनतम पेपर
💻 computer science

Safety-Constrained Reinforcement Learning with Post-Training Reachability Verification for Robot Navigation

यह शोध पत्र एक सुरक्षा-प्रतिबंधित सुदृढीकरण शिक्षण (reinforcement learning) ढांचे का प्रस्ताव करता है जो रोबोट नेविगेशन को सुदृढ़ बनाने के लिए प्रशिक्षण के दौरान 'कंडीशनल वैल्यू-एट-रिस्क' (CVaR) अनुकूलन को प्रशिक्षण के पश्चात न्यूरल नेटवर्क पहुंच योग्यता सत्यापन (reachability verification) के साथ जोड़ता है, यह प्रदर्शित करते हुए कि जोखिम-संवेदनशील नीतियां केवल औसत लागत मेट्रिक्स पर निर्भर विधियों की तुलना में बेहतर औपचारिक सुरक्षा मार्जिन और सिम-टू-रियल स्थानांतरण प्राप्त करती हैं।

मूल लेखक: Qisong He, Xinmiao Huang, Jinwei Hu, Zhuoyun Li, Yi Dong, Changshun Wu, Xiaowei Huang

प्रकाशित 2026-05-15
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Qisong He, Xinmiao Huang, Jinwei Hu, Zhuoyun Li, Yi Dong, Changshun Wu, Xiaowei Huang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट कुत्ते को लोगों या पेड़ों से टकराए बिना एक भीड़भाड़ वाले पार्क में दौड़ना सिखा रहे हैं।

समस्या: "औसत" का जाल
वर्तमान में अधिकांश तरीके रोबोट को उसके "औसत" प्रदर्शन को देखकर सिखाते हैं। यदि रोबोट 100 बार दौड़ता है और केवल एक बार पेड़ से टकराता है, तो शिक्षक कहता है, "बहुत अच्छा! आप 99% सुरक्षित हैं।"

लेकिन यहाँ एक पेंच है: वह एक बार जब वह पेड़ से टकराया, तो वह एक आपदा हो सकती थी। "औसत" स्कोर इस तथ्य को छिपा देता है कि रोबोट कभी-कभी खतरनाक, जोखिम भरे शॉर्टकट लेता है। यह एक ऐसे ड्राइवर की तरह है जो 99 बार बिल्कुल सही गाड़ी चलाता है लेकिन 100वीं बार खतरनाक गति से गाड़ी चलाता है। यदि आप केवल औसत गति देखते हैं, तो आप खतरे को नहीं देख पाते।

समाधान: एक दो-चरणीय सुरक्षा प्रणाली
इस शोध पत्र के लेखकों ने, जो अपने सिस्टम को VIA कहते हैं, रोबोट को प्रशिक्षित करने और जांचने का एक स्मार्ट तरीका प्रस्तावित किया है। वे एक दो-चरणीय प्रक्रिया का उपयोग करते हैं:

चरण 1: "सबसे खराब स्थिति" की मानसिकता के साथ प्रशिक्षण

केवल रोबोट को औसत रूप से सुरक्षित होने के लिए सिखाने के बजाय, वे इसे सबसे खराब परिदृश्यों (worst-case scenarios) से डरना सिखाते हैं।

  • उपमा: कल्पना कीजिए कि एक छात्र परीक्षा के लिए पढ़ाई कर रहा है।
    • पुराना तरीका: शिक्षक कहता है, "पिछले 10 क्विज़ में आपने 90% अंक प्राप्त किए हैं। आप तैयार हैं।"
    • VIA का तरीका: शिक्षक कहता है, "आपने औसतन 90% प्राप्त किया है, लेकिन आपने पिछले तीन क्विज़ के सबसे कठिन प्रश्न में फेल हो गए थे। आपको विशेष रूप से उन कठिन प्रश्नों के लिए अध्ययन करने की आवश्यकता है ताकि आप उन्हें दोबारा कभी गलत न करें।"
  • यह कैसे काम करता है: रोबोट को CVaR (कंडीशनल वैल्यू-एट-रिस्क) नामक एक गणितीय अवधारणा का उपयोग करके प्रशिक्षित किया जाता है। यह रोबोट को वितरण के "पूंछ" (tail) पर ध्यान केंद्रित करने के लिए मजबूर करता है—वे दुर्लभ, डरावने क्षण जहाँ चीजें गलत हो जाती हैं। यह रोबोट को अत्यधिक सतर्क होना सिखाता है, जिससे वह केवल औसत दुर्घटना दर के बजाय, दुर्घटना की संभावना को भी टाल सके।

चरण 2: "सुरक्षा जाल" की जाँच (रीचेबिलिटी वेरिफिकेशन)

रोबोट के प्रशिक्षित होने के बाद, लेखक केवल प्रशिक्षण स्कोर पर भरोसा नहीं करते हैं। वे रोबोट को वास्तविक दुनिया में छोड़ने से पहले एक कठोर, गणितीय "तनाव परीक्षण" (stress test) चलाते हैं।

  • उपमा: रोबोट के निर्णय लेने की प्रक्रिया को एक टॉर्च की रोशनी की तरह समझें।
    • जब रोबलेट एक पेड़ देखता है, तो उसके सेंसर थोड़े धुंधले (noise) हो सकते हैं।
    • एक सामान्य रोबोट कह सकता है, "पेड़ शायद वहाँ है," और एक रास्ता अनुमान लगा सकता है।
    • VIA रोबोट एक "रीचेबल सेट" (reachable set) की गणना करता है। यह हर उस संभावित पथ के चारों ओर एक मोटा, धुंधला ट्यूब बनाने जैसा है जिसे रोबोट ले सकता है यदि उसके सेंसर थोड़े गलत हों।
    • जाँच: सिस्टम पूछता है, "क्या यह पूरा धुंधला ट्यूब पेड़ से टकराता है?"
    • यदि उत्तर "हाँ, ट्यूब का किनारा भी पेड़ को छूता है" है, तो रोबोट को असुरक्षित घोषित कर दिया जाता है, भले ही पथ का "केंद्र" ठीक दिख रहा हो।

उन्होंने क्या पाया

शोधकर्ताओं ने एक सिमुलेशन में एक रोबोट पर और फिर एक लैब में एक वास्तविक रोबोट (Clearpath Jackal) पर इसका परीक्षण किया।

  1. बेहतर सुरक्षा: पारंपरिक तरीकों से प्रशिक्षित रोबोटों की तुलना में VIA रोबोट बहुत कम बार दुर्घटनाग्रस्त हुआ।
  2. "औसत" का झूठ: उन्होंने पाया कि कुछ रोबोटों के "औसत" स्कोर बहुत अच्छे थे लेकिन वे सुरक्षा जाल की जाँच में विफल रहे। वे कागजों पर सुरक्षित दिखते थे लेकिन वास्तव में सेंसर के धुंधलेपन के कारण जोखिम भरे थे।
  3. वास्तविक दुनिया में सफलता: जब उन्होंने प्रशिक्षित रोबोट को एक वास्तविक कमरे में एक वास्तविक रोबोट पर रखा, तो इसने अच्छी तरह से काम करना जारी रखा। "सुरक्षा जाल" की जाँच ने साबित कर दिया कि रोबोट वास्तविक दुनिया के सेंसर शोर (sensor noise) के साथ भी सुरक्षित रहेगा।

संक्षेप में
यह शोध पत्र तर्क देता है कि रोबोटों को वास्तव में सुरक्षित बनाने के लिए, आप केवल उनके औसत प्रदर्शन को नहीं देख सकते। आपको उन्हें सबसे खराब परिदृश्यों का सम्मान करना सिखाना होगा और फिर गणितीय रूप से यह सिद्ध करना होगा कि, यदि उनके सेंसर थोड़े गलत भी हों, तो भी वे गलती से किसी चीज़ से नहीं टकराएंगे। VIA यह दोनों करता है, जिससे एक ऐसा रोबोट बनता है जो न केवल "आमतौर पर" सुरक्षित है, बल्कि "प्रमाणित रूप से" सुरक्षित है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →