← नवीनतम पेपर
🤖 machine learning

CRAX: Fast Safe Reinforcement Learning Benchmarking

CRAX एक तेज़ और सुरक्षित सुदृढीकरण शिक्षण (reinforcement learning) बेंचमार्क है जो MuJoCo XLA भौतिक इंजन पर निर्मित है और जो हार्डवेयर त्वरण का लाभ उठाकर मौजूदा CPU-आधारित सुरक्षा बेंचमार्क की तुलना में 100x तक की गति प्राप्त करता है, जिससे विविध वातावरणों में सुरक्षित RL विधियों के बड़े पैमाने पर मूल्यांकन को सक्षम बनाया जा सके और प्रदर्शन-सुरक्षा व्यापार-समझौतों (performance-safety trade-offs) तथा पाठ्यक्रम सीखने (curriculum learning) के लाभों के बारे में प्रमुख अंतर्दृष्टि को उजागर किया जा सके।

मूल लेखक: Tristan Tomilin, Mourad Boustani, Mickey Beurskens, Thiago D. Simão

प्रकाशित 2026-06-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tristan Tomilin, Mourad Boustani, Mickey Beurskens, Thiago D. Simão

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को बारूदी सुरंगों (minefield) के बीच से चलना सिखा रहे हैं। आपका लक्ष्य रोबोट को जल्द से जल्द फिनिश लाइन तक पहुँचाना है (इनाम/Reward), लेकिन आपको यह सुनिश्चित करना होगा कि वह कभी भी किसी बारूदी सुरंग पर पैर न रखे (सुरक्षा प्रतिबंध/Safety Constraint)। यदि वह किसी सुरंग पर पैर रखता है, तो उसे एक "लागत" (cost) दंड मिलता है। चुनौती सही संतुलन खोजने की है: बहुत तेज़ जाना मतलब बारूदी सुरंग से टकरा जाना हो सकता है, लेकिन बहुत धीरे चलना मतलब कभी खत्म न कर पाना।

यह सेफ रीइन्फोर्समेंट लर्निंग (Safe RL) की मूल समस्या है।

लेखक CRAX नामक एक नया टूल पेश करते हैं जो शोधकर्ताओं को इस समस्या को तेज़ी से और बेहतर तरीके से हल करने में मदद करता है। यहाँ उन्होंने जो किया है, उसका विवरण सरल उपमाओं (analogies) का उपयोग करके दिया गया है।

1. समस्या: "स्लो मोशन" की बाधा

पहले, इन रोबोटों का परीक्षण करने वाले शोधकर्ताओं को भौतिकी (physics) को सिम्युलेट करने के लिए मानक कंप्यूटर प्रोसेसर (CPUs) का उपयोग करना पड़ता था।

  • उपमा: कल्पना कीजिए कि आप एक मैराथन धावक को प्रशिक्षित कर रहे हैं, लेकिन हर बार जब वह एक कदम लेता है, तो भौतिकी की गणना करने के लिए सिमुलेशन एक सेकंड के लिए रुक जाता है। एक पूरा मैराथन दौड़ने के लिए, आपको वर्षों तक इंतजार करना होगा।
  • वास्तविकता: मौजूदा सुरक्षा बेंचमार्क सटीक थे लेकिन अविश्वसनीय रूप से धीमे थे। इससे सर्वोत्तम प्रशिक्षण विधियों को खोजने के लिए हजारों प्रयोग करना कठिन हो गया था।

2. समाधान: CRAX (एक "टर्बो-चार्ज्ड" सिम्युलेटर)

लेखकों ने CRAX बनाया है (Constrained RL Accelerated with JAX)।

  • उपमा: एक समय में एक धावक को एक धीमी ट्रैक पर प्रशिक्षित करने के बजाय, CRAX एक विशाल स्टेडियम बनाता है जहाँ हजारों रोबोट एक विशेष ग्राफ़िक्स कार्ड (GPUs) द्वारा संचालित सुपर-फास्ट ट्रैक पर एक साथ दौड़ रहे हैं।
  • परिणाम: यह पिछले टूल्स की तुलना में लगभग 100 गुना तेज़ है। पेपर का दावा है कि जिस कार्य को पुराने कंप्यूटरों पर सिम्युलेट करने में एक साल लगता था, वह अब उनके नए सिस्टम पर केवल दो सप्ताह में पूरा हो जाता है।

3. खेल का मैदान: छह अलग-अलग "बारूदी सुरंगें"

CRAX केवल एक गेम नहीं है; यह छह अलग-अलग वातावरणों का एक संग्रह है, जिनमें से प्रत्येक में एक अलग प्रकार का रोबोट और एक अलग प्रकार का खतरा है। इसे एक वीडियो गेम की तरह समझें जिसमें अलग-अलग स्तर (levels) हैं:

  • सेफ गोल (Safe Goal): एक रोबोट को तैरते हुए खतरों से बचते हुए एक लक्ष्य तक पहुँचना होता है।
  • सेफ पुश (Safe Push): एक रोबोट को बाधाओं से टकराए बिना एक भारी बॉक्स को लक्ष्य तक धकेलना होता है।
  • सेफ स्पाइडर (Safe Spider): एक छह पैरों वाले रोबोट को आगे बढ़ना होता है जबकि विशिष्ट पैरों को हवा में रखना होता है (जैसे एक ऊँची तार पर चलने का करतब)।
  • सेफ हाइट (Safe Height): एक रोबोट को आगे बढ़ना होता है लेकिन ज़मीन के करीब रहना होता है, जैसे किसी कम ऊँचाई वाली छत के नीचे झुकना।
  • सेफ पाथवे (Safe Pathway): एक रोबोट को एक पथ पर कूदना होता है जहाँ "गलत" जगहों पर कदम रखने से दंड मिलता है।
  • सेफ वेलोसिटी (Safe Velocity): एक रोबोट को तेज़ी से दौड़ना होता है लेकिन कभी भी एक विशिष्ट गति सीमा से अधिक नहीं होना चाहिए।

इनमें से प्रत्येक गेम में तीन कठिनाई स्तर हैं:

  1. आसान (Easy): कम बाधाएं, गलती की गुंजाइश अधिक।
  2. मध्यम (Medium): अधिक बाधाएं, तंग जगह।
  3. कठिन (Hard): एक अराजक बारूदी सुरंग जहाँ रोबोट को अत्यंत सटीक होना चाहिए।

4. प्रयोग: दौड़ में कौन जीतता है?

शोधकर्ताओं ने इस नए, तेज़ खेल के मैदान में छह लोकप्रिय AI प्रशिक्षण विधियों (एल्गोरिदम) का परीक्षण किया ताकि यह देखा जा सके कि गति और सुरक्षा के बीच संतुलन बनाने में कौन सा सबसे अच्छा है।

  • निष्कर्ष: कोई एक एकल "चैंपियन" नहीं था।
    • कुछ विधियाँ बहुत सुरक्षित थीं लेकिन बहुत धीरे चलती थीं (जैसे एक सतर्क कछुआ)।
    • कुछ तेज़ी से चलती थीं लेकिन अक्सर टकरा जाती थीं (जैसे एक लापरवाह रेसर)।
    • P3O और FOCOPS सबसे मजबूत समग्र प्रदर्शन करने वाले थे, जो अधिकांश परिदृश्यों में सुरक्षित रहते हुए उच्च स्कोर प्राप्त करने में सक्षम रहे।
    • PPOLag सबसे सुरक्षित था (यह लगभग कभी नहीं टकराता), लेकिन यह अक्सर उच्चतम स्कोर नहीं प्राप्त कर पाता था।

5. "ट्रेनिंग कैंप" की खोज (करिकुलम लर्निंग)

शोधकर्ताओं ने एक विशिष्ट प्रशिक्षण रणनीति का परीक्षण किया जिसे करिकुलम लर्निंग (Curriculum Learning) कहा जाता है।

  • उपमा: किसी छात्र को तुरंत अंतिम परीक्षा में डालने के बजाय, आप उन्हें बुनियादी बातें सिखाते हैं, फिर मध्यम स्तर की समस्याएं, और अंत में कठिन परीक्षा।
  • परिणाम: यह काम कर गया! कई रोबोटों के लिए, "आसान" स्तर से शुरू करना और धीरे-धीरे "कठिन" स्तरों की ओर बढ़ना उन्हें सीधे कठिन स्तर में फेंक दिए जाने की तुलना में बेहतर सीखने में मदद करता है। यह एक ढलान वाली पहाड़ी पर साइकिल चलाने की कोशिश करने से पहले समतल रास्ते पर साइकिल चलाना सीखने जैसा है।

6. यह क्यों महत्वपूर्ण है (पेपर के अनुसार)

पेपर यह दावा नहीं करता है कि यह तुरंत सेल्फ-ड्राइविंग कारों को ठीक कर देगा या अस्पतालों में जीवन बचाएगा। इसके बजाय, यह दावा करता है कि यह वैज्ञानिकों के लिए एक उपकरण है।

  • क्योंकि CRAX बहुत तेज़ है, शोधकर्ता अब उन विशाल प्रयोगों को चला सकते हैं जो पहले असंभव थे।
  • यह उन्हें यह पता लगाने के लिए कई विचारों का तेज़ी से परीक्षण करने की अनुमति देता है कि जटिल 3D दुनिया में AI एजेंटों को सुरक्षित और अधिक कुशल कैसे बनाया जाए।

संक्षेप में: CRAX एक सुपर-फास्ट, GPU-पावर्ड वीडियो गेम इंजन है जिसे विशेष रूप से रोबोटों को लापरवाह हुए बिना तेज़ होना सिखाने के लिए डिज़ाइन किया गया है। इसने साबित कर दिया कि हालांकि अभी तक कोई भी एक AI विधि पूर्ण नहीं है, लेकिन रोबोटों को धीरे-धीरे (आसान से कठिन की ओर) प्रशिक्षित करना उन्हें बेहतर सीखने में मदद करता है, और इस क्षेत्र में प्रगति करने के लिए एक तेज़ सिम्युलेटर आवश्यक है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →