← नवीनतम पेपर
🤖 machine learning

Robust Adversarial Policy Optimization Under Dynamics Uncertainty

यह शोध पत्र रोबस्ट एडवर्सरियल पॉलिसी ऑप्टिमाइज़ेशन (RAPO) को प्रस्तुत करता है, जो एक द्वि-रूपांकन ढांचा (dual-formulation framework) है जो तापमान-निर्देशित प्रतिकूल प्रक्षेपवक्र रोलआउट (temperature-steered adversarial trajectory rollouts) को बोल्ट्ज़मैन-पुनःभारित मॉडल नमूनाकरण (Boltzmann-reweighted model sampling) के साथ जोड़कर डायनेमिक्स अनिश्चितता के प्रति सुदृढीकरण शिक्षण (reinforcement learning) की लचीलापन बढ़ाता है ताकि स्थिर, कम रूढ़िवादी और अधिक सामान्यीकरण योग्य नीतियां प्राप्त की जा सकें।

मूल लेखक: Mintae Kim, Koushil Sreenath

प्रकाशित 2026-04-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mintae Kim, Koushil Sreenath

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट कुत्ते को चलना सिखा रहे हैं। आप इसे एक परफेक्ट वीडियो गेम सिमुलेशन में प्रशिक्षित करते हैं जहाँ फर्श हमेशा समतल होता है, हवा स्थिर होती है, और रोबोट के पैर पूरी तरह से संतुलित होते हैं। रोबोट इस "प्रशिक्षण दुनिया" में खूबसूरती से चलना सीख जाता है।

लेकिन फिर, आप रोबोट को बाहर ले जाते हैं। अचानक, जमीन फिसलन भरी हो जाती है, हवा तेज चलने लगती है, और शायद इसके एक पैर का वजन दूसरे से थोड़ा अधिक हो जाता है। क्योंकि रोबोट को केवल "परफेक्ट" संस्करण पर प्रशिक्षित किया गया था, वह तुरंत लड़खड़ा कर गिर जाता है।

यह वह समस्या है जिसे RAPO (Robust Adversarial Policy Optimization) हल करने की कोशिश करता है। यह AI को प्रशिक्षित करने का एक नया तरीका है ताकि वह केवल एक परफेक्ट ट्रेडमिल पर चलना न सीखे, बल्कि वह तूफान, बर्फ और एक टूटे हुए पैर के साथ भी चलना सीख सके, और बिना गिरे या बिगड़े चलता रहे।

यहाँ बताया गया है कि RAPO कैसे काम करता है, सरल अवधारणाओं में:

1. समस्या: "परफेक्ट वर्ल्ड" का जाल

अधिकांश AI प्रशिक्षण उत्तर कुंजी (answer key) को देखकर परीक्षा की तैयारी करने जैसा है। AI "नॉमिनल" (औसत) दुनिया को पूरी तरह से सीख लेता है। लेकिन वास्तविक दुनिया अव्यवस्थों से भरी है।

  • पुराना तरीका 1 (डोमेन रैंडमाइजेशन): यह रोबोट को हर कदम के लिए फर्श की बनावट, हवा की गति और पैर के वजन को बेतरतीब ढंगते हुए प्रशिक्षित करने जैसा है। यह मदद तो करता है, लेकिन यह एक हल्की हवा को भी तूफान के समान ही मानता है। यह अक्षम है और अक्सर रोबोट को बहुत अधिक सतर्क बना देता है (वह कछुए की तरह चलता है क्योंकि उसे डर रहता है कि कहीं कुछ गलत न हो जाए)।
  • पुराना तरीका 2 (एडवरसैरियल ट्रेनिंग): यह एक "बुरे आदमी" को प्रशिक्षण के दौरान रोबोट को गिराने की कोशिश करने जैसा है। समस्या यह है कि वह बुरा आदमी बहुत ज्यादा पागल हो सकता है, जिससे रोबलेट अस्थिर हो जाता है, या वे केवल रोबोट को गिराने के एक विशिष्ट तरीके पर ध्यान केंद्रित कर सकते हैं, जिससे अन्य खतरों की अनदेखी हो जाती है।

2. समाधान: RAPO का दो-तरफा हमला

RAPO महसूस करता है कि वास्तव में मजबूत होने के लिए, आपको एक साथ दो अलग-अलग चीजों पर ध्यान देने की आवश्यकता है:

  1. विशिष्ट क्षण: "ओह नहीं, मैं अभी बर्फ के एक टुकड़े पर कदम रख रहा हूँ।"
  2. बड़ी तस्वीर: "रुको, जिस पूरी दुनिया में मैं हूँ, वह मेरी सोच से थोड़ी अलग हो सकती है (जैसे, गुरुत्वाकर्षण अधिक शक्तिशाली है)।"

RAPO इन दोनों को संभालने के लिए दो विशेष उपकरणों का उपयोग करता है:

टूल A: "स्ट्रेस-टेस्ट" नेटवर्क (AdvNet)

  • रूपक (Metaphor): एक कोच की कल्पना करें जो रोबोट को चलते हुए देखता है और तुरंत फुसफुसाता है, "हे, अभी के लिए, मान लो कि फर्श 10% अधिक फिसलन भरा है।"
  • यह कैसे काम करता है: यह एक न्यूरल नेटवर्क है जिसे AdvNet कहा जाता है। केवल रोबोट को सामान्य रूप से चलने देने के बजाय, AdvNet वर्तमान स्थिति को देखता है और कहता है, "यदि हम भौतिकी (physics) को अभी थोड़ा सा बदल दें, तो रोबोट गिर जाएगा। चलिए उस विशिष्ट विफलता का अभ्यास करते हैं।"
  • जादू: यह केवल सबसे खराब स्थिति को बेतरतीब ढंग से नहीं चुनता। यह वर्तमान नियमों को देखते हुए सबसे संभावित विफलता को खोजने के लिए एक गणितीय "तापमान" (temperature) नॉब का उपयोग करता है। यह रोबोट को घबराहट के बिना विशिष्ट, कठिन क्षणों से उबरना सीखने के लिए मजबूर करता है।

टूल B: "चिंता सूची" (Boltzmann Reweighting)

  • रूपक: कल्पना करें कि आपके पास 100 अलग-अलग "दुनियाओं" की एक लाइब्रेरी है (कुछ भारी गुरुत्वाकर्षण वाली, कुछ फिसलन भरे फर्श वाली, कुछ तेज हवाओं वाली)। एक सामान्य ट्रेनर एक दुनिया को बेतरतीब ढंग से चुनता है। RAPO का ट्रेनर रोबोट के वर्तमान कौशल को देखता है और कहता है, "रोबोट भारी गुरुत्वाकर्षण में चलने में बहुत बुरा है। तो आइए अपना 80% समय भारी गुरुत्वाकर्षण में अभ्यास करने में बिताएं और केवल 20% हल्का गुरुत्वाकर्षण में।"
  • यह कैसे काम करता है: यह लगातार एक "चिंता सूची" को अपडेट करता है। यदि रोबोट किसी विशिष्ट प्रकार के वातावरण (जैसे भारी भार) के साथ संघर्ष कर रहा है, तो सिस्टम स्वचालित रूप से उस विशिष्ट कठिनाई पर अधिक प्रशिक्षण समय केंद्रित करता है। यह आसान चीजों को अनदेखा करता है और कठिन चीजों का अभ्यास कराता है।

3. वे एक साथ कैसे काम करते हैं

RAPO को एक मास्टर शेफ द्वारा एक सहायक शेफ (sous-chef) को प्रशिक्षित करने के रूप में सोचें:

  • AdvNet चूल्हे के ठीक बगल में खड़ा शेफ है, जो चिल्ला रहा है, "सावधान! पैन अभी सामान्य से अधिक गर्म है!" (ट्रैजेक्टरी-लेवल स्ट्रेस)।
  • Boltzmann Rewealing मेनू को देख रहा शेफ है जो कहता है, "हम सुफ्ले (soufflés) बनाने में बहुत बुरे हैं, इसलिए आइए ऑमलेट का अभ्यास करना बंद करें और पूरी दोपहर सुफ्ले बनाने में बिताएं।" (मॉडल-लेवल फोकस)।

इन दोनों को जोड़कर, रोबोट तात्कालिक आश्चर्यों (एक अचानक फिसलन) और प्रणालीगत परिवर्तनों (एक पूरी तरह से नया वातावरण) दोनों को संभालने के लिए तैयार होता है।

4. परिणाम: "अभेद्य" रोबोट

जब लेखकों ने Walker2d रोबोट डॉग और एक भारी पैकेज ले जाने वाले ड्रोन पर RAPO का परीक्षण किया:

  • मानक AI (PPO): प्रशिक्षण दुनिया में बहुत अच्छा चला, लेकिन जैसे ही हवा चली या वजन बदला, वह गिर गया।
  • पुराना मजबूत AI: बहुत सुरक्षित था लेकिन बहुत धीरे और अनाड़ी तरीके से चला, जैसे कि वह अपनी ही छाया से डर रहा हो।
  • RAPO: सामान्य स्थितियों में मानक AI की तरह ही तेज और सुचारू रूप से चला, लेकिन जब उन्होंने इसमें अत्यधिक अराजकता (भारी हवाएं, टूटे हुए हिस्से, अजीब वजन) डाली, तो यह बिना गिरे चलता रहा।

सारांश

RAPO प्रशिक्षण का एक स्मार्ट तरीका है। केवल यह उम्मीद करने के बजाय कि AI संयोग से सब कुछ सीख लेगा, यह एक दोहरी रणनीति का उपयोग करता है:

  1. माइक्रो-लेवल: एक स्मार्ट नेटवर्क जो वर्तमान क्षण में विशिष्ट "फिसलने के खतरों" को खोजता है।
  2. मैक्रो-लेवल: एक स्मार्ट शेड्यूलर जो प्रशिक्षण का समय उन विशिष्ट वातावरणों पर केंद्रित करता है जहाँ AI वर्तमान में सबसे कमजोर है।

यह एक पायलट को केवल अच्छे मौसम में उड़ान भरने के लिए प्रशिक्षित करने के बजाय, एक ऐसे सिम्युलेटर के होने जैसा है जो जानता है कि पायलट किन युद्धाभ्यास (maneuvers) में बुरा है और उन्हें उन विशिष्ट युद्धाभ्यासों का अभ्यास करने के लिए मजबूर करता है जब तक कि वे उनमें परफेक्ट न हो जाएं। परिणाम एक ऐसा AI है जो वास्तविक, अव्यवस्थपूर्ण और अप्रत्याशित दुनिया के लिए तैयार है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →