← नवीनतम पेपर
🤖 machine learning

Lipschitz-Regularized Critics Lead to Policy Robustness Against Transition Dynamics Uncertainty

यह शोध पत्र PPO-PGDLC का प्रस्ताव करता है, जो एक सुदृढ़ सुदृढ़ीकरण लर्निंग (reinforcement learning) एल्गोरिदम है जो ट्रांज़िशन डायनेमिक्स अनिश्चितता को प्रभावी ढंग से कम करने और सिम्युलेटेड एवं वास्तविक दुनिया के रोबोटिक कार्यों में पॉलिसी प्रदर्शन को बढ़ाने के लिए प्रोजेक्टेड ग्रेडिएंट डिसेंट को लिप्सचिट्ज़-रेगुलराइज्ड क्रिटिक के साथ जोड़ता है।

मूल लेखक: Xulin Chen, Ruipeng Liu, Zhenyu Gan, Garrett E. Katz

प्रकाशित 2026-07-09
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xulin Chen, Ruipeng Liu, Zhenyu Gan, Garrett E. Katz

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट कुत्ते को पार्क में दौड़ना सिखा रहे हैं। आप इसे एक परफेक्ट वीडियो गेम सिमुलेशन में प्रशिक्षित करते हैं जहाँ घास हमेशा एक जैसी रहती है, हवा हमेशा स्थिर रहती है, और रोबोट के पैर कभी थकते नहीं हैं। लेकिन जब आप असली रोबोट को बाहर भेजते हैं, तो हवा चलती है, ज़मीन कीचड़ भरी होती है, और रोबोट के पैर आपके अनुमान से थोड़े भारी हो सकते हैं। यह "सिम-टू-रियल" (sim-to-real) गैप है: वास्तविक दुनिया अव्यवस्थित है, और रोबोट अक्सर इसलिए लड़खड़ा जाता है क्योंकि उसने केवल एक आदर्श मंच पर नृत्य करना सीखा था।

आप जो पेपर पढ़ रहे हैं, PPO-PGDLC, इन रोबोटों को प्रशिक्षित करने का एक नया तरीका प्रस्तावित करता है ताकि जब दुनिया अव्यवस्थित हो जाए तो वे लड़खड़ाएं नहीं। यह कैसे काम करता है, इसके लिए कुछ मजेदार उपमाओं का उपयोग करें।

समस्या: रोबोट का "पैनिक बटन" (घबराहट का बटन)

मानक रोबोट प्रशिक्षण में, रोबोट यह अनुमान लगाकर सीखता है कि आगे क्या करना है। यदि ज़मीन अचानक फिसलन भरी महसूस होती है (जिसे "ट्रांजिशन डायनेमिक्स" में बदलाव कहा जाता है), तो रोबोट घबरा सकता है और अपने पैरों को बेतहाशा झटक सकता है, जिससे वह गिर सकता है।

पिछले तरीकों ने इसे ठीक करने की कोशिश की, जैसे कि रोबोट के "दिमाग" (पॉलिसी) को अधिक सुचारू (smooth) बनाना, या उसे सबसे खराब स्थिति की उम्मीद करना सिखाना। लेकिन लेखकों ने एक कमी पाई: उन्होंने महसूस किया कि जबकि हम अक्सर रोबोट के कार्यों (actions) को सुचारू बनाते हैं, हम शायद ही कभी दुनिया कैसे बदलेगी, इसके बारे में रोबोट के पूर्वानुमानों (predictions) को सुचारू बनाते हैं।

रोबोट के दिमाग को दो भागों के रूप में सोचें:

  1. एक्टर (The Actor): वह हिस्सा जो तय करता है कि "मुझे अपना पैर बाईं ओर मारना चाहिए।"
  2. क्रिटिक (The Critic): वह हिस्सा जो फुसफुसाता है, "हे, अगर तुम यहाँ अपना पैर बाईं ओर मारते हो, तो तुम गिर सकते हो क्योंकि ज़मीन फिसलन भरी है।"

लेखकों ने पाया कि यदि क्रिटिक बहुत ज्यादा उछल-कूद करता है और वातावरण में मामूली बदलावों पर बेतहाशा प्रतिक्रिया देता है, तो एक्टर भ्रमित हो जाता है और झटकेदार, खतरनाक हरकतें करता है।

समाधान: एक "शांत बोलने वाला" क्रिटिक (A "Smooth-Talking" Critic)

टीम ने एक नया प्रशिक्षण तरीका बनाया जिसे PPO-PGDLC कहा जाता है। यह दो चतुर तरकीबों को जोड़ता है:

1. "सबसे खराब स्थिति वाला" सिम्युलेटर (PGD)
कल्पना कीजिए कि रोबोट एक वीडियो गेम में प्रशिक्षण ले रहा है, लेकिन हर बार जब वह कोई चाल चलता है, तो गेम गुप्त रूप से उसे धोखा देने की कोशिश करता है। गेम इंजन (प्रोजेक्टेड ग्रेडिएंट डिसेंट, या PGD का उपयोग करके) देखता है कि एक छोटे से दायरे के भीतर सबसे फिसलन भरा पैच या सबसे तेज़ हवा क्या हो सकती है और रोबोट को वहां चलने के लिए मजबूर करता है।

  • यह क्या करता है: यह रोबोट को यह सीखने के लिए मजबूर करता है कि तब भी कैसे सीधा खड़ा रहा जाए जब वातावरण उसके सबसे बुरे दुश्मन के रूप में व्यवहार करने की कोशिश करे।
  • कैच (चुनौती): पेपर नोट करता है कि यह "धोखेबाज" सिम्युलेटर परफेक्ट नहीं है। यदि रोबोट का दिमाग बहुत ज्यादा उछल-कूद करने वाला है, तो धोखेबाज सिम्युलेटर भ्रमित हो सकता है और गलत सलाह दे सकता है।

2. "शांत बोलने वाला" क्रिटिक (Lipschitz Regularization)
यह इस पेपर का मुख्य नवाचार है। उन्होंने क्रिटिक के दिमाग में एक नियम जोड़ा: "तुम्हें सुचारू (smooth) होना चाहिए।"
गणितीय शब्दों में, उन्होंने लिप्सचिट्ज रेगुलराइजेशन (Lipschitz regularization) लागू किया। सरल भाषा में, इसका अर्थ है कि उन्होंने क्रिटिक को अपने पूर्वानुमान धीरे-धीरे बदलने के लिए मजबूर किया। यदि ज़मीन 1% अधिक फिसलन भरी हो जाती है, तो क्रिटिक को चिल्लाकर "खतरा!" नहीं कहना चाहिए और अपनी सलाह को 100% नहीं बदलना चाहिए। इसके बजाय, उसे कहना चाहिए, "ठीक है, शायद 5% अधिक सावधान रहें।"

  • परिणाम: क्रिटिक को शांत और सुचारू रखकर, एक्टर (वह हिस्सा जो पैर हिलाता है) को स्थिर, विश्वसनीय सलाह मिलती है। वह हवा या कीचड़ में होने वाले सूक्ष्म परिवर्तनों से डरकर घबराता नहीं है।

प्रयोग क्या दिखाते हैं

लेखकों ने तीन अलग-अलग चुनौतियों पर इसका परीक्षण किया:

  1. कार्टपोल (Cartpole): एक क्लासिक खेल जहाँ आप एक कार्ट पर पोल को संतुलित करते हैं।
  2. एंट (Ant): चार पैरों वाला एक सिम्युलेटेड रोबोट।
  3. यूनिट्री गो2 (Unitree Go2): एक वास्तविक, भौतिक चार पैरों वाला रोबोट कुत्ता।

सिमुलेशन में (Cartpole और Ant):
उन्होंने रोबोट के वजन और फर्श के फिसलन भरेपन को बदलकर 121 अलग-अलग वातावरण बनाए। उन्होंने यह मापा कि रोबोट इन स्थितियों के "सबसे खराब" (एक मीट्रिक जिसे वे ρ\rho-robustness कहते हैं) में कैसा प्रदर्शन करता है।

  • निष्कर्ष: नया तरीका (PPO-PGDLC) चैंपियन था। एंट रोबोट पर, इसने कठिनाई के सभी 6 परीक्षण रेडियस में उच्चतम मजबूती (robustness) स्कोर प्राप्त किया। कार्टपोल पर, यह 6 में से 3 परिदृश्यों में जीता।
  • आंकड़े: मानक विधि (PPO) की तुलना में, उनके नए तरीके ने एक विशिष्ट कठिन परिदृश्य में मजबूती के स्कोर में 65.55% और दूसरे में 59.93% का सुधार किया। एंट रोबोट के लिए औसतन, यह सभी परीक्षणों में 9.87% बेहतर था।
  • समझौता (Trade-off): पेपर सुझाव देता है कि यदि आप "धोखेबाज" सिम्युलेटर को बहुत डरावना बनाते हैं (एक बहुत बड़े अनिश्चितता सेट का उपयोग करके, जैसे ϵ=0.007\epsilon = 0.007 या $0.01$), तो रोबोट वास्तव में अपने काम में खराब हो जाता है। हालांकि, सुचारू क्रिटिक ने इसे ठीक करने में मदद की, जिससे रोबोट अपने कौशल खोए बिना मजबूत बना।

असली रोबोट पर (Unitree Go2):
यह सबसे रोमांचक हिस्सा है। उन्होंने सिमुलेशन में प्रशिक्षित रोबोट को लिया और उसे वास्तविक हार्डवेयर पर भेजा, जिसमें उसकी पीठ पर अतिरिक्त वजन (2 किलो और 4 किलो) बांधा गया था। उन्होंने रोबोट को वास्तविक हार्डवेयर पर पुनः प्रशिक्षित नहीं किया; यह एक "जीरो-शॉट" ट्रांसफर था।

  • परिणाम: PPO-PGDLC के साथ प्रशिक्षित रोबोट मानक तरीकों द्वारा प्रशिक्षित रोबोट की तुलना में बहुत अधिक सुचारू रूप से चला।
  • मीट्रिक्स: उन्होंने "एक्शन स्मूथनेस" (चाल कितनी झटकेदार थी) और "वेलोसिटी ट्रैकिंग एरर" (उसने अपनी गति को कितनी अच्छी तरह बनाए रखा) को मापा।
    • 2 किलो के भार के साथ, नए रोबोट का एक्शन स्मूथ स्कोर 4.306 था, जबकि मानक रोबोट का 4.501 था।
    • 4 किलो के भार के साथ, यह 4.498 बनाम 4.841 था।
    • 6 में से 5 परीक्षणों में, नए रोबोट में कम "जिटर" (कम सेकंड-ऑर्डर फ्लक्चुएशन रेश्यो) था।
  • स्मूथनेस चेक: उन्होंने "लिप्सचिट्ज कांस्टेंट" (एक संख्या जो बताती है कि दिमाग कितना उछल-कूद करता है) को भी मापा। नए तरीके ने कितना स्मूथिंग लागू किया गया इसके आधार पर क्रिटिक की उछल-कूद को 57.7% से 96.6% तक कम कर दिया।

वे स्पष्ट रूप से क्या खारिज करते हैं

पेपर बहुत स्पष्ट है कि क्या काम नहीं करता है या किस पर ध्यान केंद्रित नहीं है:

  • यह केवल एक्टर के बारे में नहीं है: वे स्पष्ट रूप से कहते हैं कि पिछले कार्यों ने एक्टर (मूवर) को सुचारू बनाने पर ध्यान केंद्रित किया, लेकिन उन्होंने पाया कि क्रिटिक (भविष्यवक्ता) को सुचारू बनाना मजबूती की कुंजी है।
  • यह हर चीज़ के लिए जादुई समाधान नहीं है: वे तर्क देते हैं कि अनिश्चितता सेट को बहुत बड़ा बनाना (हर संभावित आपदा पर प्रशिक्षण देना) वास्तव में प्रदर्शन को नुकसान पहुँचाता है। आपको सही संतुलन बनाना होगा।
  • यह "परफेक्ट डायनेमिक्स" के बारे में नहीं है: वे यह दावा नहीं करते कि वे दुनिया के बारे में रोबोट को सटीक रूप से क्या है, यह जानने का समाधान कर रहे हैं। इसके बजाय, वे रोबोट को अनिश्चितता को शालीनता से संभालना सिखाते हैं।

वे कितने आश्वस्त हैं?

लेखक अपने परिणामों को लेकर आश्वस्त हैं, लेकिन वे अपनी भाषा के प्रति सावधान हैं।

  • सिमुलेशन: कार्टपोल और एंट पर परिणाम सिमुलेशन पर आधारित हैं। वे एक नियंत्रित डिजिटल दुनिया में उनके तरीके के काम करने के मजबूत प्रमाण दिखाते हैं।
  • वास्तविक दुनिया: यूनिट्री गो2 पर उनके परिणाम वास्तविक हार्डवेयर प्रयोगों पर आधारित हैं। उन्होंने रोबोट की वास्तविक गति और गति को मापा। वे कहते हैं कि रोबोट "लगातार सुचारू क्रियाएं प्राप्त करता है" और "बेहतर ट्रांसफर स्थिरता प्रदर्शित करता है।"
  • भविष्य का कार्य: वे सुझाव देते हैं कि यह एक कदम आगे है, लेकिन भविष्य के कार्य और भी सामान्य तरीकों की खोज कर सकते हैं जो वास्तविक दुनिया की अव्यवस्था को संभाल सकें। वे यह दावा नहीं करते हैं कि उन्होंने "सिम-टू-रियल" समस्या को हमेशा के लिए हल कर दिया है, लेकिन उन्होंने एक बहुत ही आशाजनक रास्ता दिखाया है।

मुख्य बात (The Takeaway)

PPO-PGDLC को यह सिखाने के रूप में समझें कि रोबोट कुत्ते को न केवल कैसे दौड़ना है, बल्कि जब दुनिया अजीब हो जाए तो अपने आंतरिक स्वर को शांति से कैसे सुनना है। अपने आंतरिक "भविष्यवक्ता" को सुचारू और स्थिर बनाकर, रोबोट घबराता नहीं है जब हवा चलती है या ज़मीन फिसलन भरी होती है। वह अपना संयम बनाए रखता है, सुचारू रूप से चलता है, और अपने पैरों पर खड़ा रहता है, भले ही वह उन भारी भारों को उठा रहा हो जिनके लिए उसे विशेष रूप से प्रशिक्षित नहीं किया गया था।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →