← नवीनतम पेपर
🤖 AI

Agent-Driven Autonomous Reinforcement Learning Research: Iterative Policy Improvement for Quadruped Locomotion

यह शोध पत्र एक केस स्टडी प्रस्तुत करता है जो यह प्रदर्शित करता है कि एक स्वायत्त एजेंट (autonomous agent), उच्च-स्तरीय मानवीय निर्देशों द्वारा निर्देशित होकर, ऊबड़-खाबड़ इलाके पर क्वाड्रुपेड लोकोमोशन (quadruped locomotion) को अनुकूलित करने के लिए एक पुनरावृत्ति सुदृढीकरण शिक्षण (iterative reinforcement learning) अनुसंधान लूप को सफलतापूर्वक निष्पादित कर सकता है, जिसने 70 से अधिक परीक्षणों में स्वचालित कोड डिबगिंग, प्रयोग प्रबंधन और रिवॉर्ड ट्यूनिंग के माध्यम से महत्वपूर्ण प्रदर्शन सुधार प्राप्त किए हैं।

मूल लेखक: Nimesh Khandelwal, Shakti S. Gupta

प्रकाशित 2026-03-31
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nimesh Khandelwal, Shakti S. Gupta

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मास्टर शेफ हैं जो एक रोबोट कुत्ते को एक पथरीले, ऊबड़-खाबड़ पहाड़ी रास्ते पर बिना गिले दौड़ना सिखाने की कोशिश कर रहे हैं।

अतीत में, आपको (एक इंसान को) सब कुछ खुद करना पड़ता: कोड लिखना, सही सेटिंग्स का अनुमान लगाना, सिमुलेशन चलाना, रोबोट को गिरते हुए देखना, कोड ठीक करना और फिर से कोशिश करना। यह धीमा, उबाऊ और थका देने वाला काम था, और आप हफ्तों तक एक ही समस्या में फंसे रह सकते थे।

यह पेपर काम करने के एक नए तरीके का वर्णन करता है। सब कुछ खुद खाना बनाने के बजाय, आपने एक बेहद बुद्धिमान और अथक परिश्रमी 'सू-शेफ' (AI एजेंट) को काम पर रखा। आपने सू-शेफ को एक व्यापक लक्ष्य दिया: "इस रोबोट कुत्ते को ऊबड़-खाबड़ जमीन पर तेज और स्थिर दौड़ना सिखाओ।"

फिर, आपने पीछे हटकर सू-शेफ को रसोई संभालने दी।

"रोबोट डॉग" प्रोजेक्ट की कहानी

यहाँ इस पेपर का विवरण दिया गया है, जिसे सरल रूपकों (metaphors) का उपयोग करके समझाया गया है:

1. सेटअप: रसोई और शेफ

  • रोबोट: DHAV1 नाम का एक 12-टांगों वाला (वास्तव में 4-टांगों वाला, लेकिन 12 जोड़ों वाला) रोबोट कुत्ता।
  • रसोई: Isaac Lab नामक एक शक्तिशाली कंप्यूटर सिमुलेशन, जहाँ रोबोट बिना कुछ तोड़े हजारों बार दौड़ने का अभ्यास कर सकता है।
  • इंसान: आप, "हेड शेफ"। आपने मेनू (लक्ष्य) तय किया और एजेंट को बताया, "चलने के तरीके और रिवॉर्ड्स (पुरस्कारों) को ठीक करने की कोशिश करो।"
  • एजेंट: एक AI (विशेष रूप से क्लॉड/Claude का एक संस्करण) जो कोड पढ़ सकता था, फाइलों को एडिट कर सकता था, प्रयोग शुरू कर सकता था और परिणामों को देख सकता था। इसने केवल आदेशों का पालन नहीं किया; इसने यह भी समझा कि चीजों को कैसे ठीक किया जाए।

2. समस्या: रोबोट बार-बार लड़खड़ा रहा है

शुरुआत में, रोबोट बहुत खराब प्रदर्शन कर रहा था। वह कुछ कदम चलता और तुरंत गिर जाता। उसे मिलने वाला "स्कोर" (रिवॉर्ड) बहुत कम था (100 में से लगभग 7)।

  • एजेंट का पहला कदम: उसने महसूस किया कि रोबोट केवल खराब चलने के कारण नहीं विफल हो रहा था; बल्कि टेरेन (जमीन) वास्तव में सिमुलेशन को तोड़ रही थी!
  • "सीढ़ी" का रूपक: कल्पना कीजिए कि आप चिकनी घास वाले रास्ते पर दौड़ने की कोशिश कर रहे हैं, लेकिन बीच-बीच में एक विशाल, नुकीली सीढ़ी आ जाती है जिससे सिमुलेशन फ्रीज हो जाता है। एजेंट ने देखा कि जब भी जमीन में "बॉक्स" या "सीढ़ियाँ" होती थीं, तो कंप्यूटर क्रैश (डेडलॉक) हो जाता था।
  • समाधान: एजेंट ने नुकीली सीढ़ियों को बदलकर चिककी ढलानों (rolling hills) को लगाने का फैसला किया। अचानक, रोबोट बिना कंप्यूटर फ्रीज हुए दौड़ने में सक्षम हो गया। यह एक बड़ी सफलता थी जिसे एक इंसान शायद कोड देखते-देखते मिस कर देता।

3. "रिवर्ड" रेसिपी: इनाम देकर सिखाना

रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) में, रोबोट अच्छे व्यवहार के लिए "इनाम" (पॉइंट्स) और गलत व्यवहार के लिए "दंड" (पेनल्टी) पाकर सीखता है।

  • एजेंट की खोज: मूल रेसिपी गलत थी। यह रोबोट को छोटी गलतियों के लिए बहुत अधिक सजा दे रही थी, जिससे वह हार मानकर स्थिर खड़ा हो जाता था।
  • "पोर्टिंग" का तरीका: एकदम नई रेसिपी बनाने के बजाय, एजेंट ने अन्य विशेषज्ञों द्वारा लिखी गई एक "कुकबुक" (किताब) देखी। उसने उनकी रसोई से चार विशिष्ट "सामग्री" (रिवॉर्ड नियम) कॉपी किए जो उनके पास गायब थे, जैसे कि "पैरों को सममित (symmetrical) रखना" या "पैरों को हवा में सही समय तक रखना" का नियम।
  • परिणाम: इन सामग्रियों को बदलकर, रोबोट लड़खड़ाने से सीधे दौड़ने लगा।

4. यात्रा: प्रयोग की 14 लहरें (Waves)

यह प्रोजेक्ट एक बार में नहीं हुआ। यह 14 "लहरों" (परीक्षण के दौरों) में हुआ, जिसमें 70 से अधिक प्रयोग शामिल थे।

  • लहर 1-5: एजेंट ने अलग-अलग सेटिंग्स आजमाईं। कुछ विफल हुईं। कुछ ने कंप्यूटर को क्रैश कर दिया। एजेंट ने सीखा कि "अधिक समानांतर कंप्यूटर" चलाने से क्रैशिंग ठीक नहीं हुई; समस्या जमीन के प्रकार में थी।
  • लहर 6: एजेंट ने उस "घातक टेरेन" (सीढ़ियों) को ढूंढ निकाला और उसे हटा दिया।
  • लहर 7-8: एजेंट उन नई "सामग्रियों" को लेकर आया जो विशेषज्ञ की कुकबुक से ली गई थीं। रोबोट का प्रदर्शन आसमान छूने लगा।
  • लहर 12: एजेंट को "गोल्डन रेसिपी" मिल गई। रोबोट बिना गिले 2,000 स्टेप्स तक दौड़ सकता था, और उसकी गति का सटीक रूप से पीछा कर रहा था।
  • लहर 13-14: एजेंट ने अपने काम की दोबारा जांच की। उसने रेसिपी को और बेहतर बनाने की कोशिश की, लेकिन महसूस किया, "अरे, हमने पहले ही सबसे अच्छा संस्करण ढूंढ लिया है।" उसने परिणाम की पुष्टि करने के लिए पांच अलग-अलग कंप्यूटरों पर इसे टेस्ट किया ताकि यह सुनिश्चित हो सके कि यह कोई इत्तेफाक नहीं है।

5. दो प्रतिस्पर्धी: PPO बनाम HIM

एजेंट ने दो अलग-अलग "ट्रेनिंग स्टाइल" (एल्गोरिदम) का भी परीक्षण किया:

  • बेसिक PPO: एक ऐसे छात्र की तरह जो अनुभव और त्रुटि (trial and error) से सीखता है। यह बहुत अच्छा काम करता था।
  • HIM: एक ऐसे छात्र की तरह जो नियमों को पूरी तरह से याद करने की कोशिश करता है। इस विशेष पथरीले इलाके में, यह बुरी तरह विफल रहा और स्थिर खड़ा रह गया।
  • एजेंट का निर्णय: असफल पद्धति पर अड़े रहने के बजाय, एजेंट ने कहा, "ठीक है, HIM यहाँ काम नहीं कर रहा है। चलिए अपनी सारी ऊर्जा PPO पर केंद्रित करते हैं।" इससे पता चला कि एजेंट रणनीतिक निर्णय ले सकता था, न कि केवल कोड चला सकता था।

मुख्य निष्कर्ष

यह पेपर रोबोट के लिए कोई नया गणितीय सूत्र आविष्कार करने के बारे में नहीं है। यह इस बारे में है कि एक AI एजेंट एक शोधकर्ता (researcher) की तरह कैसे कार्य कर सकता है।

  • पहले: एक मानव शोधकर्ता यह समझने के लिए कई दिन बिता देता था कि सिमुलेशन क्यों क्रैश हो रहा है, फिर हफ्तों तक नंबरों को बदलने में लगा रहता था, इस उम्मीद में कि कोई सफलता मिलेगी।
  • अब: इंसान एक लक्ष्य देता है। AI लॉग्स को पढ़ता है, यह समझता है कि "सीढ़ियाँ" कोड को तोड़ रही हैं, "सीढ़ियों" को "ढलानों" से बदल देता है, पड़ोसी की बेहतर रेसिपी कॉपी करता है, और इंसान से कहीं अधिक तेज़ी से 70 प्रयोग चलाता है।

निष्कर्ष:
AI ने इंसान की जगह नहीं ली। इंसान अभी भी "हेड शेफ" था जिसने लक्ष्य निर्धारित किया था। लेकिन AI ने सारा भारी काम किया: काटना, चखना, सफाई करना और प्रयोग करना। इसने साबित कर दिया कि रोबोटिक्स की जटिल दुनिया में, एक AI एजेंट स्वायत्त रूप से अनुसंधान प्रक्रिया को चला सकता है, इंजीनियरिंग बग्स को ठीक कर सकता है और अकेले इंसान की तुलना में बेहतर समाधान तेजी से खोज सकता है।

संक्षेप में: हमने एक रोबोट कुत्ते को चट्टानों पर दौड़ना सिखाया, लेकिन असली नायक वह AI सहायक था जिसने यह पता लगाया कि चट्टानें कंप्यूटर को क्यों तोड़ रही थीं और प्रशिक्षण मेनू को कैसे ठीक किया जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →