← नवीनतम पेपर
💻 computer science

Asymmetric physics enables efficient learning in quadrupedal robot swarms

यह शोधपत्र यह प्रदर्शित करता है कि एसिमेट्रिक फिजिक्स (asymmetric physics) का लाभ उठाना—जो यथार्थवादी संपर्क गतिकी के लिए एक उच्च-सटीक गैर-विभेदक सिम्युलेटर को ग्रेडिएंट-आधारित शिक्षण के लिए विभेदक सरोगेट मॉडल के साथ जोड़ता है—बिना किसी स्पष्ट संचार या वैश्विक मानचित्र के, बड़े चतुष्पाद रोबोटों के झुंड के लिए विजन-आधारित, विकेंद्रीकृत नियंत्रण नीतियों के कुशल एंड-टू-एंड प्रशिक्षण को सक्षम बनाता है, जिससे वास्तविक दुनिया के वातावरण में मजबूत ज़ीरो-शॉट ट्रांसफर प्राप्त होता है।

मूल लेखक: Yuang Zhang, Yunlong Song, Zhihao He, Zelin Ni, Kangyu Wang, Tianchi Liu, Yu Hu, Feng Yu, Danping Zou, Weiyao Lin

प्रकाशित 2026-06-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuang Zhang, Yunlong Song, Zhihao He, Zelin Ni, Kangyu Wang, Tianchi Liu, Yu Hu, Feng Yu, Danping Zou, Weiyao Lin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप पक्षियों के एक झुंड को 500 पक्षियों को एक घने जंगल से बिना पेड़ों या एक-दूसरे से टकराए उड़ना सिखाने की कोशिश कर रहे हैं। यदि आप उन्हें एक-एक करके सिखाने की कोशिश करते, या यदि आप उन्हें एक नक्शा और एक केंद्रीय कमांडर देने की कोशिश करते, तो यह धीमा, भद्दा होता और वास्तविक दुनिया में ठीक से काम नहीं करता।

यह शोध पत्र बताता है कि कैसे रोबोट कुत्तों (क्वाड्रुपेड्स) को ठीक यही करने के लिए प्रशिक्षित किया गया: बिना आपस में बात किए या किसी नेता का अनुसरण किए, केवल अपनी आँखों के उपयोग से, एक अव्यवस्थित और भीड़भाड़ वाले वातावरण में एक झुंड के रूप में एक साथ आगे बढ़ना।

यहाँ इसका सरल विवरण दिया गया है कि उन्होंने यह कैसे किया:

समस्या: रोबोट झुंड का "ब्लैक बॉक्स"

आमतौर पर, जब वैज्ञानिक आर्टिफिशियल इंटेलिजेंस (विशेष रूप से रीइन्फोर्समेंट लर्निंग) का उपयोग करके रोबोट को प्रशिक्षित करते हैं, तो वे "प्रयास और त्रुटि" (trial and error) नामक विधि का उपयोग करते हैं। रोबोट कुछ करता है, टकरा जाता है, सीखता है कि वह गलत था, और फिर से प्रयास करता है।

  • समस्या: जब आपके पास केवल एक रोबोट होता है, तो यह ठीक है। लेकिन जब आपके पास एक साथ सैकड़ों रोबोट चल रहे होते हैं, तो "प्रयास और त्रुटि" एक दुःस्वप्न बन जाता है। कंप्यूटर इस बात को समझने में अभिभूत हो जाता है कि किस रोबोट ने क्या किया, और सीखने की प्रक्रिया अविश्वसनीय रूप से धीमी और अक्षम हो जाती है। यह एक-एक करके गेंदों को गिराकर 500 गेंदों को उछालना (जगलिंग) सीखने जैसा है।

समाधान: "दो-मस्तिष्क" वाली तरकीब

शोधकर्ताओं ने "एसिमेट्रिक फिजिक्स" (Asymmetric Physics) का उपयोग करके इसे तेज करने का एक चतुर तरीका निकाला। इसे रोबोट झुंड को दो अलग-अलग कार्यों के लिए दो अलग-अलग "मस्तिष्क" देने के रूप में सोचें:

  1. "यथार्थवादी" मस्तिष्क (कार्य करने के लिए): जब रोबोट वास्तव में हिल-डुल रहे होते हैं और परस्पर क्रिया कर रहे होते हैं, तो वे एक अत्यंत विस्तृत, हाई-फिडेलिटी सिम्युलेटर का उपयोग करते हैं। यह मस्तिष्क दुनिया को बिल्कुल वैसा ही देखता है जैसी वह है: ऊबड़-खाबड़ जमीन, घास, टकराव, और कुत्ते के पैरों के मिट्टी से टकराने का जटिल भौतिक विज्ञान। यह यथार्थवादी है, लेकिन गणितीय रूप से सीखने के लिए बहुत जटिल है।
  2. "सरलीकृत" मस्तिष्क (सीखने के लिए): जब कंप्यूटर को यह समझने की आवश्यकता होती है कि कैसे सुधार किया जाए, तो यह भौतिकी के एक सरलीकृत, "कार्टून" संस्करण पर स्विच हो जाता है। हर मांसपेशी और पत्थर का अनुकरण करने के बजाय, यह रोबोटों को सरल चलते हुए बिंदुओं (नेविगेशन के लिए) या कठोर ब्लॉकों (गति के लिए) के रूप में मानता है। यह सरलीकृत संस्करण सुचारू है और कंप्यूटर के लिए ग्रेडिएंट्स (वह गणित जो रोबोट को बेहतर होने का तरीका बताता है) की गणना करना आसान है।

उपमा: कल्पना कीजिए कि एक पायलट विमान उड़ाना सीख रहा है।

  • यथार्थवादी (Realist) वास्तविक फ्लाइट सिम्युलेटर है जिसमें हवा, विक्षोभ (turbulence) और इंजन का शोर है।
  • सरलीकृत (Simplifier) व्हाइटबोर्ड पर बना एक बुनियादी चित्र है जो विमान के पथ को दर्शाता है।
  • पायलट यथार्थवादी सिम्युलेटर में अभ्यास करता है (महसूस करने के लिए), लेकिन प्रशिक्षक व्हाइटबोर्ड का उपयोग यह समझाने के लिए तेजी से करता है कि पायलट ने गलती क्यों की और उसे कैसे ठीक किया जाए। यह शोध पत्र इसे स्वचालित रूप से करता है: रोबटेज यथार्थवादी दुनिया में "कार्य" करते हैं लेकिन सरलीकृत गणित से "सीखते" हैं।

उन्होंने क्या हासिल किया

इस पद्धति का उपयोग करके, टीम ने एक एकल AI पॉलिसी को प्रशिक्षित किया जो एक साथ 512 रोबोट कुत्तों को सिमुलेशन में नियंत्रित कर सकती थी।

जब उन्होंने छह Unitree Go2 रोबोट कुत्तों के साथ वास्तविक दुनिया में इसका परीक्षण किया, तो परिणाम आश्चर्यजनक थे। रोबोटों के पास कोई केंद्रीय कमांडर नहीं था, आपस में बात करने के लिए कोई वाई-फाई नहीं था, और न ही उन्हें क्षेत्र का कोई नक्शा था। उनके पास केवल अपनी नाक पर एक कैमरा था। फिर भी, वे एक समन्वित पशु झुंड की तरह व्यवहार करते थे:

  • दाहिनी ओर रास्ता देना (Right-Side Yielding): जब दो रोबोट समूह आमने-सामने मिलते हैं, तो वे एक-दूसरे को पार करने के लिए स्वाभाविक रूप से दाईं ओर झुक जाते हैं, ठीक वैसे ही जैसे कारें या लोग करते हैं।
  • पूर्वानुमानित बचाव (Predictive Avoidance): यदि वे देखते हैं कि कोई दूसरा रोबोट आ रहा है, तो वे संकीर्ण अंतराल में प्रवेश करने से पहले धीमे हो जाते हैं या रुक जाते हैं, जिससे ट्रैफिक जाम होने से बच जाता है।
  • दीवार के साथ चलना (Wall Following): यदि वे फंस जाते हैं या रास्ता नहीं देख पाते, तो वे स्वाभाविक रूप से दीवार के साथ तब तक चलते हैं जब तक कि उन्हें कोई रास्ता न मिल जाए।
  • भीड़ का प्रवाह (Crowd Flow): वे घने जंगलों, संकीर्ण पुलों और भूलभुलैया के माध्यम से बिना टकराए निकल सके, भले ही वे पूरी तरह से अपने आप सीख रहे थे।

यह क्यों महत्वपूर्ण है

शोध पत्र का दावा है कि जटिल, भौतिक वातावरण में लेग्ड रोबोट झुंडों के लिए विजन-आधारित लर्निंग (दृष्टि-आधारित सीखना) पहली बार इतनी अच्छी तरह से काम किया है।

मुख्य बात यह है कि "यथार्थवादी कार्य" को "सरलीकृत सीखने" से अलग करके, उन्होंने एक विशाल, धीमी समस्या (500 रोबोटों को सिखाना) को एक कुशल समस्या में बदल दिया। उन्होंने रोबोटों को "दाएं झुकने" या "दूसरों के लिए इंतजार करने" के लिए प्रोग्राम नहीं किया। इसके बजाय, उन्होंने एक ऐसा प्रशिक्षण वातावरण बनाया जहाँ ये व्यवहार स्वाभाविक रूप से उभरे क्योंकि रोबोटों के लक्ष्यों तक पहुँचने का यह सबसे कुशल तरीका था।

संक्षेप में: उन्होंने रोबोट कुत्तों के एक झुंड को बिना किसी कोरियोग्राफर के जंगल में नृत्य करना सिखाया, एक ऐसी तरकीब का उपयोग करके जो उन्हें सरल सोचकर और यथार्थवादी होकर तेजी से सीखने में मदद करती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →