← नवीनतम पेपर
💻 computer science

PACE: Physics Augmentation for Coordinated End-to-end Reinforcement Learning toward Versatile Humanoid Table Tennis

यह शोध पत्र PACE प्रस्तुत करता है, जो एक भौतिकी-संवर्धित सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो एक सीखे हुए बॉल-स्टेट प्रेडिक्टर को एंड-टू-एंड होल-बॉडी कंट्रोल के लिए सघन भौतिकी-निर्देशित पुरस्कारों के साथ एकीकृत करके, एक 23-डिग्री-ऑफ-फ्रीडम वाले ह्यूमनॉइड रोबोट को बहुमुखी, समन्वित और उच्च-प्रदर्शन वाली टेबल टेनिस प्राप्त करने में सक्षम बनाता है।

मूल लेखक: Muqun Hu, Wenxi Chen, Wenjing Li, Falak Mandali, Zijian He, Renhong Zhang, Praveen Krisna, Katherine Christian, Leo Benaharon, Dizhi Ma, Karthik Ramani, Yan Gu

प्रकाशित 2026-03-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Muqun Hu, Wenxi Chen, Wenjing Li, Falak Mandali, Zijian He, Renhong Zhang, Praveen Krisna, Katherine Christian, Leo Benaharon, Dizhi Ma, Karthik Ramani, Yan Gu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक रोबोट एक इंसान के खिलाफ टेबल टेनिस खेलने की कोशिश कर रहा है। अब, कल्पना कीजिए कि वह रोबोट सिर्फ मेज पर लगा एक हाथ नहीं है; वह एक पूर्ण आकार का, दो पैरों वाला मानव रूपी रोबोट (humanoid) है जिसे 60 मील प्रति घंटे की रफ्तार से चल रही गेंद को मारने के लिए एक साथ दौड़ना, कूदना, मुड़ना और स्विंग करना पड़ता है। यही वह चुनौती है जिसे यह पेपर हल करता है।

यहाँ इस कहानी का विवरण है कि कैसे उन्होंने एक रोबोट को पिंग पोंग खेलना सिखाया, जिसे सरल भाषा में समझाया गया है।

समस्या: "इंतज़ार करो और देखो" का जाल

अधिकांश रोबोट निर्देश मानने में बहुत अच्छे होते हैं, लेकिन वे तेजी से चलती चीजों पर प्रतिक्रिया देने में बहुत खराब होते हैं। यदि आप एक रोबोट को गेंद मारने के लिए सिखाते हैं, तो वह आमतौर पर तब तक इंतजार करता है जब तक गेंद उसके ठीक सामने न आ जाए, और फिर स्विंग करने की कोशिश करता है। तब तक, अक्सर बहुत देर हो चुकी होती है। यह एक तेज़ आती हुई फास्टबॉल को पकड़ने की कोशिश करने जैसा है, जहाँ आप स्थिर खड़े रहते हैं और केवल तभी अपना हाथ हिलाते हैं जब गेंद आपके चेहरे से कुछ इंच दूर होती है। आप चूक जाएंगे।

मानव खिलाड़ी ऐसा नहीं करते। हम अनुमान (predict) लगाते हैं। हम गेंद को प्रतिद्वंद्वी के पैडल से निकलते देखते हैं, अनुमान लगाते हैं कि वह कहाँ टपकेगी, और गेंद के मेज से टकराने से पहले ही दौड़ना शुरू कर देते हैं।

समाधान: रोबोट के लिए एक "क्रिस्टल बॉल"

पर्ड्यू यूनिवर्सिटी के शोधकर्ताओं ने PACE नामक एक सिस्टम बनाया। इसे रोबोट को एक "क्रिस्टल बॉल" (एक प्रेडिक्टर/भविष्यवक्ता) और एक सख्त कोच (भौतिकी-आधारित पुरस्कार) देने के रूप में समझें।

यहाँ बताया गया है कि यह सिस्टम कैसे काम करता है, जिसे तीन सरल भागों में बांटा गया है:

1. क्रिस्टल बॉल (द प्रेडिक्टर)

एक सामान्य खेल में, रोबोट गेंद की वर्तमान स्थिति देखता है। लेकिन दुनिया इतनी तेज़ चलती है कि वह देख नहीं पाता।

  • ट्रिक: टीम ने एक छोटा, स्मार्ट कंप्यूटर प्रोग्राम जोड़ा जो गेंद की उड़ान के पिछले कुछ फ्रेमों को देखता है और सटीक अनुमान लगाता है कि भविष्य में वह कहाँ होगी।
  • उपमा: कल्पना कीजिए कि आप कैच पकड़ रहे हैं। गेंद को अपने हाथ में देखने के बजाय, आप थ्रो करने वाले के कंधे को देखते हैं और गेंद के हाथ से छूटने से पहले ही अनुमान लगाते हैं कि वह कहाँ गिरेगी। यह "प्रेडिक्टर" रोबोट को बताता है: "गेंद वहाँ गिरने वाली है! अभी दौड़ना शुरू करो!" यह रोबोट को प्रतिक्रियात्मक (reactive) होने के बजाय सक्रिय (proactive) रूप से हिलने की अनुमति देता है।

2. सख्त कोच (फिजिक्स-बेस्ड रिवार्ड्स)

रीइन्फोर्समेंट लर्निंग (RL) में, रोबट चीजें आजमाकर और अच्छा करने पर "पॉइंट्स" प्राप्त करके सीखते हैं।

  • समस्या: यदि आप केवल तब पॉइंट्स देते हैं जब रोबोट वास्तव में गेंद को मारता है और पॉइंट जीतता है, तो रोबोट भाग्यशाली होने से पहले हजारों बार असफल होगा। यह एक मिनट तक सफलतापूर्वक जगलिंग करने के बाद ही खुद को कुकी (इनाम) देने जैसा है। आप कभी नहीं सीख पाएंगे।
  • समाधान: शोधकर्ताओं ने एक "फिजिक्स कोच" बनाया। भले ही रोबोट गेंद को मिस कर दे, कोच गणित का उपयोग करके कहता है: "तुम करीब थे! अगर तुम अपने पैर 2 इंच बाईं ओर ले जाते, तो तुम इसे पूरी तरह से मार देते।"
  • उपमा: केवल "अच्छा काम किया" या "बुरा काम किया" कहने के बजाय, कोच फीडबैक की एक निरंतर धारा देता है: "थोड़ा और बाईं ओर," "गति बढ़ाओ," "अपना स्टांस नीचे करो।" यह एक विरल (sparse) और निराशाजनक सीखने की प्रक्रिया को एक सुचारू, निर्देशित प्रशिक्षण सत्र में बदल देता है।

3. पूरे शरीर का नृत्य (एंड-टू-एंड लर्निंग)

पुराने रोबोटों में अक्सर "पैरों" और "हाथों" के लिए अलग-अलग दिमाग होते थे। पैर दौड़ते थे, और फिर हाथ स्विंग करते थे। यह अनाड़ीपन भरा होता है।

  • नवाचार: यह रोबोट एक ही मस्तिष्क (एक न्यूरल नेटवर्क) का उपयोग करता है जो सब कुछ एक साथ नियंत्रित करता है। यह सीखता है कि एक तेज़ गेंद को मारने के लिए, इसे एक ही तरल गति में अपने धड़ को झुकाना, अपना वजन बदलना और अपने हाथ को घुमाना होगा।
  • परिणाम: रोबोट केवल खड़ा होकर स्विंग नहीं करता; वह एक छोटा सा नृत्य करता है। वह बगल में खिसकता है, आगे की ओर झपटता है, और अपने शरीर को घुमाता है, बिल्कुल एक मानव एथलीट की तरह।

परिणाम: सिमुलेशन से वास्तविकता तक

टीम ने इस रोबोट को पहले एक वीडियो गेम की दुनिया (सिमुलेशन) में प्रशिक्षित किया।

  • गेम में: रोबोट एक प्रो बन गया। उसने 96% से अधिक बार गेंद को हिट किया और 92% से अधिक बार सफलतापूर्वक वापस किया, यहाँ तक कि जब सर्व (serve) तेज़ और अप्रत्याशित थी।
  • वास्तविक जीवन में: उन्होंने गेम में प्रशिक्षित किए गए "दिमाग" को सीधे Booster T1 (एक 23-जॉइंट वाला, 30 किलो का ह्यूमनॉइड) नामक वास्तविक रोबोट पर डाल दिया। उन्होंने इसे दोबारा कुछ भी नहीं सिखाया (इसे "जीरो-शॉट" ट्रांसफर कहा जाता है)।
  • आउटकम: वास्तविक रोबोट सफलतापूर्वक दौड़ा, संतुलन बनाया और गेंद को वापस मारा! वह 93% बार गेंद को हिट करने और 61% बार उसे वापस भेजने में सफल रहा। हालांकि यह वीडियो गेम जितना परफेक्ट नहीं था (वास्तविक जीवन में घर्षण और डगमगाते जोड़ होते हैं), इसने यह साबित कर दिया कि एक रोबोट एक गतिशील खेल को एंड-टू-एंड खेल सकता है।

यह क्यों महत्वपूर्ण है

यह केवल पिंग पोंग के बारे में नहीं है। यह रोबोट को अराजक, तेज़-तर्रार वातावरण में मनुष्यों की तरह चलने में सक्षम बनाने की दिशा में एक बड़ी सफलता है।

  • रूपक: इससे पहले, रोबोट एक शतरंज खिलाड़ी की तरह थे जो एक बार में केवल एक मोहरा हिला सकते थे। यह नया तरीका रोबोट को एक ग्रैंडमास्टर की तरह बनाता है जो एक जटिल समस्या को तुरंत हल करने के लिए अपने पूरे शरीर को सामंजस्य में चला सकता है।

संक्षेप में: रोबोट को भविष्य की भविष्यवाणी करने का तरीका और निरंतर फीडबैक देने वाला एक कोच देकर, शोधकर्ताओं ने एक रोबोट को एक मानव एथलीट के समन्वय के साथ नृत्य करना, दौड़ना और गेंद को मारना सिखाया।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →