← नवीनतम पेपर
🤖 AI

SceneBot: Contact-Prompted General Humanoid Whole Body Tracking with Scene-Interaction

SceneBot एक एकीकृत मोशन-ट्रैकिंग फ्रेमवर्क है जो ह्युमनॉइड रोबोट्स को एक नवीन हिंडसाइट सीन रिकंस्ट्रक्शन दृष्टिकोण से प्राप्त संदर्भ गतियों और अनुमानित सीन-इंटरैक्शन ग्राफ्स पर एक एकल पॉलिसी को कंडिशन करके मुक्त-स्थान लोकोमोशन और जटिल संपर्क-समृद्ध कार्यों में निर्बाध रूप से सामान्यीकरण करने में सक्षम बनाता है।

मूल लेखक: Sirui Chen, Shibo Zhao, Zhen Wu, Jiaman Li, Guanya Shi, C. Karen Liu

प्रकाशित 2026-06-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sirui Chen, Shibo Zhao, Zhen Wu, Jiaman Li, Guanya Shi, C. Karen Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को चलना, नाचना और सीढ़ियों पर भारी बक्से ले जाना सिखा रहे हैं। लंबे समय तक, रोबोट प्रशिक्षकों को एक कठिन समस्या का सामना करना पड़ा: वे रोबोट को खाली कमरों (मुक्त स्थान) में पूरी तरह से घूमना तो सिखा सकते थे, लेकिन जैसे ही रोबोट को किसी दीवार को छूना होता, सीढ़ी पर कदम रखना होता, या कोई भारी वस्तु पकड़नी होती, तो वह भ्रमित हो जाता था। यह वैसा ही है जैसे किसी डांसर को यह कहना कि "अपना हाथ बॉक्स की ओर ले जाओ," लेकिन उसे यह न बताना कि उसे कैसे छूना है—क्या उसे बस उसे छूकर निकल जाना चाहिए, या उसे उठाने के लिए पर्याप्त मजबूती से पकड़ना चाहिए? उस विशिष्ट निर्देश के बिना, रोबट को पता नहीं चलता कि उसे तैरना (floating) है या धक्का देना (pushing) है।

SceneBot एक नया समाधान है जिसे स्टैनफोर्ड और अमेज़न के शोधकर्ताओं द्वारा बनाया गया है। इसे एक "यूनिवर्सल ट्रांसलेटर" के रूप में समझें जो एक ही रोबोट मस्तिष्क को खाली कमरों और अव्यवस्थित, भीड़भाड़ वाले वातावरण (जहाँ चीजों को छूना आवश्यक है) दोनों को संभालने के लिए प्रशिक्षित करता है।

यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. "कॉन्टैक्ट मैप" (गुप्त सामग्री)

अधिकांश रोबोट केवल मानव गतिविधियों (kinematics) की नकल करने की कोशिश करते हैं। SceneBot एक दूसरा स्तर का निर्देश जोड़ता है: कॉन्टैक्ट लेबल्स (Contact Labels)

  • उपमा: कल्पना कीजिए कि आप सीढ़ियों पर एक भारी सूटकेस ले जाना सीख रहे हैं। एक सामान्य निर्देश कहता है, "अपने हाथ को इस तरह हिलाएं।" SceneBot एक स्टिकी नोट जोड़ता है जो कहता है, "आपके हाथ को हैंडल पर दबाव डालना ही चाहिए," और "आपके पैर को सीढ़ी पर मजबूती से टिकना ही चाहिए।"
  • यह कैसे मदद करता है: यह रोबोट को बताता है कि शरीर के किन हिस्सों को दुनिया के विरुद्ध धक्का देना, खींचना या टिकना है। यह अस्पष्ट गति निर्देशों को वातावरण के साथ "कनेक्ट द डॉट्स" के एक भौतिक खेल में बदल देता है।

2. "टाइम-ट्रैवल" डेटा इंजन

रोबोट को यह सिखाने के लिए, आपको सीढ़ियों और बक्सों के साथ रोबोटों के हजारों उदाहरणों की आवश्यकता है। लेकिन वास्तविक दुनिया का डेटा दुर्लभ है, और रोबोटों को यह करते हुए फिल्माना धीमा और महंगा है।

  • समस्या: हमारे पास नाचने, चलने और चीजें ले जाने के इंसानों के ढेर सारे वीडियो हैं, लेकिन हमारे पास उन सीढ़ियों या बक्सों के 3D मॉडल नहीं हैं जिनके साथ वे इंटरैक्ट कर रहे थे।
  • समाधान (हाइंडसाइट रिकंस्ट्रक्शन - Hindsight Reconstruction): शोधकर्ताओं ने एक चतुर "टाइम-ट्रैवल" प्रणाली बनाई है। वे मानव गति का एक वीडियो लेते हैं, और कंप्यूटर पीछे की ओर काम करके दृश्य को बना (invent) देता है।
    • यदि इंसान का हाथ किसी स्थान के पास रुक जाता है, तो कंप्यूटर कहता है, "आह, वे यहाँ एक बॉक्स पकड़े हुए रहे होंगे," और वह एक वर्चुअल बॉक्स प्रिंट करता है।
    • यदि इंसान का पैर ऊपर की ओर उठता है, तो कंप्यूटर कहता है, "वे एक सीढ़ी पर रहे होंगे," और वह एक वर्चुअल सीढ़ी बनाता है।
  • परिणाम: उन्होंने मानव गति के घंटों के डेटा को वर्चुअल सीढ़ियों, बक्सों और असमान जमीन वाले एक विशाल प्रशिक्षण जिम में बदल दिया, जो रोबोट की गतिविधियों के साथ पूरी तरह मेल खाता है।

3. "एक-मस्तिष्क" नीति (One-Brain Policy)

आमतौर पर, आपको चलने के लिए एक मस्तिष्क, सीढ़ियाँ चढ़ने के लिए दूसरा, और चीजें ले जाने के लिए तीसरा चाहिए होता है। SceneBot एक ही मस्तिष्क को यह सब करने के लिए प्रशिक्षित करता है।

  • जादू: रोबोट को "इस तरह चलो" और "इसे छुओ" दोनों तरह के निर्देश देकर, रोबोट एक सामान्य कौशल सीख जाता है। यह खाली फर्श पर चल सकता है, और फिर बिना अपना "सॉफ्टवेयर" बदले तुरंत सीढ़ियों पर एक बक्सा उठाकर चढ़ सकता है।
  • वास्तविक परीक्षण: पेपर दिखाता है कि रोबोट सफलतापूर्वक एक बक्से को उठाता है, उसे ले जाता है, और एक निरंतर गति में सीढ़ियाँ चढ़ता है।

4. रोबोट के सिर के लिए "जीपीएस" (GPS)

रोबोट को चक्कर आने या गिरने से बचाने के लिए, शोधकर्ताओं ने यह भी सुधार किया है कि रोबोट दुनिया में अपनी स्थिति को कैसे जानता है।

  • मुद्दा: जब रोबोट अपने सिर को तेजी से घुमाता है, तो वह अक्सर अपने ओरिएंटेशन (ऊपर की दिशा क्या है) को लेकर भ्रमित हो जाता है।
  • सुधार: उन्होंने एक लेजर स्कैनर (LiDAR) और रोबोट के कूल्हों पर लगे एक सेंसर (मानव के आंतरिक कान की तरह) के डेटा को मिलाया ताकि एक अत्यंत सटीक "जीपीएस" बनाया जा सके जो जटिल करतब करते समय भी रोबोट को संतुलित रखता है।

सारांश

SceneBot को एक रोबोट को "स्पर्श की सुपर-सेंस" देने जैसा समझना चाहिए। केवल मानव गतिविधियों की नकल करने के बजाय, यह सीखता है कि दुनिया को कहाँ और कैसे छूना है। मानव वीडियो से प्रशिक्षण दृश्य बनाने के एक चतुर तरीके का उपयोग करके, शोधकर्ताओं ने एक एकल रोबोट पॉलिसी को खाली कमरे में नाचने से लेकर सीढ़ियों पर भारी फर्नीचर ले जाने तक सब कुछ संभालने के लिए प्रशिक्षित किया है, और वह भी बिना प्रत्येक कार्य के लिए अलग प्रोग्राम के।

शोधकर्ता कहते हैं कि यह मुक्त-स्थान गति (free-space movement) को जटिल, संपर्क-प्रधान कार्यों के साथ सहजता से एकीकृत करने वाला पहला फ्रेमवर्क है, और वे अपने कोड और डेटा को साझा करने की योजना बना रहे हैं ताकि अन्य लोग इस पर आगे बढ़ सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →