← नवीनतम पेपर
💻 computer science

AXIS: A Growable Community-Driven Data Engine for Scalable Robot Manipulation

यह शोध पत्र AXIS को प्रस्तुत करता है, जो एक स्केलेबल, समुदाय-संचालित डेटा इंजन और बेंचमार्क है जो विविध रोबोट मैनिपुलेशन कार्यों के बड़े पैमाने के डेटासेट को उत्पन्न करने के लिए ब्राउज़र-आधारित टेलीऑपरेशन और स्वचालित डेटा प्रोसेसिंग का लाभ उठाता है, यह प्रदर्शित करते हुए कि इस डेटा पर निरंतर प्रीट्रेनिंग मौजूदा मॉडलों की तुलना में पॉलिसी प्रदर्शन और स्केलिंग व्यवहार में महत्वपूर्ण सुधार करती है।

मूल लेखक: Mengfei Zhao, Dihong Huang, Yikai Tang, Peihao Li, Mingxuan Yan, Ruiqi Zhuang, Yanjia Huang, Jie Wang, Hai Zhai, Tony Zhou, Rui Zhang, Zhexi Luo, Yuchen Huang, Jianfei Yang, Jiachen Li

प्रकाशित 2026-07-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mengfei Zhao, Dihong Huang, Yikai Tang, Peihao Li, Mingxuan Yan, Ruiqi Zhuang, Yanjia Huang, Jie Wang, Hai Zhai, Tony Zhou, Rui Zhang, Zhexi Luo, Yuchen Huang, Jianfei Yang, Jiachen Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को घर के काम करना सिखाने की कोशिश कर रहे हैं, जैसे कि एक खिलौना उठाना और उसे एक डिब्बे में रखना। सीखने के लिए, रोबोट को पहले किसी व्यक्ति को यह काम करते हुए हजारों उदाहरण देखने की आवश्यकता होती है। इसे "इमिटेशन लर्निंग" (अनुकरण सीखना) कहा जाता है। अतीत में, ये उदाहरण प्राप्त करना एक वास्तविक रोबट के पास खड़े विशेषज्ञों की एक छोटी सेना को नियुक्त करने जैसा था, जो विशेष नियंत्रकों के साथ उसके हाथों का मार्गदर्शन करते थे। यह महंगा, धीमा और केवल कुछ विशिष्ट कार्यों तक सीमित था। लेकिन क्या होगा अगर आप पूरे इंटरनेट को एक कक्षा में बदल सकें? क्या होगा अगर आप किसी को भी वेब ब्राउज़र के माध्यम से रोबोट को सिखाने में मदद करने दे सकें, और फिर एक सुपर-स्मार्ट कंप्यूटर का उपयोग करके उनके अव्यवस्थित मानवीय प्रयासों को पूर्ण, पॉलिश किए गए पाठों में बदल सकें? यही उस नए शोध पत्र के पीछे का बड़ा सवाल है: हम एक ऐसा रोबोट लर्निंग सिस्टम कैसे बनाएं जो कभी बढ़ना बंद न करे, अधिक मदद के साथ बेहतर होता जाए, और जिसे शुरू करने के लिए लाखों डॉलर के हार्डवेयर की आवश्यकता न हो?

यह शोध पत्र AXIS को पेश करता है, जो एक "ग्रोएबल कम्युनिटी-ड्रिवन डेटा इंजन" (बढ़ने योग्य समुदाय-संचालित डेटा इंजन) है, जिसे ठीक इसी समस्या को हल करने के लिए डिज़ाइन किया गया है। AXIS को एक विशाल, इंटरैक्टिव वीडियो गेम के रूप में समझें जहाँ लाखों लोग अपने कंप्यूटर से लॉग इन करके एक सरल खेल खेलने के लिए शामिल हो सकते हैं: "नीले ब्लॉक को उठाओ और उसे लाल प्लेट पर रखो।" लेकिन केवल मनोरंजन के लिए खेलने के बजाय, खिलाड़ियों द्वारा की जाने वाली हर हरकत को रिकॉर्ड किया जाता है और रोबोट के मस्तिष्क को भेजा जाता है। पेच यह है कि खिलाड़ी वास्तविक रोबोट को नियंत्रित नहीं कर रहे हैं; वे वेब ब्राउज़र में एक आभासी (वर्चुअल) रोबोट को नियंत्रित कर रहे हैं। यह किसी के लिए भी, कहीं भी, बिना किसी विशेष उपकरण के भाग लेना आसान बनाता है।

एक बार जब डेटा आ जाता है, तो AXIS एक सुपर-एफिशिएंट संपादक की तरह कार्य करता है। मानव खिलाड़ी यह दिखाने में माहिर होते हैं कि क्या करना है, लेकिन वे अक्सर अव्यवस्थित होते हैं। वे बहुत देर तक रुक सकते हैं, कंट्रोलर को हिला सकते हैं, या लक्ष्य को चूक सकते हैं। AXIS स्वचालित रूप से इन रिकॉर्डिंग को साफ करता है। यह "हिचकिचाहट" (विराम) को हटा देता है, टेढ़ी-मेढ़ी रेखाओं को सुचारू बनाता है, और जांचता है कि कार्य वास्तव में सफल हुआ या नहीं। फिर, यह रचनात्मक होता है। यह एक अच्छे उदाहरण को लेता है और उससे हजारों विविधताएं बनाता है: लाइटिंग बदलना, फर्नीचर को खिसकाना, फर्श को फिसलन भरा बनाना, या यहाँ तक कि वस्तुओं की बनावट (टेक्सचर) को बदलना। यह एक केक बनाने की एक रेसिपी लेने और तुरंत उसके हजारों संस्करण बनाने जैसा है जिसमें अलग-अलग स्प्रिंकल्स, फ्लेवर और बेकिंग समय हो, ताकि रोबोट चाहे रसोई कैसी भी हो, केक बनाना सीख सके।

शोध पत्र में पाया गया है कि यह दृष्टिकोण अविश्वसनीय रूप से अच्छा काम करता है। इस विशाल, साफ और विविध डेटासेट पर एक रोबोट पॉलिसी को प्रशिक्षित करके, रोबोट नई स्थितियों को संभालने में बहुत बेहतर हो जाता है। जब शोधकर्ताओं ने अपने सिस्टम का परीक्षण किया, तो उन्होंने पाया कि AXIS डेटासेट (जिसमें 50,000 से अधिक ट्रेजेक्टरीज और 207 अलग-अलग कार्य शामिल हैं) पर प्रशिक्षित एक रोबोट ने एक मानक बेसलाइन की तुलना में अपनी सफलता दर में 5.8% का सुधार किया। इससे भी अधिक प्रभावशाली बात यह है कि इसने एक अलग, बड़े डेटासेट पर प्रशिक्षित एक समान सिस्टम की तुलना में 37.3% बेहतर प्रदर्शन किया। यह सुझाव देता है कि AXIS डेटा की गुणवत्ता और विविधता—जो वास्तविक मनुष्यों से आती है और कंप्यूटर द्वारा भारी मात्रा में संवर्धित (ऑगमेंटेड) की जाती है—केवल कच्चे डेटा की एक बड़ी मात्रा की तुलना में कहीं अधिक मूल्यवान है।

परिणाम यह भी दिखाते हैं कि रोबोट जितना अधिक डेटा देखता है, वह उतना ही बेहतर होता जाता है। जब टीम ने रोबोट का केवल 25%, 50%, और 100% AXIS डेटा के साथ परीक्षण किया, तो सफलता दर 84.7% से बढ़कर 85.7% और अंत में 88.8% तक लगातार बढ़ती गई। रोबोट "जटिल" स्थितियों को संभालने में विशेष रूप से अच्छा हो गया, जैसे कि जब कैमरा एंगल बदल गया, लाइटिंग अजीब थी, या वस्तुएं अप्रत्याशित स्थानों पर थीं। यह साबित करता है कि AXIS की "ग्रोएबल" प्रकृति—जहाँ डेटासेट तब भी बढ़ सकता है जब अधिक लोग इसमें शामिल होते हैं—एक ऐसा रोबोट बनाती है जो मजबूत है और वास्तविक दुनिया के लिए तैयार है।

संक्षेप में, AXIS केवल एक डेटासेट नहीं है; यह एक जीवित इंजन है। यह हजारों इंटरनेट उपयोगकर्ताओं के अराजक, विविध और कभी-कभी अव्यवस्थित कार्यों को रोबोट के लिए एक संरचित, उच्च-गुणवत्ता वाले पाठ्यक्रम में बदल देता है। यह सुझाव देता है कि रोबोट लर्निंग का भविष्य लैब में कुछ विशेषज्ञों के बारे में नहीं है, बल्कि एक वैश्विक समुदाय के बारे में है जो मिलकर काम कर रहा है, जहाँ कंप्यूटर उन सामूहिक प्रयासों को सुपर-स्मार्ट रोबोट कौशल में बदलने के लिए भारी काम कर रहे हैं। हालांकि शोध पत्र नोट करता है कि सिमुलेशन से वास्तविक भौतिक रोबोट तक जाना अभी भी एक चुनौती है, आभासी दुनिया में परिणाम एक स्पष्ट रास्ता दिखाते हैं: हम जितना अधिक सिखाते हैं, रोबोट उतना ही बेहतर सीखते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →