← नवीनतम पेपर
💻 computer science

FOCI Policy: Focus on Object-Centric Interactions for Relational Manipulation Policies

यह शोधपत्र FOCI पॉलिसी का प्रस्ताव करता है, जो एक ऑब्जेक्ट-सेंट्रिक फ्रेमवर्क है जो कार्यों के लिए प्रासंगिक वस्तुओं के बीच टेम्पोरली कॉम्पैक्ट इंटरेक्शन सेगमेंट और स्पेशियली इनवैरिएंट रिलेटिव SE(3)SE(3) मोशन में कौशल को एब्स्ट्रैक्ट करके रिजिड रिलेशनल मैनिपुलेशन में जनरलाइजेशन और डेटा एफिशिएंसी में सुधार करता है।

मूल लेखक: Ze Fu, Pinhao Song, Yutong Hu, Renaud Detry

प्रकाशित 2026-09-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ze Fu, Pinhao Song, Yutong Hu, Renaud Detry

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट लंबे समय से वस्तुओं को एक स्थान से दूसरे स्थान पर ले जाने के सरल कार्य में संघर्ष करते रहे हैं। हालांकि उन्हें कारखाने में दोहराव वाले कार्यों को करने के लिए प्रोग्राम किया जा सकता है, लेकिन उन्हें एक नज़र या एक संक्षिप्त प्रदर्शन के साथ नई स्थितियों को संभालना सिखाना एक गहन चुनौती बनी हुई है। वर्तमान के अधिकांश दृष्टिकोण रोबोट को यह दिखाने की कोशिश करते हैं कि उसे अपने हाथों और उंगलियों को बिल्कुल कैसे हिलाना है, जो अनिवार्य रूप से 'मसल मेमोरी' (मांसपेशियों की स्मृति) का एक रूप विकसित करने जैसा है। इस पद्धति के लिए डेटा की विशाल मात्रा की आवश्यकता होती है, जिसमें अक्सर सैकड़ों प्रदर्शनों की जरूरत होती है ताकि हर उस तरीके को कवर किया जा सके जिससे कोई वस्तु रखी हो सकती है या कमरा व्यवस्थित हो सकता है। यदि रोबोट को किसी मामूली बदलाव का सामना करना पड़ता है, जैसे कि एक कप को कुछ इंच बाईं ओर खिसका दिया गया हो, तो कठोर निर्देश अक्सर विफल हो जाते हैं। शोधकर्ता अब एक अलग रास्ता खोज रहे हैं: रोबोट के शरीर पर ध्यान केंद्रित करने के बजाय, वे मशीनों को वस्तुओं के बीच के संबंध पर ध्यान केंद्रित करना सिखा रहे हैं। यह समझने के बजाय कि रोबोट का ग्रिपर अंतरिक्ष में कैसे चलता है, यदि सिस्टम यह समझ ले कि एक कप के सापेक्ष टूथब्रश कैसे चलता है, तो एक सिस्टम बहुत कम प्रयास के साथ कौशल को सामान्यीकृत करना सीख सकता है।

KU Leuven के शोधकर्ताओं की एक टीम ने 'FOCI पॉलिसी' नामक एक नया ढांचा विकसित किया है जो इस विचार को व्यवहार में लाता है। उनका कार्य बताता है कि कई जटिल कार्य उन छोटे, महत्वपूर्ण क्षणों द्वारा नियंत्रित होते हैं जहाँ वस्तुएं आपस में क्रिया करती हैं, जबकि बाकी की गति केवल यात्रा मात्र होती है। कल्पना कीजिए कि आप एक गिलास में पानी डालने का तरीका सीखने की कोशिश कर रहे हैं। जग उठाने और मेज तक चलने का कार्य अनगिनत तरीकों से किया जा सकता है, लेकिन वह क्षण जब पानी स्प्राउट (धार) से गिलास में गिरता है, वह बहुत ही सीमित होता है और एक विशिष्ट पैटर्न का पालन करता है। शोधकर्ताओं ने देखा कि यदि एक रोबोट इन संक्षिप्त, उच्च-जोखिम वाले इंटरेक्शन चरणों को अलग कर सके और शोर भरे, परिवर्तनशील यात्रा समय को अनदेखा कर सके, तो वह कार्य को बहुत अधिक कुशलता से सीख सकता है। उन्होंने एक ऐसा सिस्टम बनाया जो प्रदर्शन वीडियो को स्वचालित रूप से स्कैन करता है, पहचानता है कि वस्तुएं वास्तव में कब एक-दूसरे को छूना या प्रभावित करना शुरू करती हैं, और उस विशिष्ट खंड को निकाल लेता है।

एक बार जब इस महत्वपूर्ण खंड को अलग कर लिया जाता है, तो सिस्टम रोबोट के सटीक पथ को याद करने की कोशिश नहीं करता है। इसके बजाय, यह शामिल दो वस्तुओं के बीच की सापेक्ष गति को सीखता है। यदि कोई मनुष्य वाइन की बोतल को रैक में रखने का प्रदर्शन करता है, तो रोबोट रैक के सापेक्ष बोतल की गति को सीखता है, न कि रोबोट के हाथ की गति को। यह दृष्टिकोण कौशल को रोबोट के विशिष्ट शरीर के आकार या कमरे के सटीक लेआउट से स्वतंत्र बनाता है। सिस्टम फिर इस सीखे हुए संबंध को एक नई स्थिति में लागू कर सकता है, भले ही वस्तुएं अलग स्थितियों में हों या रोबोट एक पूरी तरह से अलग मॉडल हो। अपने परीक्षणों में, शोधकर्ताओं ने प्रत्येक कार्य के लिए केवल एक ही प्रदर्शन पर सिस्टम को प्रशिक्षित किया। नई स्थितियों का सामना करते हुए, रोबोट ने वाइन की बोतलें रखने, कीलें ठोकने या तरल पदार्थ डालने जैसे जटिल कार्यों को सफलतापूर्वक पूरा किया, और अक्सर उन अन्य तरीकों से बेहतर प्रदर्शन किया जिन्हें बहुत अधिक डेटा पर प्रशिक्षित किया गया था।

परिणाम विशेष रूप से तब प्रभावशाली थे जब दृश्य स्थितियां बदल गईं। प्रयोगों के एक सेट में, शोधकर्ताओं ने गंभीर दृश्य बाधाएं पेश कीं, जैसे कि प्रकाश व्यवस्था बदलना, ध्यान भटकाने वाली वस्तुएं जोड़ना, या वस्तुओं की बनावट (टेक्सचर) को बदलना। जबकि अन्य उन्नत सिस्टम जिन्होंने सौ प्रदर्शनों पर प्रशिक्षण लिया था, ऐसी स्थितियों में उनकी सफलता दर नाटकीय रूप रूप से गिर गई, वहीं नए तरीके ने एक-दशांश डेटा का उपयोग करने के बावजूद, उन भारी प्रशिक्षित मॉडलों के तुलनीय प्रदर्शन स्तर बनाए रखा। यह सुझाव देता है कि वस्तुओं के बीच ज्यामितीय संबंध पर ध्यान केंद्रित करके, रोबोट दृश्य शोर (विजुअल नॉइज़) से कम भ्रमित होता है। सिस्टम एक भौतिक रोबोटिक हाथ पर वास्तविक दुनिया के कार्यों को संभालने के लिए पर्याप्त मजबूत साबित हुआ, जिसने केवल एक बार देखने के बाद धूल साफ करने या दराज खोलने जैसे कार्य सफलतापूर्वक पूरे किए।

हालांकि, शोधकर्ता सावधानी बरतते हुए कहते हैं कि यह दृष्टिकोण हर प्रकार की गति के लिए सार्वभौमिक समाधान नहीं है। यह विधि उन कार्यों के लिए सबसे अच्छी है जिनमें कठोर वस्तुएं शामिल हैं जिनके स्पष्ट, विशिष्ट इंटरेक्शन चरण होते हैं, जैसे कि एक छेद में पेग डालना या शेल्फ पर किताब रखना। यह उन कार्यों के लिए कम प्रभावी है जिनमें निरंतर संपर्क शामिल है, जैसे कि एक मेज पर नरम वस्तु को धकेलना, या उन स्थितियों के लिए जहाँ वस्तुएं इतनी छोटी या छिपी हुई हैं कि रोबोट उनकी स्थिति का विश्वसनीय रूप से निर्धारण नहीं कर सकता। सिस्टम वस्तुओं को स्पष्ट रूप से देखने की क्षमता पर निर्भर करता है; यदि रोबोट यह अनुमान नहीं लगा सकता कि कोई वस्तु कहाँ है, तो वह सही सापेक्ष गति की गणना नहीं कर सकता। इन सीमाओं के बावजूद, निष्कर्ष रोबोट के सीखने के तरीके में एक प्रभावशाली बदलाव प्रदान करते हैं। रोबोट के चलने के अनावश्यक विवरणों को हटाकर और वस्तुओं के बीच के आवश्यक नृत्य पर ध्यान केंद्रित करके, शोधकर्ताओं ने दिखाया है कि मशीनें पहले से आवश्यक माने जाने वाले डेटा के एक अंश के साथ नए कौशल प्राप्त कर सकती हैं। यह दक्षता हमें एक ऐसे भविष्य के करीब लाती है जहाँ रोबोट मिनटों में नए कार्य सीख सकते हैं, न कि दिनों में, और वास्तविक दुनिया की अप्रत्याशित प्रकृति के अनुसार तेजी से अनुकूलित हो सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →