← नवीनतम पेपर
💻 computer science

GraphPoint: Semantic Entity Graphs and Point Trajectories for Compositional Robot Manipulation

यह शोधपत्र GraphPoint प्रस्तुत करता है, जो रोबोटिक हेरफेर में निर्देश-निर्भर सामान्यीकरण (instruction-dependent generalization) में सुधार के लिए अनुमानित ग्रिपर प्रक्षेप पथों (gripper trajectories) के माध्यम से सिमेंटिक एंटिटी ग्राफ को ज्यामितीय नियंत्रण से जोड़ता है, जिसे नए CoMani बेंचमार्क द्वारा मान्य किया गया है जो उप-कार्यों (subtasks) के बीच और उप-कार्यों के भीतर संरचनात्मक पुन: उपयोग (compositional reuse) का परीक्षण करने के लिए डिज़ाइन किया गया है।

मूल लेखक: Kang Luo, Hesheng Wang

प्रकाशित 2026-09-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kang Luo, Hesheng Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट जो कप उठा सकते हैं या मेज पर कटोरा रख सकते हैं, अनुसंधान प्रयोगशालाओं में एक आम दृश्य बन गए हैं, फिर भी ये मशीनें अक्सर संघर्ष करती हैं जब निर्देश थोड़े से बदल जाते हैं। एक रोबोट जिसे प्लेट पर कटोरा रखने के लिए प्रशिक्षित किया गया है, वह विफल हो सकता है यदि उसे उसी कटोरे को प्लेट के दाईं ओर रखने के लिए कहा जाए, या यदि उसे उसे उठाने के बजाय वहां खिसकाने (स्वीप करने) के लिए कहा जाए। ऐसा इसलिए होता है क्योंकि कई वर्तमान प्रणालियाँ किसी दृश्य की एक विशिष्ट तस्वीर को एक विशिष्ट गति के साथ मिलाने के लिए सीखती हैं, न कि वास्तव में उन शब्दों को समझने के लिए जो क्या करना है उसका वर्णन करते हैं। जब दृश्य दृश्य परिचित लगता है, तो रोबोट उस विजुअल शॉर्टकट पर निर्भर हो जाता है और नए निर्देश को अनदेखा कर देता है। रोबोटों को वास्तव में अनुकूलन करने में सक्षम बनाने के लिए, शोधकर्ताओं को उन्हें किसी वस्तु के अर्थ को उसके स्थान से अलग करना सिखाने और यह समझने की आवश्यकता है कि कार्यों को नए तरीकों से कैसे मिलाया और जोड़ा जा सकता है।

शंघाई जियाओ टोंग विश्वविद्यालय के शोधकर्ताओं की एक टीम ने इस समस्या को हल करने के लिए एक नया दृष्टिकोण विकसित किया है, जिसमें 'ग्राफपॉइंट' (GraphPoint) नामक एक प्रणाली पेश की गई है। रोबोट के दृश्य को एक एकल, असंरचित छवि या बिंदुओं के क्लाउड के रूप में मानने के बजाय, यह प्रणाली दृश्य को विशिष्ट भूमिकाओं के मानचित्र में विभाजित करती है। यह रोबोट के हाथ, स्थानांतरित की जाने वाली वस्तु और लक्ष्य गंतव्य को अलग-अलग संस्थाओं के रूप में पहचानती है। इसके बाद, प्रणाली मानव निर्देश को पढ़ने और उसे एक संरचित योजना में अनुवाद करने के लिए एक बड़े भाषा मॉडल (Large Language Model) का उपयोग करती है जो यह परिभाषित करती है कि ये भूमिकाएँ बिल्कुल कैसे परस्पर क्रिया करेंगी। उदाहरण के लिए, यदि कोई व्यक्ति कहता है "कटोरे को प्लेट पर रखें," तो प्रणाली समझती है कि कटोरा वह वस्तु है जिसे स्थानांतरित किया जाना है, प्लेट लक्ष्य है, और क्रिया रखना (प्लेसिंग) है। महत्वपूर्ण रूप से, यह इन भूमिकाओं को अपने आंतरिक तर्क में अलग रखती है, जिससे इसे बिना पूरे मूवमेंट को फिर से सीखे, एक अलग वस्तु या एक अलग लक्ष्य पर वही "रखने" वाला तर्क लागू करने की अनुमति मिलती है।

शोधकर्ताओं ने अपने विचार का परीक्षण चुनौतियों के एक नए सेट का उपयोग करके किया, जिसे उन्होंने 'कोमानी' (CoMani) नाम दिया था। यह परीक्षण क्षेत्र विशेष प्रकार की सीख को अलग करने के लिए बनाया गया था। परीक्षणों के एक सेट में, रोबोट को एक ही क्रिया करने के लिए कहा गया था, जैसे किसी वस्तु को नीचे रखना, लेकिन उसे कहाँ रखना है इसके बारे में अलग-अलग निर्देश दिए गए थे, जैसे "प्लेट पर" बनाम "प्लेट के दाईं ओर।" दूसरे सेट में, रोबोट को विभिन्न प्रकार की गतिविधियों का उपयोग करना था, जैसे किसी वस्तु को उठाने के बजाय खिसकाना। अंत में, उन्होंने परीक्षण किया कि क्या रोबोट सरल कार्यों को एक लंबे अनुक्रम (सीक्वेंस) में जोड़ सकता है जिसे उसने पहले कभी नहीं देखा था, जैसे कि एक विशिष्ट क्रम में एक बोतल, फिर एक कटोरा, फिर पनीर को हिलाना। लक्ष्य यह देखना था कि क्या रोबोट कमरे के विजुअल पैटर्न को याद करने के बजाय सुने गए शब्दों पर भरोसा कर सकता है।

परिणामों ने दिखाया कि ग्राफपॉइंट ने इन परीक्षणों में अन्य अग्रणी तरीकों की तुलना में काफी बेहतर प्रदर्शन किया। जब निर्देश ने वस्तुओं के बीच संबंध को बदल दिया, जैसे कि किसी वस्तु को ऊपर रखने के बजाय दाईं ओर रखने के लिए कहना, तो ग्राफपॉइंट लगभग सभी मामलों में सफल रहा, जबकि अन्य प्रणालियाँ अक्सर विफल रहीं क्योंकि वे दृश्य के लेआउट पर अटकी हुई थीं। यह प्रणाली नए प्रकार के कार्यों को सीखने में भी सक्षम सिद्ध हुई। जब एक नॉब (knob) को घुमाने के लिए कहा गया, जो कि एक कार्य था जिसे उसे पहले कभी नहीं दिखाया गया था, तो इसने सफलतापूर्वक एक नई वस्तु पर रोटेशन (घुमाने) की अवधारणा को लागू किया। सबसे प्रभावशाली बात यह थी कि, एक ऐसे तीन-चरणीय अनुक्रम का सामना करने पर जिसे उसने कभी भी एक पूर्ण इकाई के रूप में अभ्यास नहीं किया था, सिस्टम व्यक्तिगत रूप से सीखे गए सरल कौशल को जटिल, बहु-चरणीय निर्देशों का पालन करने के लिए संयोजित करने में सक्षम था। इसमें से दो चरणों को 80 प्रतिशत से अधिक प्रयासों में सही ढंग से पूरा किया और लगभग आधे परीक्षणों में तीनों चरणों को पूरा किया। इसने प्रदर्शित किया कि रोबोट सीखे गए सरल कौशलों को जटिल, बहु-चरणीय निर्देशों का पालन करने के लिए जोड़ सकता है।

इस प्रणाली की सफलता इस बात पर निर्भर करती है कि यह सूचना को कैसे संसाधित करती है। कमरे में पूर्ण स्थितियों (absolute positions) के साथ काम करने के बजाय, प्रणाली सब कुछ रोबोट के अपने हाथ के सापेक्ष वर्णित करती है। यह रोबोट को यह समझने की अनुमति देता है कि वस्तु को "दाईं ओर" ले जाना वही रहता है चाहे वस्तु कहीं से भी शुरू हुई हो। प्रणाली एक ऐसी तकनीक का भी उपयोग करती है जहाँ वह प्रशिक्षण के दौरान वस्तुओं के विस्तृत आकार को अस्थायी रूप से छिपा देती है, जिससे उसे केवल वस्तुओं के दिखने के पैटर्न को याद करने के बजाय भाषा के निर्देशों और वस्तुओं की भूमिकाओं पर ध्यान केंद्रित करने के लिए मजबूर किया जाता है। रोबोट की गतिविधियों को भूमिकाओं और संबंधों के सिमेंटिक मैप में स्थापित करके, शोधकर्ताओं ने एक ऐसी नीति बनाई जो भाषा परिवर्तनों के प्रति प्रतिक्रिया करती है, भले ही दृश्य दृश्य समान बना रहे। यह कार्य सुझाव देता है कि गतिशील वातावरण में रोबोटों को वास्तव में उपयोगी बनाने के लिए, उन्हें विजुअल पैटर्न को सत्य के एकमात्र स्रोत के रूप में मानने के बजाय, निर्देशों को क्रिया के प्राथमिक मार्गदर्शक के रूप में मानना सीखना होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →