← नवीनतम पेपर
💻 computer science

IM-ENGINE: Image Editing for Embodied Data Generation

IM-ENGINE एक सिम्युलेटर-ग्राउंडेड पाइपलाइन है जो स्केलेबल, सिमेंटिक रूप से अर्थपूर्ण और भौतिक रूप से निष्पादनीय सुपरविजन उत्पन्न करने के लिए इमेज एडिटिंग को एक इंटरमीडिएट रिप्रेजेंटेशन के रूप में उपयोग करती है, जो विशेष रूप से एम्बोडीड रोबोट लर्निंग के लिए डेक्सट्रस ग्रैस्प सिंथेसिस और गोल-स्टेट जनरेशन को सक्षम बनाती है।

मूल लेखक: Yian Wang, Junyi Cao, Xiaowen Qiu, Chuang Gan

प्रकाशित 2026-09-09
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yian Wang, Junyi Cao, Xiaowen Qiu, Chuang Gan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट लंबे समय से एक कप उठाने या कोट टांगने जैसे सरल कार्य करने के लिए संघर्ष करते रहे हैं। जबकि मशीनें अविश्वसनीय गति और सटीकता के साथ चल सकती हैं, उनमें अक्सर इस बात की सहज समझ की कमी होती है कि किसी वस्तु को उपयोगी बनाने के लिए उसे कैसे पकड़ना है। एक रोबोट सफलतापूर्वक स्प्रे बोतल उठा सकता है, लेकिन यदि वह ट्रिगर के बजाय शरीर को पकड़ता है, तो वह स्प्रे नहीं कर सकता। भौतिक क्षमता और कार्यात्मक इरादे के बीच यह अंतर हमें रोबोट को सिखाने में एक बड़ी बाधा है। पारंपरिक रूप से, शोधकर्ताओं ने इसे या तो कार्यों को करते हुए मनुष्यों की फिल्में बनाकर या कंप्यूटरों को लाखों यादृच्छिक (रैंडम) गतिविधियों का अनुकरण करने के लिए देकर हल करने का प्रयास किया है। पहला दृष्टिकोण धीमा और महंगा है, जबकि दूसरा अक्सर ऐसे परिणाम देता है जो शारीरिक रूप से संभव तो हैं लेकिन व्यावहारिक रूप से बेकार हैं, जैसे कि एक हाथ द्वारा मग को उसके हैंडल के बजाय उसके किनारे से पकड़ना।

मैसाचुसेट्स विश्वविद्यालय एमहर्स्ट और जेनेसिस एआई के शोधकर्ताओं की एक टीम ने एक नया तरीका विकसित किया है, जिसे IM-ENGINE कहा जाता है, जो इस अंतर को पाटने का काम करता है। उनका दृष्टिकोण रोबोट की सीखने की प्रक्रिया को एक रचनात्मक कलाकार और एक सख्त इंजीनियर के बीच बातचीत की तरह मानता है। वे एक कमरे का कंप्यूटर सिमुलेशन शुरू करते हैं जिसमें वस्तुएं होती हैं, और फिर एक इमेज-एडिटिंग टूल का उपयोग करके एक मानव हाथ को किसी वस्तु को पकड़ते हुए या उसे किसी विशिष्ट स्थान पर रखते हुए चित्रित करते हैं। यह संपादित छवि एक दृश्य निर्देश के रूप में कार्य करती है, जो सिस्टम को ठीक-ठीक बताती है कि वांछित परिणाम कैसा दिखना चाहिए। सिस्टम फिर इस 2D चित्र को लेता है और पीछे की ओर काम करता है, सिमुलेशन के ज्ञात नियमों का उपयोग करके हाथ और वस्तु की सटीक 3D स्थिति और अभिविन्यास (ओरिएंटेशन) का पता लगाता है। अंत में, एक फिजिक्स इंजन जांचता है कि प्रस्तावित क्रिया वास्तव में संभव है या नहीं, और उन विचारों को खारिज कर देता है जिनसे वस्तु तैरती, गिरती या मेज के आर-पार जाती। परिणाम रोबोटिक गतिविधियों का एक ऐसा पुस्तकालय है जो न केवल भौतिक रूप से वैध है बल्कि अर्थपूर्ण रूप से भी सही है, जो रोबोट को ड्रिल को उसके हैंडल से पकड़ना या एक मानव की तरह पेड़ की शाखा पर मग लटकाना सिखाता है।

इस पद्धति का मूल एक चार-चरणीय प्रक्रिया पर निर्भर करता है जो एक साधारण ड्राइंग को रोबोट-तैयार निर्देश में बदल देती है। सबसे पहले, सिस्टम सिमुलेशन से एक दृश्य प्रस्तुत करता है, जिसमें गहराई और ज्यामिति के सटीक माप होते हैं। एक इमेज-एडिटिंग मॉडल इस तस्वीर को संशोधित करता है, जिसमें एक मानव हाथ को एक कार्यात्मक मुद्रा में डाला जाता है या किसी वस्तु को वांछित अंतिम अवस्था में ले जाया जाता है, जैसे कि एक प्लेट को डिश रैक में खिसकाना। यह चरण "इरादे" को कैप्चर करता है, जो दुनिया के साथ एक विशिष्ट तरीके से बातचीत करने की मानवीय इच्छा को दर्शाता है। इसके बाद, सिस्टम मूल सिमुलेशन डेटा का उपयोग दृश्य को तीन आयामों (3D) में पुनर्गठित करने के लिए एक मार्गदर्शक के रूप में करता है। क्योंकि कंप्यूटर जानता है कि कैमरा कहाँ था और मूल छवि में वस्तुएं कितनी गहरी हैं, इसलिए वह सटीक रूप से गणना कर सकता है कि हाथ या वस्तु वास्तविक दुनिया में कहाँ होनी चाहिए, भले ही छवि को बदला गया हो।

एक बार जब सिस्टम के पास वांछित क्रिया का 3D मॉडल होता है, तो वह इसे एक कठोर भौतिक परीक्षण के अधीन करता है। कंप्यूटर गति का अनुकरण करता है, टकराव और स्थिरता की जांच करता है। यदि प्रस्तावित पकड़ फिसल जाएगी, या यदि वस्तु को रखने पर वह पलट जाएगी, तो सिस्टम उस प्रयास को त्याग देता है और फिर से प्रयास करता है। यह सुनिश्चित करता है कि उत्पन्न की गई प्रत्येक गति केवल एक सुंदर चित्र नहीं है, बल्कि एक भौतिक रूप से निष्पादABLE क्रिया है। उन कार्यों के लिए जिनमें जटिल गति की आवश्यकता होती है, जैसे कि एक संकीली शाखा पर मग को पिरोना, सिस्टम एक पथ की योजना बनाता है जो बाधाओं से बचता है, यह सुनिश्चित करता है कि रोबोट बिना कुछ गिराए लक्ष्य तक पहुँच सके। अंतिम आउटपुट ट्रैजेक्टरीज (पथों) का एक सेट है जिसे एक वास्तविक रोबोट पालन कर सकता है, जिसमें कार्य को पूरा करने के लिए आवश्यक उंगलियों की स्थिति और हाथ की गतिविधियाँ शामिल हैं।

शोधकर्ताओं ने विभिन्न चुनौतीपूर्ण कार्यों पर इस प्रणाली का परीक्षण किया, जिसमें पावर टूल्स, स्प्रे बोतलें और वाइन ग्लास को पकड़ना, साथ ही वस्तुओं को कंटेनरों जैसे कि डिश रैक और मग ट्री में रखना शामिल था। शैडोहैंड (ShadowHand) रोबोट के परीक्षणों में, सिस्टम ने वस्तुओं को उठाने में 99.4% सफलता दर और सही कार्यात्मक पकड़ करने में 83.2% सफलता दर प्राप्त की। यह पिछले तरीकों की तुलना में एक महत्वपूर्ण सुधार है, जो अक्सर वस्तु को उठाने में तो सफल होते थे लेकिन उसे सही तरीके से पकड़ने में विफल रहते थे। उदाहरण के लिए, जबकि अन्य सिस्टम 97% बार स्प्रे बोतल उठाने में सफल रहे, वे केवल 7% बार ट्रिगर को सही ढंग से पकड़ पाए। इसके विपरीत, नया तरीका 69% बार ट्रिगर को सही ढंग से पकड़ता है, जो दर्शाता है कि दृश्य मार्गदर्शन ने प्रभावी रूप से रोबोट को कार्यात्मक संपर्क की विशिष्ट बारीकियों को सिखाया।

यह प्रणाली 'गोल-स्टेट जनरेशन' (लक्ष्य-अवस्था निर्माण) के लिए भी प्रभावी सिद्ध हुई, जहाँ रोबोट को किसी वस्तु को एक विशिष्ट विन्यास में रखना होता है, जैसे कि कैंची को रैक पर लटकाना या एक ट्यूब को होल्डर में डालना। इन संबंध-प्रधान कार्यों में, जहाँ अंतिम स्थिति दो वस्तुओं के सटीक संरेखण पर निर्भर करती है, नया तरीका 40 में से 35 प्रयासों में सफल रहा। इसने अन्य दृष्टिकोणों को बहुत पीछे छोड़ दिया जो स्थिति का अनुमान लगाने या सरल दृश्य संकेतों का उपयोग करने पर निर्भर थे, जो अक्सर कार्य की सख्त सीमाओं को समझने में विफल रहे। शोधकर्ताओं ने पाया कि एक स्पष्ट दृश्य लक्ष्य से शुरू करके और भौतिकी के माध्यम से उसे परिष्कृत करके, सिस्टम उन समस्याओं को हल कर सकता था जो स्वचालित डेटा निर्माण के लिए पहले बहुत कठिन थीं।

यह सत्यापित करने के लिए कि ये सिम्युलेटेड सबक वास्तविक दुनिया में अनुवादित हो सकते हैं, टीम ने IM-ENGINE द्वारा उत्पन्न डेटा का उपयोग करके एक रोबol को प्रशिक्षित किया और फिर इसे भौतिक वस्तुओं के साथ परखा। रोबोट ने मग पकड़ने और हैंगर लटकाने जैसे कार्यों को सफलतापूर्वक किया, क्रमशः 80% और 70% की सफलता दर प्राप्त की। इसने प्रदर्शित किया कि आभासी दुनिया में निर्मित डेटा एक भौतिक रोबोट को वास्तविक दुनिया की वस्तुओं को संभालने के लिए सिखाने हेतु पर्याप्त मजबूत था। शोधकर्ताओं ने उल्लेख किया कि हालांकि यह प्रणाली अत्यधिक प्रभावी है, लेकिन यह पूर्ण नहीं है; यह कभी-कभी एक ऐसी छवि बना सकती है जो एक असंभव संपर्क को दर्शाती है, या भौतिक सिमुलेशन एक सूक्ष्म टकराव को मिस कर सकता है। हालाँकि, समग्र ढांचा उच्च-गुणवत्ता वाले, कार्य-विशिष्ट डेटा को उत्पन्न करने का एक शक्तिशाली नया तरीका प्रदान करता है जिसकी रोबोट को जटिल हेरफेर कौशल सीखने के लिए आवश्यकता होती है।

इस कार्य के निहितार्थ केवल बेहतर रोबोटिक हाथों तक ही सीमित नहीं हैं। यह दिखाते हुए कि इमेज एडिटिंग का उपयोग मानव इरादे और मशीन निष्पादन के बीच एक सेतु के रूप में किया जा सकता है, शोधकर्ताओं ने रोबोट लर्निंग के लिए एक नया मार्ग खोल दिया है। महंगे मानव प्रदर्शनों या अंतहीन यादृच्छिक परीक्षणों पर निर्भर रहने के बजाय, अब रोबोट भौतिक वास्तविकता में आधारित दृश्य उदाहरणों से सीख सकते हैं। यह दृष्टिकोण निरंतर मानवीय हस्तक्षेप के बिना वस्तुओं और कार्यों की एक विस्तृत श्रृंखला को कवर करते हुए, विविध प्रशिक्षण डेटा के तेजी से उत्पादन की अनुमति देता है। जैसे-जैसे रोबोट हमारे दैनिक जीवन में एकीकृत हो रहे हैं, उन्हें न केवल यह सिखाने की क्षमता कि कैसे चलें, बल्कि यह भी सिखाना कि दुनिया के साथ सार्थक रूप से कैसे बातचीत करें, आवश्यक होगा। IM-ENGINE सिस्टम एक आशाजनक भविष्य की ओर एक कदम है, जो सरल दृश्य निर्देशों को विश्वसनीय, भौतिक क्रियाओं में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →