← नवीनतम पेपर
💻 computer science

Scene2Demo: Self-Evolving Embodied Data Generation via Object-Action Graph

Scene2Demo एक स्व-विकसित (self-evolving) फ्रेमवर्क है जो ऑब्जेक्ट-एक्शन ग्राफ और फीडबैक-संचालित परिशोधन (feedback-driven refinement) का लाभ उठाकर एकल छवियों से स्वचालित रूप से उच्च-गुणवत्ता वाला, निष्पादन योग्य एम्बोडीड डेटा (embodied data) उत्पन्न करता है, जो कार्य नियोजन की सफलता को महत्वपूर्ण रूप से सुधारता है और प्रभावी डाउनस्ट्रीम रोबोट नीति शिक्षण को सक्षम बनाता है।

मूल लेखक: Xiang Liu, Sen Cui, Guocai Yao, Zhong Cao, Jingheng Ma, Min Zhang, Changshui Zhang

प्रकाशित 2026-08-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiang Liu, Sen Cui, Guocai Yao, Zhong Cao, Jingheng Ma, Min Zhang, Changshui Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

हमारे घरों में घूम सकने वाले और दैनिक कार्यों में मदद करने वाले रोबोट लंबे समय से विज्ञान कथाओं का एक सपना रहे हैं, लेकिन उन्हें बनाना एक हठी और कठिन वास्तविकता साबित हुआ है। मुख्य समस्या केवल मशीन को अपना हाथ चलाना सिखाना नहीं है, बल्कि उसे एक अव्यवस्थित, अप्रत्याशित दुनिया को समझना और यह तय करना सिखाना है कि आगे क्या करना है। इन कौशलों को सीखने के लिए, रोबोट्स को पारंपरिक रूप से भारी मात्रा में डेटा की आवश्यकता होती है: किसी इंसान द्वारा कार्य करने वाले वीडियो के हजारों घंटे, या कंप्यूटर सिमुलेशन में लाखों बार प्रयास और त्रुटि (ट्रायल-एंड-एरर) के प्रयास। इस डेटा को हाथ से एकत्र करना धीमा, महंगा और अक्सर दुर्लभ या खतरनाक परिदृश्यों के लिए असंभव होता है। शोधकर्ताओं ने इस डेटा को स्वचालित रूप से उत्पन्न करने के लिए आर्टिफिशियल इंटेलिजेंस का सहारा लिया है, लेकिन शुरुआती प्रयासों में अक्सर ऐसे सिमुलेशन बने जो वास्तविक तो दिखते थे लेकिन भौतिकी के नियमों को तोड़ देते थे, या ऐसे निर्देश दिए जो एक रोबोट वास्तव में पालन नहीं कर सकता था। चुनौती एक ऐसा सिस्टम बनाने की थी जो कमरे की एक एकल तस्वीर और एक सरल अनुरोध ले सके, और फिर एक कार्यात्मक, भौतिकी-आधारित सिमुलेशन बना सके जहाँ एक रोबोट कार्य का अभ्यास कर सके, और तब तक विफल होकर सुधार कर सके जब तक कि वह इसे सही ढंग से न कर ले।

शोधकर्ताओं की एक टीम ने एक नया सिस्टम पेश किया है जिसे SCENE2DEMO कहा जाता है, जो एक 'स्व-सुधार डेटा फैक्ट्री' के रूप में कार्य करके इस समस्या का समाधान करता है। यह प्रक्रिया वास्तविक दुनिया के कमरे की एक तस्वीर, जैसे कि रसोई, और उपयोगकर्ता के एक सरल टेक्स्ट कमांड, जैसे कि "ग्लास उठाओ," से शुरू होती है। सिस्टम पहले उन्नत कंप्यूटर विजन का उपयोग करके उस फोटो को एक पूरी तरह से इंटरैक्टिव 3D सिमुलेशन में पुनर्गठित करता है। यह वस्तुओं, उनके आकार और उनकी स्थिति की पहचान करता है, जिससे एक दृश्य का 'डिजिटल ट्विन' बनता है जो गुरुत्वाकर्षण और टकराव जैसे भौतिक नियमों का सम्मान करता है। एक बार जब यह आभासी कमरा बन जाता है, तो सिस्टम केवल यह अनुमान नहीं लगाता कि रोबोट को कैसे हिलना चाहिए; बल्कि यह उपयोगकर्ता के अनुरोध को छोटे, प्रबंधनीय चरणों के तार्किक क्रम में तोड़ देता है। यह कार्य को एक मानचित्र की तरह मानता है, जहाँ यात्रा का प्रत्येक पड़ाव एक विशिष्ट क्रिया है, जैसे दरवाजा खोलना या किसी वस्तु को उठाना, और यह सुनिश्चित करता है कि एक चरण का अंत दूसरे चरण की शुरुआत के लिए बिल्कुल उपयुक्त हो।

इसके बाद सिस्टम इस योजना को सिमुलेशन में चलाने का प्रयास करता है। यदि रोबोट सफल होता है, तो सिस्टम भविष्य के सीखने के लिए गतिविधियों और कैमरा दृश्यों के पूरे अनुक्रम को एक आदर्श उदाहरण के रूप में रिकॉर्ड करता है। हालाँकि, SCENE2DEMO की असली शक्ति उस समय निहित है जब रोबोट विफल होता है। कई पिछले सिस्टमों में, विफलता को बस हटा दिया जाता था। यहाँ, सिस्टम एक 'स्व-विकास तंत्र' (self-evolution mechanism) का उपयोग करता है। जब कोई चरण गलत होता है—शायद रोबोट दरवाजे से टकरा जाता है या कोई वस्तु गिरा देता है—तो दो विशेष डिजिटल एजेंट जांच के लिए आगे आते हैं। एक एजेंट एक 'सुरक्षा निरीक्षक' के रूप में कार्य करता है, जो विफलता के वीडियो को कई कैमरा कोणों से देखकर ठीक से पता लगाता है कि क्या गलत हुआ। दूसरा एजेंट एक 'पर्यवेक्षक' के रूप में कार्य करता है, जो उस दृश्य साक्ष्य का उपयोग करके योजना को फिर से लिखता है। यह सुझाव दे सकता है कि रोबोट के आधार को थोड़ा बाईं ओर खिसकाएं, या हाथ को थोड़ा और आगे बढ़ाएं, इससे पहले कि कार्य को फिर से आजमाया जाए। प्रयास करने, विफल होने, विश्लेषण करने और सुधारने का यह लूप स्वचालित रूप से तब तक चलता रहता है जब तक कि रोबोट सफलतापूर्वक कार्य पूरा नहीं कर लेता।

शोधकर्ताओं ने सौ से अधिक विभिन्न परिदृश्यों पर इस दृष्टिकोण का परीक्षण किया, जिसमें कप उठाने जैसे सरल कार्यों से लेकर फ्रिज में ग्लास रखने जैसे जटिल, बहु-चरणीय कार्यों तक शामिल थे। स्व-सुधार सुविधा के बिना, सिस्टम साधारण कार्यों में लगभग 72 प्रतिशत सफल रहा। जब उन्होंने अधिक जटिल, लंबे समय तक चलने वाले कार्यों के लिए स्व-विकास लूप जोड़ा, तो सफलता दर में काफी सुधार हुआ, और व्यक्तिगत चरणों की गुणवत्ता बहुत अधिक विश्वसनीय हो गई। सिस्टम एक उच्च-गुणवत्ता वाला प्रशिक्षण डेटा उत्पन्न करने में सक्षम था जिसका उपयोग फिर एक वास्तविक रोबोट पॉलिसी को सिखाने के लिए किया गया। जब एक रोबोट ने इन स्वचालित रूप से उत्पन्न उदाहरणों से सीखा, तो उसने फ्रिज खोलने पर 96 प्रतिशत और ग्लास उठाने पर 92 प्रतिशत की सफलता दर हासिल की, जिससे यह सिद्ध हुआ कि मशीन द्वारा बनाया गया डेटा वास्तविक दुनिया में कार्य करने के लिए रोबोट को सिखाने हेतु पर्याप्त मजबूत था।

यह कार्य बताता है कि हमें इस बात को मैन्युअल रूप से रिकॉर्ड करने की आवश्यकता नहीं है कि एक रोबोट दुनिया के साथ हर संभव तरीके से कैसे व्यवहार कर सकता है। इसके बजाय, एक यथार्थवादी सिमुलेशन के साथ एक फीडबैक लूप को जोड़कर, जो सिस्टम को अपनी गलतियों से सीखने की अनुमति देता है, हम विश्वसनीय प्रशिक्षण डेटा के विशाल पुस्तकालय बना सकते हैं। यह सिस्टम जादू या पूर्ण दृष्टि पर निर्भर नहीं है; यह समस्याओं को तोड़ने, उनका परीक्षण करने और दृश्य साक्ष्य के आधार पर समाधान को परिष्कृत करने की एक संरचित प्रक्रिया पर निर्भर करता है। हालांकि वर्तमान सिस्टम विशिष्ट प्रकार की गतिविधियों और वस्तुओं तक सीमित है, और यह अभी भी सबसे जटिल भौतिक बाधाओं के साथ संघर्ष करता है, यह एक स्पष्ट मार्ग प्रदर्शित करता है। प्रशिक्षण डेटा के निर्माण को स्वचालित करके, यह दृष्टिकोण अंततः रोबोट को नए कौशल तेजी से और सुरक्षित रूप से सीखने में सक्षम बना सकता है, केवल एक कमरे की तस्वीर देखकर और उन्हें क्या करना है यह बताए जाने पर।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →