← नवीनतम पेपर
💻 computer science

CoEnv: Driving Embodied Multi-Agent Collaboration via Compositional Environment

CoEnv एक नवीन ढांचा (framework) प्रस्तुत करता है जो एम्बोडीड मल्टी-एजेंट सहयोग के लिए एक "कंपोजिशनल एनवायरनमेंट" का उपयोग करता है, जो वास्तविक दुनिया और सिमुलेशन घटकों को एकीकृत करता है ताकि जटिल मैनिपुलेशन कार्यों के लिए सुरक्षित रणनीति अन्वेषण, VLM-संचालित एक्शन सिंथेसिस और विश्वसनीय सिम-टू-रियल ट्रांसफर को सक्षम बनाया जा सके।

मूल लेखक: Li Kang, Yutao Fan, Rui Li, Heng Zhou, Yiran Qin, Zhemeng Zhang, Songtao Huang, Xiufeng Song, Zaibin Zhang, Bruno N. Y. Chen, Zhenfei Yin, Dongzhan Zhou, Wangmeng Zuo, Lei Bai

प्रकाशित 2026-04-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Li Kang, Yutao Fan, Rui Li, Heng Zhou, Yiran Qin, Zhemeng Zhang, Songtao Huang, Xiufeng Song, Zaibin Zhang, Bruno N. Y. Chen, Zhenfei Yin, Dongzhan Zhou, Wangmeng Zuo, Lei Bai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ CoEnv पेपर का स्पष्टीकरण दिया गया है, जिसे सरल, रोज़मर्रा की भाषा और रचनात्मक उपमाओं (analogies) के साथ अनुवादित किया गया है।

मुख्य विचार: रोबोटिक टीमवर्क के लिए एक "डिजिटल ट्विन"

कल्पना कीजिए कि आप रोबोट्स की एक टीम को एक बिखरे हुए कमरे को साफ करने के लिए मिलकर काम करना सिखाने की कोशिश कर रहे हैं। यदि आप उन्हें केवल "जाओ और इसे करो" कह देते हैं, तो वे एक-दूसरे से टकरा सकते हैं, झाडू गिरा सकते हैं, या फूलदान को तोड़ सकते हैं। वास्तविक दुनिया के रोबोट महंगे होते हैं, और यदि वे टकराते हैं, तो चीजें टूट जाती हैं।

CoEnv एक नया सिस्टम है जो इसे एक हाइब्रिड "कंपोजिशनल एनवायरनमेंट" (Compositional Environment) बनाकर हल करता है। इसे एक ऐसे वीडियो गेम की दुनिया के रूप में समझें जो वास्तविक दुनिया के साथ पूरी तरह से सिंक (sync) है।

रोबोट्स को वास्तविक दुनिया में अंदाज़ा लगाने और टकराने देने के बजाय, CoEnv उन्हें पहले एक हाई-टेक डिजिटल सिमुलेशन में अपना पूरा प्रदर्शन "रिहर्सल" करने देता है। एक बार जब वे गेम में इसे पूरी तरह से परफेक्ट कर लेते हैं, तो वे उस सटीक योजना को सुरक्षित रूप से निष्पादित करने के लिए वास्तविक रोबोट्स पर स्थानांतरित कर देते हैं।


यह कैसे काम करता है: तीन अंकों वाला नाटक (The Three-Act Play)

पेपर एक तीन-चरणीय प्रक्रिया का वर्णन करता है, जिसे हम एक फिल्म निर्देशित करने से तुलना कर सकते हैं।

अंक 1: सेट को स्कैन करना (Real-to-Sim Reconstruction)

फिल्मिंग से पहले, एक निर्देशक को यह जानने की आवश्यकता है कि सेट वास्तव में कैसा दिखता है।

  • समस्या: वास्तविक दुनिया अव्यवस्थपूर्ण होती है। रोबोट्स को यह जानने की आवश्यकता है कि बॉक्स, ब्रश और अन्य रोबोट्स कहाँ हैं।
  • CoEnv का समाधान: सिस्टम कई कैमरों (जैसे 360-डिग्री स्कैन) से तस्वीरें लेता है और एक परफेक्ट डिजिटल ट्विन बनाने के लिए AI का उपयोग करता है। यह आपके लिविंग रूम की फोटो लेने और तुरंत उसे एक खेलने योग्य वीडियो गेम लेवल में बदलने जैसा है, जहाँ हर वस्तु का वजन, आकार और स्थिति वास्तविक चीज़ के समान ही होती है।

अंक 2: रिहर्सल (Simulation-Conditioned Action Synthesis)

अब जब डिजिटल सेट तैयार है, तो रोबोट्स को यह समझना होगा कि उन्हें कैसे हिलना है। यहीं पर CoEnv चालों की योजना बनाने के लिए दो अलग-अलग "निर्देशकों" (AI दिमागों) का उपयोग करता है।

  • निर्देशक A: "स्टेप-बाय-स्टेप" कोच (इंटरैक्टिव मोड)

    • यह कैसे काम करता है: यह अभिनेताओं के बगल में खड़े एक कोच की तरह है। AI दृश्य को देखता है, कहता है "रोबोट 1, ब्रश उठाओ," और फिर यह देखने के लिए रुकता है कि क्या यह सफल रहा। यदि ब्रश फिसल जाता है, तो कोच कहता है, "ठीक है, अपना हाथ 2 इंच बाईं ओर ले जाने की कोशिश करें।"
    • सबसे अच्छा: उन कार्यों के लिए जिनमें निरंतर जाँच की आवश्यकता होती है, जैसे एक रोबोट से दूसरे रोबोट को एक नाजुक वस्तु सौंपना।
    • सीक्रेट वेपन: यदि रोबोट्स एक-दूसरे का रास्ता रोकते हैं (जैसे एक रोबोट वस्तु को अपने हाथ के पीछे छिपा देता है), तो AI बेहतर दृश्य पाने के लिए वर्चुअल कैमरा को गतिशील रूप से हिला सकता है, ठीक वैसे ही जैसे एक निर्देशक कैमरा ऑपरेटर को सेट के चारों ओर घूमने के लिए कहता है।
  • निर्खीक B: "स्क्रिप्ट राइटर" (इटरेटिव मोड)

    • यह कैसे काम करता है: यह AI अभिनेताओं के हिलने से पहले ही पूरे कार्य के लिए एक पूर्ण स्क्रिप्ट (एक कंप्यूटर प्रोग्राम) लिखता है। यह वह कोड लिखता है जो कहता है, "रोबोट 1 यहाँ जाता है, फिर रोबोट 2 वहाँ जाता है, फिर वे हाई-फाइव करते हैं।" यह सिमुलेशन में स्क्रिप्ट चलाता है। यदि सिमुलेशन में रोबोट्स टकरा जाते हैं, तो AI स्क्रिप्ट को फिर से लिखता है और तब तक प्रयास करता रहता है जब तक कि वह परफेक्ट न हो जाए।
    • सबसे अच्छा: जटिल, सटीक कार्यों के लिए जैसे ब्लॉक को एक के ऊपर एक रखना या फर्श पर झाड़ू लगाना, जहाँ आपको एक सुचारू, पूर्व-नियोजित प्रवाह की आवश्यकता होती है।

अंक 3: प्रीमियर (Sim-to-Real Transfer)

एक बार जब वीडियो गेम में रिहर्सल परफेक्ट हो जाता है, तो वास्तविक शो का समय आता है।

  • सुरक्षा जांच: वास्तविक रोबोट्स के हिलने से पहले, CoEnv एक अंतिम "कोलिजन चेक" (टक्कर की जाँच) करता है। यह पूछता है, "यदि रोबोट A अपना हाथ हिलाता है, तो क्या वह रोबोट B से टकराएगा?"
  • सुचारू चाल: यह डिजिटल योजना को लेता है और गतिविधियों को सुचारू बनाता है ताकि वास्तविक रोबोट झटके न लें।
  • परिणाम: रोबोट वास्तविक दुनिया में उसी सफलता के साथ कार्य को निष्पादित करते हैं जो उनकी सिमुलेशन में थी, बिना कुछ तोड़े।

यह एक बड़ी बात क्यों है?

1. यह रोबोट्स के लिए "फ्लाइट सिम्युलेटर" की तरह है
जिस तरह पायलट वास्तविक विमानों को क्रैश होने से बचाने के लिए सिम्युलेटर में प्रशिक्षण लेते हैं, CoEnv रोबोट्स को एक सुरक्षित डिजिटल स्थान में खतरनाक या जटिल टीमवर्क का अभ्यास करने देता है। इससे पैसा बचता है और हार्डवेयर टूटने से बचता है।

2. यह "ब्लाइंड स्पॉट" (अंध बिंदु) की समस्या को हल करता है
रोबोट्स की एक टीम में, एक रोबोट अक्सर दूसरे का दृश्य बाधित कर देता है। CoEnv स्मार्ट है कि वह समझ जाता है, "मैं बॉक्स को नहीं देख पा रहा हूँ क्योंकि रोब‌تر 2 बीच में है," इसलिए वह बॉक्स को देखने के लिए वर्चुअल कैमरा को हिलाता है, चाल की योजना बनाता है, और फिर रोबोट्स को क्या करना है यह बताता है।

3. यह एक "डेटा फैक्ट्री" बनाता है
चूंकि सिस्टम सिमुलेशन में बहुत तेज़ी से हजारों रिहर्सल चला सकता है, इसलिए यह भारी मात्रा में उच्च-गुणवत्ता वाला प्रशिक्षण डेटा उत्पन्न करता है। यह भविष्य के रोबोट्स को यह सिखाने में मदद करता है कि वे बेहतर टीम के साथी कैसे बनें, बिना इंसानों को घंटों तक उन्हें शारीरिक रूप से हिलाने की आवश्यकता के।

निचोड़ (The Bottom Line)

CoEnv डिजिटल दुनिया (जहाँ हम विचारों को सुरक्षित और सस्ते में टेस्ट कर सकते हैं) और भौतिक दुनिया (जहाँ वास्तविक काम होता है) के बीच एक सेतु है। शक्तिशाली सिमुलेशन और AI प्लानिंग के साथ वास्तविक दुनिया की सेंसिंग को जोड़कर, यह कई रोबोट्स को सहयोग करना, टकराने से बचना और कुशलतापूर्वक काम पूरा करना सीखने की अनुमति देता है।

यह रोबोट्स की एक टीम को एक कमरे में फेंकने और यह उम्मीद करने के बीच का अंतर है कि वे खुद सब समझ लेंगे, बनाम उन्हें एक डिजिटल रिहर्सल स्पेस देने के बीच का अंतर जहाँ वे अभ्यास कर सकते हैं, असफल हो सकते हैं, सीख सकते हैं, और फिर वास्तविकता में एक त्रुटिहीन प्रदर्शन कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →