← नवीनतम पेपर
🤖 AI

Any4D: Open-Prompt 4D Generation from Natural Language and Images

यह शोध पत्र प्रिमिटिव एम्बोडीड वर्ल्ड मॉडल्स (PEWM) का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो एक मॉड्यूलर VLM प्लानर और स्टार्ट-गोल हीटमैप तंत्र द्वारा निर्देशित सूक्ष्म प्रिमिटिव मोशन में जटिल कार्यों को विभाजित करके एम्बोडीड AI में डेटा की कमी और लॉन्ग-होरिजन जनरेशन की चुनौतियों पर विजय प्राप्त करता है, जिससे स्केलेबल, व्याख्या योग्य और सामान्य-उद्देश्यीय रोबोटिक नियंत्रण सक्षम होता है।

मूल लेखक: Hao Li, Qiao Sun

प्रकाशित 2026-03-30
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Hao Li, Qiao Sun

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को घर के काम करना सिखाने की कोशिश कर रहे हैं।

पुराना तरीका: "मैराथन धावक" की समस्या
वर्तमान में, अधिकांश AI शोधकर्ता रोबोट को जटिल, लंबे कार्य (जैसे "पूखी रसोई साफ करना") करने वाले वीडियो के हजारों घंटों के फुटेज दिखाकर सिखाने की कोशिश करते हैं। यह एक मैराथन धावक को केवल लोगों के मैराथन दौड़ते हुए वीडियो दिखाकर सिखाने जैसा है।

  • समस्या: ऐसे पर्याप्त वीडियो ढूंढना अविश्वसनीय रूप से कठिन है। भले ही आप उन्हें पा लें, AI भ्रमित हो जाता है। वह सूक्ष्म विवरणों को समझने में संघर्ष करता है (जैसे कि ठीक से स्पंज को कितनी जोर से दबाना है) क्योंकि वह एक बार में पूरे मैराथन को याद करने की कोशिश कर रहा होता है। यह बहुत अधिक जानकारी है, बहुत तेज़ है, और रोबोट अंततः अनाड़ी और धीमा हो जाता है।

नया विचार: "LEGO ब्रिक" दृष्टिकोण (Any4D)
यह पेपर प्रिमिटिव एम्बोडीड वर्ल्ड मॉडल्स (PEWM) नामक एक नई विधि पेश करता है। रोबोट को पूरा मैराथन सिखाने के बजाय, वे हर चीज़ को छोटे, सरल बिल्डिंग ब्लॉक्स में तोड़ देते हैं—जैसे कि LEGO ब्रिक्स या व्यक्तिगत नृत्य की मुद्राएं।

यह इस प्रकार काम करता है, सरल उपमाओं का उपयोग करते हुए:

  1. लंबे मैराथन नहीं, बल्कि छोटी लहरें (Short Bursts):
    AI से 10 मिनट का वीडियो बनाने के लिए कहने के बजाय कि एक रोबोट कमरा साफ कर रहा है, हम केवल उसे रोबोट द्वारा कप उठाने का 2 सेकंड का क्लिप बनाने के लिए कहते हैं।
  • उपमा: इसे पियानो बजाना सीखने जैसा समझें। आप एक पूरी सिम्फनी बजाने की कोशिश करके शुरुआत नहीं करते हैं। आप पहले एक एकल नोट का अभ्यास करते हैं, फिर एक साधारण स्केल का। एक बार जब आप छोटे नोट्स में महारत हासिल कर लेते हैं, तो आप गाना बजा सकते हैं। इन छोटी "प्रिमिटिव" गतियों पर ध्यान केंद्रित करके, AI बहुत तेज़ी से सीखता है और कम गलतियाँ करता है।
  1. "स्मार्ट मैनेजर" (The VLM Planner):
    यह सिस्टम एक "विज़न-लैंग्वेज मॉडल" (VLM) का उपयोग एक स्मार्ट मैनेजर के रूप में करता है। यह मैनेजर मानवीय भाषा ("लाल कप उठाओ") को समझता है और जानता है कि किस छोटे "LEGO ब्रिक" (प्रिमिटिव मोशन) का उपयोग करना है।
  • उपमा: एक निर्माण स्थल की कल्पना करें। VLM एक फोरमैन है जो ब्लूप्रिंट पढ़ता है और कहता है, "ठीक है टीम, हमें यहाँ एक ईंट रखनी है, फिर वहाँ दूसरी।" वह दीवार खुद नहीं बनाता; वह बस श्रमिकों (वीडियो जनरेटर) को बताता है कि अगला छोटा हिस्सा कहाँ रखना है।
  1. "जीपीएस हीटमैप" (Start-Goal Guidance):
    यह सुनिश्चित करने के लिए कि रोबोट भटक न जाए, सिस्टम एक "स्टार्ट-गोल हीटमैप" का उपयोग करता है।
  • उपमा: यह एक GPS नेविगेशन ऐप की तरह है। यह कार को पहिए कैसे घुमाने हैं यह नहीं बताता; यह बस "यहाँ" (शुरुआत) से "वहाँ" (लक्ष्य) तक एक चमकता हुआ रास्ता दिखाता है। रोबोट यह सुनिश्चित करने के लिए उस चमकते रास्ते का अनुसरण करता है कि वह वास्तव में गंतव्य तक पहुँचे, भले ही कार्य जटिल हो जाए।

यह क्यों महत्वपूर्ण है
बड़े, डरावने कार्यों को छोटे, प्रबंधनीय टुकड़ों में तोड़कर, यह नई विधि:

  • डेटा बचाता है: आपको जटिल वीडियो के लाखों घंटों की आवश्यकता नहीं है; आपको बस सरल गतिविधियों के कई छोटे क्लिप चाहिए।
  • समय बचाता है: रोबोट तेज़ी से सोचता है क्योंकि वह एक समय में केवल छोटी पहेलियों को हल कर रहा होता है।
  • समझ में आता है: मनुष्यों के लिए यह समझना आसान है कि रोबोट ने कुछ क्यों किया क्योंकि यह सरल, तार्किक चरणों की एक श्रृंखला है।

निष्कर्ष (The Bottom Line)
यह पेपर सुझाव देता है कि रोबोट को "GPT मोमेंट" (जहाँ वे वास्तव में स्मार्ट और सहायक बन जाते हैं) देने के लिए, हमें उन्हें तुरंत मैराथन दौड़ना नहीं सिखाना चाहिए। इसके बजाय, हमें उन्हें छोटे, सटीक कदम उठाना सिखाना चाहिए, और फिर उन कदमों को जोड़ने के लिए एक स्मार्ट मैनेजर का उपयोग करना चाहिए ताकि जटिल, बुद्धिमान व्यवहार बनाया जा सके। यह "रोबोट को इंसान बनाना" जैसे असंभव कार्य को "डॉट्स को जोड़ने" के एक प्रबंधनीय खेल में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →