← नवीनतम पेपर
🤖 machine learning

WorldDiT: A Unified Diffusion Architecture for World and Action Modeling

WorldDiT एक एकीकृत डिफ्यूजन ट्रांसफॉर्मर आर्किटेक्चर पेश करता है जो निरंतर कार्यों (continuous actions) को उत्पन्न करने और भविष्य के विज़ुअल फ्रेम्स की भविष्यवाणी करने का कार्य एक साथ करता है, जिससे बड़े प्रीट्रेंड विज़न-लैंग्वेज मॉडल्स पर निर्भर किए बिना कई रोबोट मैनिपुलेशन बेंचमार्क में अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Sen Wang, R. Gnana Praveen, Bidhan Roy, Marcos Villagra

प्रकाशित 2026-07-28
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sen Wang, R. Gnana Praveen, Bidhan Roy, Marcos Villagra

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ रोबोट केवल निर्देशों की एक कठोर सूची का पालन नहीं करते, बल्कि वास्तव में इस बारे में "सपने" देखते हैं कि आगे क्या होने वाला है। यह रोबोट लर्निंग का नया मोर्चा है, एक ऐसा क्षेत्र जो मशीनों को हमारे अव्यवस्थित, वास्तविक संसार में चलना सिखाने की कोशिश कर रहा है। लंबे समय तक, सबसे बड़ी सफलताएँ एक विशिष्ट रेसिपी से आईं: एक विशाल, पूर्व-प्रशिक्षित "मस्तिष्क" लें जो भाषा और चित्रों के बारे में सब कुछ जानता हो (जैसे कि एक सुपर-स्मार्ट विश्वकोश जो देख भी सकता है), और उससे एक रोबोट का हाथ जोड़ दें। यह काम तो करता है, लेकिन यह वैसा ही है जैसे किसी पिल्ले को पहले प्रोफेसर बनने के लिए प्रशिक्षित करके उसे चीज़ें लाना सिखाना; यह भारी, महंगा है और यह बताना कठिन है कि रोबोट कार्य सीख रहा है या केवल प्रोफेसर के नोट्स की नकल कर रहा है। बड़ा सवाल जो वैज्ञानिक पूछ रहे हैं वह है: क्या हम एक ऐसा रोबोट मस्तिष्क बना सकते हैं जो छोटा हो, हल्का हो, और एक साथ हिलना और भविष्य की भविष्यवाणी करना सीख सके, बिना उस विशाल, पहले से लोड किए गए विश्वकोश की आवश्यकता के?

WorldDiT से मिलिए, एक नया रोबोट मस्तिष्क जिसे Bagel Labs के शोधकर्ताओं द्वारा डिजाइन किया गया है। WorldDiT को एक ऐसे छात्र के रूप में न देखें जो पाठ्यपुस्तक की नकल कर रहा है, बल्कि एक युवा कलाकार के रूप में देखें जो अपने स्वयं के भविष्य की फिल्म देखकर पेंटिंग करना सीख रहा है। एक विशाल, पूर्व-प्रशिक्षित "विज़न-लैंग्वेज मॉडल" (एक विशाल AI जो छवियों और टेक्स्ट का वर्णन करना जानता है) पर निर्भर रहने के बजाय, जो इसे बताता है कि क्या करना है, WorldDiT एक एकल, एकीकृत इंजन का उपयोग करता है जो दो चीजें एक साथ करता है। पहला, यह रोबोट के हाथ के अगले मूव्स का पता लगाता है। दूसरा, यह अनुमान लगाने की कोशिश करता है कि कुछ सेकंड बाद कैमरा क्या देखेगा। यह एक शतरंज खिलाड़ी की तरह है जो न केवल अपनी अगली चाल की योजना बनाता है, बल्कि बोर्ड को तीन चालों आगे तक भी देखता है ताकि यह सुनिश्चित हो सके कि उसकी योजना सही है।

शोधकर्ताओं ने इस प्रणाली को LIBERO नामक एक सिम्युलेटेड दुनिया में प्रशिक्षित किया, जहाँ रोबोटों को ब्लॉक स्टैक करने या वस्तुओं को हिलाने जैसे कार्य करने होते हैं। उन्होंने पाया कि WorldDiT, जो आश्चर्यजनक रूप से छोटा है (अन्य शीर्ष विधियों द्वारा उपयोग किए जाने वाले अरबों के मुकाबले 400 मिलियन से कम पैरामीटर्स), भविष्य के कैमरा दृश्य और रोबोट के कार्यों की अविश्वसनीय सटीकता के साथ भविष्यवाणी कर सकता है। वास्तव में, जब उन्होंने इसका परीक्षण किया, तो रोबोट चार अलग-अलग प्रकार की चुनौतियों में से लगभग 95% कार्यों में सफल रहा। सबसे रोमांचक बात? इसने यह उस भारी, पूर्व-प्रशिक्षित "बैकबोन" के बिना किया जिसका उपयोग अधिकांश अन्य सफल रोबोट करते हैं। इसने साबित कर दिया कि एक अच्छा रोबोट बनने के लिए आपको एक विशाल, पहले से लोड किए गए मस्तिष्क की आवश्यकता नहीं है; आपको बस एक ऐसे मस्तिष्क की आवश्यकता है जो चलते समय भविष्य को देखना सीखता है।

"सपनों वाला" रोबोट

तो, WorldDiلت वास्तव में कैसे काम करता है? कल्पना कीजिए कि आप जगलिंग (juggle) सीखना चाह रहे हैं। आज के अधिकांश रोबोट उन छात्रों की तरह हैं जिन्होंने जगलिंग विशेषज्ञों के हजारों वीडियो रट लिए हैं और वे ठीक उसी की नकल करने की कोशिश कर रहे हैं। WorldDiT अलग है। यह एक ऐसे जगलिंग छात्र की तरह है जो आँखों पर पट्टी बांधे हुए है लेकिन उसके पास एक क्रिस्टल बॉल है।

यहाँ एक तरकीब है: हर बार जब WorldDiT कोई चाल चलने की योजना बनाता है, तो यह यह भी "सपना" देखने की कोशिश करता है कि कैमरा भविष्य में क्या देखेगा। यह रोबोट की वर्तमान स्थिति, दिए गए निर्देश (जैसे "लाल ब्लॉक उठाओ"), और पिछले कुछ सेकंड के वीडियो को देखता है। फिर, यह एक ही समय में दो प्रश्न पूछता है:

  1. "रोबोट को आगे क्या करना चाहिए?"
  2. "यदि मैं वह करता हूँ, तो एक क्षण बाद तस्वीर कैसी दिखेगी?"

शोधकर्ता इसे डिफ्यूजन ट्रांसफॉर्मर (diffusion transformer) कहते हैं। यदि यह सुनने में विज्ञान-काल्पनिक शब्द लगता है, तो इसे "डिनोइजिंग" (denoising) प्रक्रिया के रूप में सोचें। कल्पना कीजिए कि एक फोटो है जो स्टैटिक शोर (static noise) से ढकी हुई है। WorldDiT रोबोट के अगले कदम और भविष्य की तस्वीर के पूर्णतः यादृच्छिक, शोर भरे अनुमान के साथ शुरू होता है। फिर, चरण-दर-चरण, यह उस शोर को साफ करता है, अपने अनुमान को परिष्कृत करता है जब तक कि उसे लक्ष्य तक पहुँचने का एक स्पष्ट, सुचारू मार्ग न मिल जाए। यह रोबोट के कार्यों और भविष्य की छवियों, दोनों के लिए ऐसा करता है।

जादू इसलिए होता है क्योंकि ये दोनों कार्य एक-दूसरे की मदद करते हैं। भविष्य की छवि की भविष्यवाणी करने की कोशिश करके, रोबोट दुनिया के भौतिकी (physics) को समझने के लिए मजबूर होता है। यदि वह एक ब्लॉक को धकेलने की योजना बनाता है, लेकिन उसका भविष्य का "सपना" दिखाता है कि ब्लॉक हवा में तैर रहा है, तो वह जानता है कि उसकी योजना गलत है। उसे अपने एक्शन को तब तक एडजस्ट करना होगा जब तक कि "सपना" वास्तविकता से मेल न खा जाए। यह एक फीडबैक लूप बनाता है जहाँ रोबोट केवल यह अनुमान लगाकर कि आगे क्या होने वाला है, दुनिया के नियमों को सीखता है।

परिणाम: छोटा मस्तिष्क, बड़ी सफलता

शोधकर्ताओं ने चार अलग-अलग सिमुलेशन सूट्स (सोचिए कि वे चार अलग-अलग बाधा दौड़ हैं: स्पेशियल, ऑब्जेक्ट, गोल, और लॉन्ग) में WorldDiT का परीक्षण किया। उन्होंने इसकी तुलना 24 अन्य प्रसिद्ध रोबोट लर्निंग विधियों से की।

यहाँ मुख्य बात है: WorldDiT बहुत छोटा है। इसमें लगभग 399 मिलियन पैरामीटर्स ("न्यूरॉन्स") हैं। अन्य कई शीर्ष प्रदर्शन करने वाले रोबोट 1 बिलियन या यहाँ तक कि 10 बिलियन पैरामीटर्स वाले मॉडल का उपयोग करते हैं। आमतौर पर, बड़ा मस्तिष्क बेहतर प्रदर्शन का संकेत देता है। लेकिन WorldDiT ने इस नियम को तोड़ दिया।

इन सिमुलेशन में, WorldDiT ने सभी चार कोर्सों में औसतन 94.9% सफलता दर प्राप्त की।

  • स्पेशियल (Spatial): 98.0% सफलता
  • ऑब्जेक्ट (Object): 97.0% सफलता
  • गोल (Goal): 92.8% सफलता
  • लॉन्ग (Long): 91.8% सफलता

जब आप इन परिणामों को ग्राफ पर देखते हैं, तो WorldDiT "पारेटो फ्रंटियर" (Pareto frontier) पर स्थित है। सरल शब्दों में, इसका अर्थ है कि यह कमरे में सबसे कुशल रोबोट है। यदि आप एक ऐसा रोबोट चाहते है जो WorldDiT जितना स्मार्ट हो लेकिन उसका मस्तिष्क छोटा हो, तो आप उसे नहीं पा सकते। यदि आप एक ऐसा रोबोट चाहते हैं जो WorldDiT जितना छोटा हो लेकिन अधिक स्मार्ट हो, तो भी आप उसे नहीं पा सकते। अन्य सभी रोबोट जिन्होंने 94.9% से बेहतर प्रदर्शन किया, वे काफी बड़े और भारी थे।

यह क्यों महत्वपूर्ण है

यह पेपर स्पष्ट रूप से इस विचार के विरुद्ध तर्क देता है कि अच्छा रोबोट नियंत्रण पाने के लिए आपको एक विशाल, पूर्व-प्रशिक्षित विज़न-लैंग्वेज मॉडल (VLA) का उपयोग करना ही चाहिए। कुछ समय के लिए, क्षेत्र को लगा था, "दुनिया को समझने के लिए हमें एक विशाल मस्तिष्क की आवश्यकता है।" WorldDiT कहता है, "जरूरी नहीं।"

शोधकर्ताओं ने दिखाया कि एक्शन जनरेशन (हिलना-डुलना) को वर्ल्ड मॉडलिंग (भविष्य की भविष्यवाणी करना) के साथ जोड़कर, एक एकल, एकीकृत आर्किटेक्चर प्रभावी ढंग से रोबोट को नियंत्रित करना सीख सकता है। उन्होंने केवल सुझाव नहीं दिया; उन्होंने हजारों सिम्युलेटेड एपिसोड में इसे मापा। रोबोट केवल "भाग्यशाली" नहीं था; इसने लगातार बड़े मॉडलों से बेहतर प्रदर्शन किया।

हालाँकि, एक पेच है। ये परिणाम सिमुलेशन (कंप्यूटर गेम जहाँ रोबोट रहते हैं) से आए हैं। पेपर में उल्लेख किया गया है कि जबकि प्रदर्शन मजबूत है, यह भविष्य के अध्ययनों के लिए एक आधार रेखा (baseline) है। हमें अभी तक यह नहीं पता है कि क्या यह "सपनों वाला" रोबोट वास्तविक दुनिया की, वास्तविक गुरुत्वाकर्षण और वास्तविक फिसलन भरे फर्श वाली रसोई में पूरी तरह से काम करेगा। लेकिन सिमुलेशन परिणाम एक मजबूत संकेत हैं कि हम भविष्य में छोटे, सस्ते और अधिक कुशल रोबोट बना सकते हैं—ऐसे रोबोट जो केवल अतीत को याद करने के बजाय भविष्य की कल्पना करके सीखते हैं।

अंत में, WorldDiT सुझाव देता है कि एक स्मार्ट रोबोट का रहस्य केवल ज्ञान का एक विशाल पुस्तकालय होना नहीं है; बल्कि एक ऐसा मस्तिष्क होना है जो अभी बेहतर निर्णय लेने के लिए अपने मन में भविष्य को चला सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →