← नवीनतम पेपर
💻 computer science

WAM4D: Fast 4D World Action Model via Spatial Register Tokens

WAM4D एक तेज़ 4D वर्ल्ड एक्शन मॉडल है जो प्रीट्रेन किए गए ज्यामितीय प्रायों (geometric priors) को एक कॉज़ल वीडियो-एक्शन ट्रांसफार्मर में स्थानांतरित करने के लिए हल्के स्थानिक रजिस्टर टोकन का लाभ उठाता है, जिससे यह सघन ज्यामितीय डिकोडिंग की कम्प्यूटेशनल लागतों से बचते हुए कुशल अनुमान के साथ सटीक 3D मैनिपुलेशन भविष्यवाणियां प्राप्त करता है।

मूल लेखक: Ying Li, Xiaobao Wei, Jiajun Cao, Hao Wang, Xiaowei Chi, Chengyu Bai, Qianpu Sun, Jiajun Li, Xiaojie Zhang, Jian Tang, Sirui Han, Shanghang Zhang

प्रकाशित 2026-06-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ying Li, Xiaobao Wei, Jiajun Cao, Hao Wang, Xiaowei Chi, Chengyu Bai, Qianpu Sun, Jiajun Li, Xiaojie Zhang, Jian Tang, Sirui Han, Shanghang Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक नाजुक कप उठाने और उसमें पानी डालने का काम सिखा रहे हैं। इसे अच्छी तरह से करने के लिए, रोबोट को केवल यह समझने की आवश्यकता नहीं है कि कप दिखने में कैसा है, बल्कि यह भी कि वह 3D स्थान में कहाँ स्थित है, वह कितना भारी महसूस हो सकता है, और यदि वह मेज से टकरा जाए तो क्या होगा।

लंबे समय तक, रोबमा के "दिमाग" (AI मॉडल) उन कलाकारों की तरह थे जो भविष्य की एक सुंदर तस्वीर तो बना सकते थे लेकिन आपको ठीक-ठीक यह नहीं बता सकते थे कि कप कितनी दूर था। वे 2D वीडियो में यह अनुमान लगा सकते थे कि "कप यहाँ होगा", लेकिन वे अक्सर छिपे हुए हिस्सों या उस सटीक दूरी को मिस कर देते थे जो बिना कप गिराए उसे पकड़ने के लिए आवश्यक होती है।

WAM4D एक नया "रोबोट दिमाग" है जिसे इस समस्या को हल करने के लिए डिज़ाइन किया गया है। यह कैसे काम करता है, इसके लिए सरल उपमाओं (analogies) का उपयोग किया गया है:

1. समस्या: "सपाट" भविष्य (The "Flat" Future)

अधिकांश वर्तमान रोबोट मॉडल एक फ्लैट टीवी पर मूवी देखने की तरह हैं। वे अगले वीडियो फ्रेम जैसा दिखना तो देख सकते हैं, लेकिन वे वास्तव में दृश्य की गहराई (depth) को नहीं समझते हैं। यदि कोई रोबोट किसी ऐसी वस्तु को पकड़ने की कोशिश करता है जो किसी दूसरी चीज़ के पीछे आंशिक रूप से छिपी हुई है, तो एक "सपाट" मॉडल गलत स्थान का अनुमान लगा सकता है क्योंकि वह 3D आकार को "देख" नहीं पाता है।

2. समाधान: "घोस्ट आर्किटेक्ट" (Spatial Register Tokens)

लेखकों ने एक चतुर तकनीक बनाई है जिसे Spatial Register Tokens कहा जाता है। इन्हें "घोस्ट आर्किटेक्ट्स" या "अदृश्य स्टिकी नोट्स" के रूप में सोचें जिनका उपयोग रोबोट केवल सीखते समय करता है।

  • प्रशिक्षण के दौरान (During Training): कल्पना कीजिए कि रोबोट एक वीडियो गेम खेलना सीख रहा है। जब वह अभ्यास करता है, तो ये "घोस्ट आर्किटेक्ट्स" प्रकट होते हैं। वे अब तक रोबोट ने जो कुछ भी देखा है उसके इतिहास को देखते हैं और एक सुपर-स्मार्ट, प्री-ट्रेन्ड 3D विशेषज्ञ (एक ज्योमेट्रिक फाउंडेशन मॉडल) से पूछते हैं: "जो हमने अब तक देखा है, उसके आधार पर, भविष्य का डेप्थ मैप (depth map) कैसा दिखता है?"
  • सबक: रोबोट भविष्य का वीडियो अनुमान लगाने की कोशिश करता है। "घोस्ट आर्किटेक्ट्स" यह जाँचते हैं कि क्या रोबोट का अनुमान 3D स्पेस में सही है। यदि रोबोट भविष्यवाणी करता है कि कप हवा में तैर रहा है जबकि उसे मेज पर होना चाहिए, तो घोस्ट आर्किटेक्ट्स कहते हैं, "नहीं, यह 3D में गलत है," और रोबोट इस गलती से सीखता है।
  • जादू: यह रोबोट को जटिल 3D मैप आउटपुट किए बिना भी 3D ज्यामिति (geometry) को समझने के लिए प्रशिक्षित करता है।

3. परिणाम: "लाइटवेट पायलट" (The "Lightweight Pilot")

सबसे अच्छी बात यह है: जब रोबोट सीखना समाप्त कर लेता है, तो "घोस्ट आर्किटेक्ट्स" गायब हो जाते हैं।

  • वास्तविक दुनिया में: जब रोबोट वास्तव में काम कर रहा होता है (जैसे कप उठाना), तो उसे जटिल 3D मैप की गणना करने या भारी 3D डिकोडिंग चलाने की आवश्यकता नहीं होती है। वह बस "घोस्ट आर्किटेक्ट्स" से सीखी गई अपनी "मसल मेमोरी" (muscle memory) का उपयोग करता है।
  • यह क्यों मायने रखता है: यह एक छात्र की तरह है जो गहरी गणित समझने के लिए ट्यूटर (घोस्ट आर्किटेक्ट्स) के साथ घंटों पढ़ाई करता है, लेकिन परीक्षा के दिन, वह बिना ट्यूटर की मदद के तेजी से सवालों के जवाब देता है। यह रोबोट को तेज़ और कुशल बनाता है, जबकि वह 3D स्पेस को संभालने के लिए पर्याप्त स्मार्ट भी रहता है।

4. "ट्रैफिक कोप" (The "Traffic Cop" - Causal Mixture Attention)

यह सुनिश्चित करने के लिए कि रोबोट धोखाधड़ी न करे, लेखकों ने एक "ट्रैफिक कोप" सिस्टम जोड़ा है। AI में, "धोखाधड़ी" का अर्थ है भविष्य को देखकर वर्तमान का अनुमान लगाना। ट्रैफिक कोप यह सुनिश्चित करता है कि रोबोट केवल उसी को देखे जो पहले ही हो चुका है (पिछला वीडियो और क्रियाएं) ताकि वह आगे क्या करना है इसका निर्णय ले सके। यह रोबोट को निर्णय लेते समय "भविष्य के डेप्थ" या "भविष्य के वीडियो" को झाँकने से सख्ती से रोकता है, जिससे यह सुनिश्चित होता है कि रोबोट वास्तविक समय में कार्य करता है, ठीक वैसे ही जैसे एक इंसान करता है।

उन्होंने क्या सिद्ध किया?

टीम ने इस नए रोबोट दिमाग का परीक्षण एक डुअल-आर्म वाले रोबोट (RoboTwin) और एक वास्तविक दुनिया के रोबोट (AstriBot) पर किया।

  • बेहतर सटीकता: रोबोट सटीक संपर्क वाले कार्यों में बहुत बेहतर था, जैसे ब्लॉक को एक के ऊपर एक रखना, पेन के ढक्कन हटाना, या वस्तुओं को छांटना, क्योंकि वह दुनिया के 3D आकार को बेहतर समझता था।
  • गति: भले ही उसने 3D ज्यामिति से सीखा, फिर भी यह अन्य तेज़ रोबोटों की तरह ही तेज़ चलता है क्योंकि वास्तविक काम के दौरान भारी 3D गणित को हटा दिया जाता है।
  • वास्तविक दुनिया में सफलता: इसने प्लेट उठाने और LEGO छांटने जैसे कठिन वास्तविक दुनिया के कार्यों को सफलतापूर्वक पूरा किया, और उन पिछले मॉडलों से बेहतर प्रदर्शन किया जिन्होंने इस 3D "घोस्ट आर्किटेक्ट" ट्रिक का उपयोग नहीं किया था।

सारांश में

WAM4D एक ऐसा रोबोट दिमाग है जो प्रशिक्षण के दौरान एक अस्थायी, अदृश्य 3D ट्यूटर का उपयोग करके 3D दुनिया को समझना सीखता है। प्रशिक्षित होने के बाद, यह भारी गणित को भूल जाता है और एक तेज़, कुशल पायलट बन जाता है जो अभी भी जटिल, 3D वातावरण में सटीकता के साथ नेविगेट कर सकता है। यह "वीडियो देखने" और "भौतिक दुनिया को समझने" के बीच के अंतर को पाटता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →