← नवीनतम पेपर
💻 computer science

Discrete-WAM: Unified Discrete Vision-Action Token Editing for World-Policy Learning

डिस्क्रीट-WAM एक एकीकृत डिस्क्रीट लेटेंट फ्रेमवर्क पेश करता है जो विजन और एक्शन टोकन को संरेखित करता है ताकि एक साझा डिस्क्रीट डिफ्यूजन प्रोसेस के माध्यम से वर्ल्ड डायनेमिक्स और डिसीजन पॉलिसीज को संयुक्त रूप से मॉडल करके स्वायत्त ड्राइविंग के लिए कंपोजिशनल कॉज़ल रीजनिंग, कंट्रोलेबल जनरेशन और काउंटरफैक्चुअल प्लानिंग को सक्षम बनाया जा सके।

मूल लेखक: Ziyang Yao, Haochen Liu, Yuncheng Jiang, Zeyu Zhu, Zibin Guo, Jingru Wang, Tianle Liu, Jianwei Cui, Kuiyuan Yang, Hongwei Xie, Jingwei Zhao, Guang Chen, Hangjun Ye

प्रकाशित 2026-06-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ziyang Yao, Haochen Liu, Yuncheng Jiang, Zeyu Zhu, Zibin Guo, Jingru Wang, Tianle Liu, Jianwei Cui, Kuiyuan Yang, Hongwei Xie, Jingwei Zhao, Guang Chen, Hangjun Ye

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कार चलाना सिखा रहे हैं। वर्तमान के अधिकांश तरीके एक छात्र को एक आदर्श ड्राइवर का वीडियो दिखाकर सिखाने जैसे हैं और कहना, "जो तुम देख रहे हो उसे ठीक वैसा ही कॉपी करो।" रोबोट उन गतिविधियों की नकल करना सीख जाता है, लेकिन वह यह वास्तव में नहीं समझ पाता कि ड्राइवर ने पहिया क्यों घुमाया या उस मोड़ से आगे क्या बदलने वाला है। यह सिर्फ एक पैटर्न को याद कर रहा है।

अन्य तरीके एक "वर्ल्ड मॉडल" (world model) बनाने की कोशिश करते—भविष्य का एक मानसिक सिमुलेशन। लेकिन ये अक्सर एक धुंधले, निरंतर डेटा वाले बादल का उपयोग करके मौसम की भविष्यवाणी करने जैसा है। यह उस बादल को विशिष्ट, तार्किक चरणों में तोड़ना कठिन बना देता है जैसे कि "यदि मैं बाएं मुड़ता हूँ, तो मेरे बगल वाली कार दाईं ओर जाएगी।"

Discrete-WAM (Xiaomi से) एक नया दृष्टिकोण है जो इन दोनों समस्याओं को ठीक करने की कोशिश करता है। यह कैसे काम करता है, यहाँ सरल भाषा में समझाया गया है:

1. "लेगो" (Lego) दृष्टिकोण (डिस्क्रीट टोकन)

दुनिया को एक सुचारू, धुंधले वीडियो या एक जटिल गणितीय समीकरण के रूप में देखने के बजाय, Discrete-WAM सब कुछ लेगो ब्लॉक्स (जिन्हें "डिस्क्रीट टोकन" कहा जाता है) में तोड़ देता है।

  • दृश्य (Visuals): कैमरे की हर छवि को एक विशिष्ट लेगो ईंट में बदल दिया जाता है।
  • क्रियाएं (Actions): कार द्वारा की जाने वाली हर हरकत (त्वरण, मुड़ना) भी एक विशिष्ट लेगो ईंट है।
  • जादू: क्योंकि चित्र और क्रिया दोनों एक ही प्रकार के लेगो ब्लॉक्स से बने हैं, इसलिए AI उन्हें आसानी से मिला और जोड़ सकता है। यह सड़क की एक तस्वीर देख सकता है, एक "बाएं मुड़ें" वाला ईंट उठा सकता है, और भविष्य कैसा दिखेगा यह देखने के लिए उसे तस्वीर पर चिपका सकता है।

2. "एडिट" बटन (यूनिफाइड जनरेशन)

AI को केवल भविष्य की भविष्यवाणी करने वाली मशीन के रूप में नहीं, बल्कि एक एडिटर के रूप में सोचें जिसके पास "फाइंड एंड रिप्लेस" (Find and Replace) टूल है।

  • प्रक्रिया: AI भविष्य का एक कच्चा मसौदा (सड़क और कार के रास्ते का एक धुंधला अनुमान) तैयार करता है।
  • पुनरावृत्ति सुधार (Iterative Refinement): इसके बाद यह एक कहानी लिखने वाले लेखक की तरह अपने मसौदे को कई बार एडिट करता है। प्रत्येक दौर में, यह उन "लेगो ब्लॉक्स" को देखता है जो गलत या अनिश्चित लगते हैं और उन्हें बेहतर ब्लॉक्स से बदल देता है।
  • यह क्यों मदद करता है: यह AI को विभिन्न "क्या होगा अगर" (what-if) परिदृश्यों को आज़माने की अनुमति देता है। यह पूछ सकता है, "अगर मैं यहाँ बाएं मुड़ूँ तो क्या होगा?" और तुरंत भविष्य की छवि को संपादित करके परिणाम दिखा सकता है, और फिर पूछ सकता है, "अगर मैं दाएं मुड़ूँ तो क्या होगा?" और उसे भी एडिट कर सकता है। इसे तुरंत एक ही रास्ते के लिए प्रतिबद्ध होने की आवश्यकता नहीं है।

3. "कैप्टन और क्रू" (हायरार्किकल प्लानिंग)

यह पेपर निर्णय लेने का एक स्मार्ट तरीका पेश करता है, जो काम को दो भूमिकाओं में विभाजित करता है:

  • कैप्टन (उच्च-स्तरीय निर्णय): यह AI का हिस्सा बड़े, सरल विकल्प बनाता है: "मैं लेन बदलने जा रहा हूँ," या "मैं रुकने जा रहा हूँ।" यह एक कैप्टन द्वारा सामान्य आदेश देने जैसा है।
  • क्रू (निम्न-स्तरीय क्रिया): एक बार जब कैप्टन आदेश दे देता है, तो क्रू यह पता लगाता है कि इसे पूरा करने के लिए सुचारू और विस्तृत गतिविधियाँ कैसे की जाएं। वे विशिष्ट स्टीयरिंग और गति समायोजन को संभालते हैं।
  • लाभ: यह AI को भ्रमित होने से रोकता है। यदि यह एक साथ हर छोटी पहिया गतिविधि को समझने की कोशिश करता है, तो यह अटक सकता है। "बड़े विचार" को "बारीक विवरणों" से अलग करके, यह स्थिर और सुरक्षित रहता है।

4. "सेफ्टी सिम्युलेटर" (काउंटरफैक्चुअल रीजनिंग)

चूंकि AI भविष्य को इतनी आसानी से एडिट कर सकता है, इसलिए यह कार के लिए एक फ्लाइट सिम्युलेटर की तरह कार्य करता है।

  • यह एक सिमुलेशन चला सकता है जहाँ कार सामान्य रूप से चलती है और देख सकता है कि क्या यह सुरक्षित है।
  • फिर, यह सिमुलेशन को "एडिट" कर सकता है यह पूछने के लिए: "क्या होगा अगर वह पैदल यात्री सड़क पर आ जाए?" या "क्या होगा अगर मैं बहुत देर से ब्रेक लगाऊं?"
  • यदि सिमुलेशन एक टक्कर (एक "सरप्राइज" जिसे AI ने उम्मीद नहीं की थी) दिखाता है, तो सिस्टम जानता है कि वह रास्ता खतरनाक है। यह वास्तव में होने से पहले ही खतरनाक परिदृश्यों का परीक्षण करके दुर्घटनाओं से बचने में मदद करता है।

परिणाम

इस पेपर ने वास्तविक ड्राइविंग परिदृश्यों के विशाल डेटासेट पर इस सिस्टम का परीक्षण किया।

  • प्रदर्शन: इसने वर्तमान शीर्ष प्रणालियों के समान या उनसे बेहतर प्रदर्शन किया।
  • सुरक्षा: यह टक्करों से बचने और यातायात नियमों का पालन करने में बेहतर था।
  • रचनात्मकता: केवल वही कॉपी करने के बजाय जो उन्होंने देखा है, यह सिस्टम नए और सुरक्षित ड्राइविंग पथ उत्पन्न कर सका जो उसने पहले नहीं देखे थे, जिससे सिद्ध होता है कि यह वास्तव में सड़क के नियमों को समझता है।

संक्षेप में: Discrete-WAM एक सेल्फ-ड्राइविंग कार को "लेगो ब्लॉक्स" में सोचना सिखाता है। यह इसे एक वीडियो एडिटर की तरह भविष्य को एडिट करने, बड़े निर्णयों को बारीक विवरणों से अलग करने और वास्तविक रूप से कार्य करने से पहले यह जांचने के लिए मानसिक सिमुलेशन चलाने की अनुमति देता है कि क्या कोई चाल सुरक्षित है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →