← नवीनतम पेपर
💻 computer science

Adaptive-WAM: Quality-Guided Early-Exit Planning from Intermediate Video-Diffusion Features

Adaptive-WAM एक गुणवत्ता-निर्देशित अर्ली-एग्जिट प्लानिंग फ्रेमवर्क है जो वीडियो डिफ्यूजन मॉडल्स से इंटरमीडिएट फीचर्स का लाभ उठाकर कंप्यूटेशनल डेप्थ को गतिशील रूप से आवंटित करता है, जिससे पुनरावृत्त वीडियो जनरेशन को दरकिनार करके काफी कम लेटेंसी के साथ अत्याधुनिक स्वायत्त ड्राइविंग प्रदर्शन प्राप्त होता है।

मूल लेखक: Sining Ang, Yuguang Yang, Yan Wang

प्रकाशित 2026-08-07
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sining Ang, Yuguang Yang, Yan Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कार चलाना सिखा रहे हैं। ऐसा करने के लिए, रोबोट को न केवल यह समझने की आवश्यकता है कि अभी क्या हो रहा है, बल्कि यह भी कि अगले कुछ सेकंड में दुनिया कैसे बदलेगी। क्या वह पैदल यात्री फुटपाथ से नीचे उतरेगा? क्या आगे वाली कार अचानक ब्रेक लगाएगी? लंबे समय तक, वैज्ञानिकों ने इसे "वर्ल्ड मॉडल्स" (world models) बनाकर हल करने की कोशिश की है—विशाल AI मस्तिष्क जो पूरी भविष्य की कल्पना करने की कोशिश करते हैं, फ्रेम दर फ्रेम, ठीक वैसे ही जैसे एक फिल्म निर्देशक दृश्य होने से पहले उसका फिल्मांकन करता है। ये मॉडल अविश्वसनीय रूप से शक्तिशाली हैं, लेकिन वे बहुत भारी और धीमे भी हैं। यह एक शेफ से पूछने जैसा है कि क्या उन्हें सूप में नमक का एक चुटकी डालना चाहिए, इसके लिए उन्हें पूरा तीन-कोर्स का भोजन पकाना पड़े। रोबोट को भविष्य की पूरी "फिल्म" जनरेट होने का इंतज़ार करना पड़ता है ताकि वह ड्राइविंग का एक निर्णय ले सके, जिसमें हाईवे की गति पर चलते वास्तविक कार के लिए बहुत अधिक समय और कंप्यूटर पावर लग जाती है।

यह हमें एक बड़े सवाल की ओर ले जाता है: क्या हमें वास्तव में क्या करना है यह जानने के लिए पूरी फिल्म देखने की आवश्यकता है? शायद रोबोट भविष्य की "फिल्म" के पहले कुछ सेकंडों पर एक नज़र डालकर, या बीच के स्क्रिप्ट पर झाँककर सही कदम उठा सकता है। यह Adaptive-WAM नामक नए शोध का केंद्र है। शोधकर्ताओं ने यह देखने की कोशिश की कि क्या वे इन विशाल, धीमे AI मॉडलों को "अर्ली एग्जिट" (early exit - जल्दी बाहर निकलने) की अनुमति देकर तेज़ और स्मार्ट बना सकते हैं। गणना के हर एक चरण को चलाने के लिए कंप्यूटर को मजबूर करने के बजाय, उन्होंने एक ऐसा सिस्टम बनाया है जो प्रक्रिया के दौरान ही उत्तर की गुणवत्ता की जांच करता है। यदि उत्तर पर्याप्त अच्छा दिखता है, तो कंप्यूटर रुक जाता है और गाड़ी चलाता है। यदि नहीं, तो वह काम जारी रखता है। यह एक ऐसे छात्र की तरह है जो परीक्षा देते समय महसूस करता है कि उसे पांचवें प्रश्न का उत्तर पहले से ही पता है, इसलिए उसे लिखने के लिए पूरे अध्याय को पढ़ने में समय बर्बाद करने की आवश्यकता नहीं है।

शोध पत्र, जिसका शीर्षक "Adaptive-WAM: Quality-Guided Early-Exit Planning from Intermediate Video-Diffusion Features" है, इस बात पर ध्यान केंद्रित करता है कि ये वीडियो-जनरेट करने वाले AI मॉडल कैसे काम करते हैं। ये मॉडल आमतौर पर भविष्य को छोटे चरणों में तोड़ते हैं, अधिक विवरण जोड़ते जाते हैं, ठीक वैसे ही जैसे एक कलाकार एक मोटा खाका खींचता है और फिर धीरे-धीरे उसमें रंग भरता है। शोधकर्ताओं ने पाया कि यह आश्चर्यजनक था: AI को यह जानने के लिए पूरा पेंटिंग खत्म करने की आवश्यकता नहीं है कि कार को कहाँ जाना चाहिए। उन्होंने पाया कि AI के मस्तिष्क की "मध्य परतें" (middle layers)—जहाँ इसने दृश्य को समझना शुरू कर दिया है लेकिन अंतिम पिक्सेल को रेंडर करना अभी बाकी है—पहले से ही एक सुरक्षित ड्राइविंग निर्णय लेने के लिए पर्याप्त जानकारी रखती हैं।

इसका परीक्षण करने के लिए, टीम ने एक विशाल वीडियो मॉडल जिसे Wan2.2 कहा जाता है, का उपयोग करके एक नया प्लानर बनाया। कल्पना कीजिए कि यह मॉडल एक गहरा सुरंग जैसा है जिसमें कई कमरे हैं। आमतौर पर, एक कार को उत्तर प्राप्त करने के लिए शुरू से अंत तक हर कमरे से गुजरना पड़ता है। हालाँकि, शोधकर्ताओं ने कई बिंदुओं (विशेष रूप से परतों 5, 9, 15, 18, 22 और 30 पर) पर "एग्जिट डोर" (निकास द्वार) स्थापित किए। प्रत्येक निकास पर, एक छोटा, तेज़ "जज" उस प्रक्षेपवक्र (trajectory - कार द्वारा तय किया जाने वाला पथ) को देखता है जिसे AI ने अब तक जनरेट किया है। यह जज पूछता है, "क्या यह पथ पर्याप्त अच्छा है?" यदि उत्तर हाँ है, तो कार तुरंत बाहर निकल जाती है और चलती है। यदि उत्तर नहीं है, तो कार बेहतर उत्तर पाने के लिए सुरंग में और गहराई तक जाती रहती है।

परिणाम रोमांचक थे। शोधकर्ताओं ने पाया कि ड्राइविंग निर्णय की गुणवत्ता इस बात पर बहुत अधिक निर्भर नहीं थी कि भविष्य का वीडियो कितना "नॉइजी" या धुंधला था, लेकिन यह इस पर बहुत अधिक निर्भर थी कि AI ने कितनी गहराई तक देखा। उन्होंने पाया कि सबसे अच्छा एकल पथ अक्सर सुरंग के मध्य से आता है, न कि बिल्कुल अंत से। अपने स्मार्ट "एग्जिट स्ट्रैटेजी" का उपयोग करके, नया प्लानर एक शक्तिशाली कंप्यूटर चिप (A100) पर लगभग 170 मिलीसेकंड में निर्णय ले सकता है। यह एक मानक प्लानर से लगभग 10% तेज़ है जो हमेशा एक निश्चित मध्य बिंदु पर रुकता है, और एक ऐसे प्लानर से लगभग 47% तेज़ है जो पूरी सुरंग से गुजरने पर जोर देता है। इससे भी बेहतर, सिस्टम केवल तेज़ ही नहीं हुआ; यह थोड़ा अधिक सटीक भी हो गया, जिसने NAVSIM नामक एक मानक ड्राइविंग टेस्ट पर 90.79 का स्कोर किया, जो फिक्स्ड-डेप्थ (निश्चित गहराई वाले) संस्करणों से बेहतर है।

शोध पत्र ने यह भी दिखाया कि यह "स्मार्ट एग्जिट" ट्रिक तब भी काम करती है जब रोबोट बिना किसी अतिरिक्त प्रशिक्षण के पूरी तरह से अलग शहर में गाड़ी चलाता है। nuScenes डेटासेट (ड्राइविंग दृश्यों का एक अलग संग्रह) पर परीक्षण करने पर, सिस्टम ने बहुत कम गलतियाँ कीं, जिसमें औसत त्रुटि केवल 0.88 मीटर और टकराव की दर केवल 0.08% थी। यह सुझाव देता है कि AI ने ड्राइविंग की एक सामान्य समझ सीखी है जो किसी एक विशिष्ट डेटासेट से बंधी नहीं है।

महत्वपूर्ण रूप से, शोधकर्ताओं ने इस विचार को खारिज कर दिया कि निर्णय लेने के लिए कंप्यूटर को पूर्ण, हाई-डेफिनिशन भविष्य का वीडियो बनाना आवश्यक है। उन्होंने साबित किया कि योजना बनाने के उद्देश्य से अंतिम "मूवी" फ्रेम को रेंडर करने में लगाया गया अतिरिक्त समय बेकार प्रयास है। उन्होंने यह भी दिखाया कि केवल AI के मस्तिष्क को फ्रीज करना और केवल निकास द्वारों को प्रशिक्षित करना पर्याप्त नहीं था; पूरे सिस्टम को सर्वोत्तम परिणाम देने के लिए एक साथ ट्यून करने की आवश्यकता थी।

संक्षेप में, Adaptive-WAM, सुपर-स्मार्ट AI ड्राइवरों को बहुत अधिक कुशल बनाने का एक चतुर तरीका है। यह रोबोट को अपने अंतर्ज्ञान (gut feeling) पर भरोसा करना सिखाता है जब उत्तर स्पष्ट हो, बजाय इसके कि वह सब कुछ दोबारा जाँचने में समय बर्बाद करे। AI को जल्दी रुकने की अनुमति देकर, कार वास्तविक दुनिया के प्रति तेज़ी से प्रतिक्रिया कर सकती है, जो हमें सुरक्षित और तेज़ स्व-चालित कारों के करीब लाता है। इस सिस्टम का कोड रिलीज़ किया जाएगा, जिससे अन्य लोग "क्वालिटी-गाइडेड अर्ली एग्जिट" के इस विचार पर आधारित और भी स्मार्ट मशीनें बना सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →