← नवीनतम पेपर
💻 computer science

WorldCache: Accelerating World Models for Free via Heterogeneous Token Caching

WorldCache एक नवीन कैशिंग फ्रेमवर्क है जो बिना पुनरप्रशिक्षण (retraining) के डिफ्यूजन-आधारित वर्ल्ड मॉडल्स को 3.7×\times तक त्वरित करता है, जो उच्च रोलआउट गुणवत्ता बनाए रखने के लिए कर्वेचर-गाइडेड प्रेडिक्शन और केओटिक-प्रायोरिटाइज्ड एडेप्टिव स्किपिंग के माध्यम से टोकन विषमता (token heterogeneity) और गैर-समान टेम्पोरल डायनेमिक्स की चुनौतियों पर विजय प्राप्त करता है।

मूल लेखक: Weilun Feng, Guoxin Fan, Haotong Qin, Chuanguang Yang, Mingqiang Wu, Yuqi Li, Xiangqi Li, Zhulin An, Libo Huang, Dingrui Wang, Longlong Liao, Michele Magno, Yongjun Xu

प्रकाशित 2026-03-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Weilun Feng, Guoxin Fan, Haotong Qin, Chuanguang Yang, Mingqiang Wu, Yuqi Li, Xiangqi Li, Zhulin An, Libo Huang, Dingrui Wang, Longlong Liao, Michele Magno, Yongjun Xu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जटिल, चलती-फिरती दुनिया के भविष्य की भविष्यवाणी करने की कोशिश कर रहे हैं—जैसे कि एक वीडियो गेम जहाँ आप घूम सकते हैं, वस्तुओं को देख सकते हैं और आकाश में सूर्य की गति देख सकते हैं। यह वही है जो "वर्ल्ड मॉडल्स" (World Models) करते हैं। ये AI सिस्टम हैं जो वास्तविकता का अनुकरण (simulate) करने की कोशिश करते हैं।

हालाँकि, एक बड़ी समस्या है: इन सिमुलेशन को चलाना अविश्वसनीय रूप से धीमा और महंगा है। केवल कुछ सेकंड का वीडियो बनाने के लिए, AI को सैकड़ों छोटे कदम उठाने पड़ते हैं, और हर बार पूरे दृश्य की गणना शून्य से शुरू करके दोबारा करनी पड़ती है। यह एक मास्टरपीस पेंट करने की कोशिश करने जैसा है जहाँ हर नया विवरण जोड़ने के लिए आपको पहले ब्रशस्ट्रोक से लेकर आखिरी तक पूरे कैनवास को फिर से पेंट करना पड़ता है।

WorldCache एक नया तरीका है जो बिना तस्वीर की गुणवत्ता खराब किए इसे 3.7 गुना तेज़ कर देता है। यह इसलिए काम करता है क्योंकि यह "स्मार्ट" तरीके से तय करता है कि उसे किन चीजों को छोड़ना है।

यह कैसे काम करता है, इसका एक सरल उदाहरण यहाँ दिया गया है:

समस्या: "आलसी" बनाम "अराजक" (The "Lazy" vs. The "Chaotic")

कल्पना कीजिए कि आप एक फिल्म देख रहे हैं।

  • आकाश (The Sky): बादल धीरे-धीरे और अनुमानित रूप से चलते हैं। यदि आप जानते हैं कि 5 सेकंड पहले वे कहाँ थे, तो आप लगभग 100% सटीकता के साथ अनुमान लगा सकते हैं कि वे अब कहाँ हैं।
  • कार दुर्घटना (The Car Crash): अचानक, एक कार मुड़ती है, टकराती है और चिंगारियां उड़ती हैं। यह अराजक (chaotic) है। यदि आप पिछले 5 सेकंड के आधार पर अनुमान लगाने की कोशिश करेंगे कि आगे क्या होगा, तो आप पूरी तरह से गलत होंगे।

पुराने AI तरीकों ने पूरी फिल्म के साथ एक जैसा व्यवहार किया। वे या तो:

  1. सब कुछ दोबारा इस्तेमाल करते थे: वे बस पिछले फ्रेम की नकल करते थे। यह आकाश के लिए तो काम करता था लेकिन कार दुर्घटना को एक धुंधले, जमे हुए मलबे जैसा बना देता था।
  2. सब कुछ कैलकुलेट करते थे: वे हर कदम के लिए हर एक पिक्सेल की दोबारा गणना करते थे। यह सटीक तो था लेकिन इसमें बहुत समय लगता था।

समाधान: WorldCache

WorldCache एक स्मार्ट डायरेक्टर की तरह काम करता है जिसे पता होता है कि दृश्य के किन हिस्सों पर ध्यान देने की आवश्यकता है और किन हिस्सों को अनदेखा किया जा सकता है। यह दो मुख्य तरीकों का उपयोग करता है:

1. "कर्वेचर" कंपास (अराजकता को पहचानना)

AI छवि के हर छोटे टुकड़े (जिसे "टोकन" कहा जाता है) को देखता है और पूछता है: "क्या यह टुकड़ा एक सीधी रेखा में चल रहा है, या यह बेतहाशा मुड़ रहा है और घूम रहा है?"

  • स्थिर टोकन (The Sky): ये एक सीधी, उबाऊ रेखा में चलते हैं। AI कहता है, "मुझे पता है तुम क्या कर रहे हो। मैं बस तुम्हारी पिछली चाल की नकल करूँगा।" (यह Reuse है)।
  • रैखिक टोकन (A walking person): ये अनुमानित रूप से चलते हैं लेकिन इनकी गति थोड़ी बदल रही होती है। AI कहता है, "मैं तुम्हारी अगली चाल का अनुमान लगाने के लिए तुम्हारी पिछली दो स्थितियों से एक सीधी रेखा खींच सकता हूँ।" (यह Linear Extrapolation है)।
  • अराजक टोकन (The car crash): ये मुड़ रहे हैं, घूम रहे हैं और तुरंत दिशा बदल रहे हैं। AI कहता है, "ओह नहीं, यह खतरनाक है! मैं इसका अनुमान नहीं लगा सकता। मुझे इस हिस्से की गणना शून्य से शुरू करके करनी होगी।" (यह Damped Update है)।

2. "ड्रिफ्ट" अलार्म (जानना कि कब अनुमान लगाना बंद करें)

यहाँ तक कि अराजक हिस्सों के लिए भी, AI नहीं चाहता कि उसे अगर ज़रूरत न हो तो हर कदम की गणना करनी पड़े। इसलिए, यह एक ड्रिफ्ट अलार्म (Drift Alarm) सेट करता है।

कल्पना कीजिए कि आप एक रस्सी (tightrope) पर चल रहे हैं। जब तक आप स्थिर हैं, आपको सुरक्षा जाल की आवश्यकता नहीं है। लेकिन यदि आप डगमगाना (wobble) शुरू करते हैं, तो जाल को आपको पकड़ने की आवश्यकता होती है।

  • WorldCache अराजक हिस्सों पर बारीकी से नज़र रखता है।
  • यह मापता है कि AI का अनुमान वास्तविकता से कितना दूर "ड्रिफ्ट" (विचलित) हो रहा है।
  • महत्वपूर्ण बात: यह स्थिर हिस्सों (आकाश) को अनदेखा करता है क्योंकि वे विचलित नहीं हो रहे हैं। यह केवल अराजक हिस्सों को सुनता है।
  • जैसे ही अराजक हिस्से बहुत अधिक डगमगाने लगते हैं, अलार्म बज उठता है, और AI अनुमान लगाना बंद कर देता है और फिर से कठिन गणितीय गणना करता है।

यह एक बड़ी बात क्यों है?

अधिकांश पिछले तरीके एक ऐसे छात्र की तरह थे जो एक प्रश्न का उत्तर देने के लिए पूरी किताब रटने की कोशिश करता है, या एक ऐसे छात्र की तरह जो बेतरतीब ढंग से अनुमान लगाता है और असफल हो जाता है।

WorldCache एक ऐसे ट्यूटर की तरह है जो जानता है कि कौन से प्रश्न कठिन हैं।

  • यह अपना 90% समय आसान चीजों (आकाश, दीवारें) को जल्दी से देखने में बिताता है।
  • यह केवल तभी रुकता है जब "अराजक" चीजें (चलती कारें, जटिल अंतःक्रियाएं) गड़बड़ होने लगती हैं।

परिणाम

ऐसा करके, WorldCache AI को 3.7 गुना तेज़ बनाता है (जैसे कि 10 मिनट के इंतज़ार को 3 मिनट के इंतज़ार में बदलना) जबकि वीडियो की गुणवत्ता को लगभग मूल धीमे और महंगे संस्करण के समान रखता है। यह हमें इन जटिल "वर्ल्ड सिमुलेशन" को मानक कंप्यूटरों पर चलाने में सक्षम बनाता है, जिससे इंटरैक्टिव AI और वर्चुअल रियलिटी बहुत अधिक व्यावहारिक हो जाती है।

संक्षेप में: WorldCache AI को उन चीजों पर ऊर्जा बर्बाद करने से रोकता है जिन्हें आसानी से समझा जा सकता है, ताकि वह अपना पूरा ध्यान उन चीजों पर लगा सके जो वास्तव में बदल रही हैं और कठिन हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →