← नवीनतम पेपर
🤖 AI

Reverso: Efficient Time Series Foundation Models for Zero-shot Forecasting

यह शोध पत्र Reverso को प्रस्तुत करता है, जो अत्यधिक कुशल ज़ीरो-शॉट टाइम सीरीज़ फाउंडेशन मॉडल्स का एक परिवार है, जो बहुत बड़े ट्रांसफार्मर-आधारित मॉडल्स के प्रदर्शन से मेल खाने के लिए लॉन्ग कन्वोल्यूशन और लीनियर RNN लेयर्स को संयोजित करने वाले छोटे हाइब्रिड आर्किटेक्चर का लाभ उठाते हैं, जबकि पैरामीटर काउंट को दो आदेशों (ऑर्डर्स) से अधिक कम कर देते हैं।

मूल लेखक: Xinghong Fu, Yanhong Li, Georgios Papaioannou, Yoon Kim

प्रकाशित 2026-07-28
📖 10 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xinghong Fu, Yanhong Li, Georgios Papaioannou, Yoon Kim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप भविष्य बताने की कोशिश कर रहे हैं, लेकिन मौसम या शेयर बाजार का अनुमान लगाने के बजाय, आप संख्याओं की एक लंबी, घुमावदार रेखा को देख रहे हैं जो समय के साथ बदलती रहती है। इसे टाइम सीरीज़ फोरकास्टिंग (समय श्रृंखला पूर्वानुमान) कहा जाता है। दशकों से, वैज्ञानिक गणित के नुस्खों और सरल कंप्यूटर प्रोग्रामों का उपयोग करके यह अनुमान लगाने की कोशिश करते आए हैं कि आगे क्या होगा। लेकिन हाल ही में, एक नए प्रकार का सुपर-स्मार्ट कंप्यूटर दिमाग आया है जिसे फाउंडेशन मॉडल कहा जाता है। इन मॉडलों को एक मास्टर शेफ की तरह समझें जिसने दुनिया के हर व्यंजन का स्वाद चखा है। केवल एक रेसिपी सीखने के बजाय (जैसे बिजली की खपत की भविष्यवाणी करना), वे एक साथ सभी रेसिपी की "भाषा" सीखते हैं। यह उन्हें किसी भी नए व्यंजन का भविष्य बताने में सक्षम बनाता है जिसे उन्होंने पहले कभी नहीं देखा है, बस कुछ सामग्रियों को देखकर। इसे ज़ीरो-शॉट फोरकास्टिंग कहा जाता है। हालाँकि, इसमें एक पेंच है: इस मास्टर शेफ बनने के लिए, इन मॉडलों को आमतौर पर विशाल होना पड़ता है, जिन्हें चलाने के लिए भारी कंप्यूटर और भारी मात्रा में बिजली की आवश्यकता होती है। वे एक विशाल, ईंधन की भूखी ट्रक की तरह हैं जो बहुत सारा माल ढो तो सकता है लेकिन उसे छोटी शहर की गलियों में चलाना असंभव है।

यह पेपर Reverso पेश करता है, जो टाइम सीरीज़ मॉडलों का एक नया परिवार है जो एक सरल प्रश्न पूछता है: क्या हमें पैकेज डिलीवर करने के लिए वास्तव में एक विशाल ट्रक की आवश्यकता है, या क्या हम एक सुव्यवस्थित, कुशल मोटरसाइकिल बना सकते हैं जो उतनी ही तेज़ चल सके? शोधकर्ताओं की एक टीम के लेखकों का तर्क है कि वर्तमान में मॉडलों को बड़ा और बड़ा बनाने का जुनून हमें मुख्य बात से भटका सकता है। उनका सुझाव है कि एक महान टाइम सीरीज़ मॉडल का रहस्य केवल आकार नहीं है, बल्कि यह है कि मॉडल डेटा को कितनी चतुराई से देखता है। उन्होंने Reverso को छोटा बनाया—इसके कुछ संस्करणों में केवल कुछ लाख पैरामीटर्स (मॉडल के "मस्तिष्क कोशिकाएं") हैं—फिर भी वे विशाल, अरबों पैरामीटर्स वाले दिग्गजों के समान प्रदर्शन करते हैं। पेपर सुझाव देता है कि कुछ स्मार्ट ट्रिक्स का उपयोग करके, हम इन मॉडलों को इतना छोटा बना सकते हैं कि वे भविष्य की सटीक भविष्यवाणी करने की अपनी क्षमता खोए बिना, लैपटॉप या यहाँ तक कि फोन जैसे रोजमर्रा के उपकरणों पर चल सकें।

विशाल मॉडलों के साथ समस्या

आर्टिफिशियल इंटेलिजेंस की दुनिया में, एक लोकप्रिय विचार है कि "बड़ा बेहतर है।" यदि आप चाहते हैं कि एक मॉडल स्मार्ट हो, तो बस उसे अधिक डेटा और अधिक मस्तिष्क कोशिकाएं दें। भाषा और विजन के लिए इस काम ने अद्भुत परिणाम दिए हैं, जिससे ऐसे विशाल मॉडल बने जो निबंध लिख सकते हैं या बिल्लियों को पहचान सकते हैं। लेकिन टाइम सीरीज़ के लिए, इस दृष्टिकोण ने ऐसे मॉडल बना दिए हैं जो करोड़ों मस्तिष्क कोशिकाओं के बड़े हैं। हालांकि वे भविष्य की भविष्यवाणी करने में अच्छे हैं, लेकिन वे उपयोग करने में बहुत कठिन हैं। वे छोटे उपकरणों पर चलाने के लिए बहुत भारी हैं, उन्हें प्रशिक्षित करना बहुत महंगा है, और वास्तविक समय की स्थितियों में उपयोग करने के लिए बहुत धीमे हैं। यह एक साइकिल के टायर को ठीक करने के लिए स्टीमरोलर (भारी रोलर) का उपयोग करने जैसा है; यह काम तो करता है, लेकिन यह बेहद अक्षम है।

इस पेपर के लेखकों ने एक अलग रास्ता चुनने का निर्णय लिया। मॉडल को केवल बड़ा बनाने के बजाय, उन्होंने पूछा: हम मॉडल को डेटा देखने के बारे में कैसे स्मार्ट बना सकते हैं? वे एक ऐसा मॉडल बनाना चाहते थे जो "पैरामीटर-एफिशिएंट" हो, जिसका अर्थ है कि वह अपने निवेश का अधिकतम लाभ उठाए। वे केवल एक छोटा मॉडल नहीं चाहते थे; वे एक ऐसा छोटा मॉडल चाहते थे जो दिग्गजों के साथ प्रतिस्पर्धा कर सके।

Reverso की रेसिपी: तीन जादुई ट्रिक्स

Reverso बनाने के लिए, लेखकों ने एक सरल रेसिपी तैयार की। इसे एक भोजन बनाने की तरह समझें जहाँ आप सब कुछ बस एक बर्तन में नहीं डालते; बल्कि आप इसे इस तरह तैयार करते हैं जिससे सबसे अच्छे स्वाद उभर कर आएं।

1. "ज़ूम लेंस" रणनीति (मल्टी-स्केल इनपुट)
कल्पना कीजिए कि आप एक लंबी सड़क देख रहे हैं। यदि आप केवल बहुत करीब से देखते हैं, तो आप फुटपाथ की दरारें देखते हैं। यदि आप बहुत दूर से देखते हैं, तो आप पूरा हाईवे देखते हैं लेकिन विवरण चूक जाते हैं। अधिकांश मॉडल केवल एक दूरी से देखने की कोशिश करते हैं। हालाँकि, Reverso एक "ज़ूम लेंस" का उपयोग करता है। यह एक ही टाइम सीरीज़ डेटा को लेता है और उसे एक साथ चार अलग-अलग लेंसों के माध्यम से देखता है:

  • एक लेंस डेटा को वैसा ही देखता है जैसा वह है (उच्च विवरण)।
  • एक लेंस हर दूसरे बिंदु को छोड़ देता है (मध्यम विवरण)।
  • एक लेंस हर तीसरे बिंदु को छोड़ देता है (कम विवरण)।
  • एक लेंस और भी अधिक छोड़ देता है (बहुत कम विवरण)।

डेटा के इन चार अलग-अलग "व्यू" को एक साथ मॉडल में फीड करके, मॉडल उन पैटर्न को सीख सकता है जो तेजी से होते हैं (जैसे अचानक उछाल) और उन पैटर्न को जो धीरे-धीरे होते हैं (जैसे मौसमी रुझान), और यह सब एक साथ कर सकता है। यह चार जासूसों की एक टीम होने जैसा है, जिनमें से प्रत्येक अपराध स्थल को एक अलग कोण से देख रहा है, और फिर वे अपने नोट्स को मिलाते हैं। यह ट्रिक मॉडल को लंबे समय के पैटर्न को समझने की अनुमति देती है बिना एक साथ बहुत बड़ी मात्रा में डेटा को याद रखने की आवश्यकता के।

2. "हाइब्रिड इंजन" (सीक्वेंस मिक्सिंग)
एक बार जब मॉडल के पास उसका डेटा आ जाता है, तो उसे उसे प्रोसेस करने की आवश्यकता होती है। अधिकांश मॉडल "अटेंशन" नामक एक विधि का उपयोग करते हैं, जो एक स्पॉटलाइट की तरह है जो डेटा के पूरे इतिहास को स्कैन करती है ताकि महत्वपूर्ण चीज़ों को पाया जा सके। यह शक्तिशाली है लेकिन धीमा और भारी है। Reverso एक हाइब्रिड इंजन का उपयोग करता है जो दो अलग-अलग प्रकार के प्रोसेसिंग के बीच स्विच करता है:

  • लॉन्ग कॉन्वोल्यूशन (Long Convolutions): ये एक स्लाइडिंग विंडो की तरह हैं जो दोहराते हुए पैटर्न खोजने के लिए डेटा को स्कैन करती है, जैसे कि एक बैंड में रिदम सेक्शन ताल बनाए रखता है।
  • डेल्टानेट लेयर्स (DeltaNet Layers): ये एक प्रकार के "लीनियर रिकरेंट" लेयर हैं। इन्हें एक मेमोरी बैंक के रूप में सोचें जो लगातार खुद को अपडेट करता रहता है, पूरे इतिहास को फिर से पढ़े बिना सबसे महत्वपूर्ण चीजों को याद रखता है।

लेखकों ने पाया कि इन दोनों को मिलाने से—कुछ हिस्सों के लिए "स्लाइडिंग विंडो" का उपयोग करने और दूसरों के लिए "मेमोरी बैंक" का उपयोग करने से—सबसे अच्छा परिणाम मिलता है। यह केवल भारी स्पॉटलाइट (अटेंशन) या केवल मेमोरी बैंक का उपयोग करने की तुलना में तेज़ और हल्का था। यह एक ऐसी कार चलाने जैसा है जिसमें गति के लिए टर्बोचार्जर और दक्षता के लिए हाइब्रिड बैटरी दोनों हैं।

3. "स्मार्ट डिकोडर" (अटेंशन हेड)
अंत में, डेटा को प्रोसेस करने के बाद, मॉडल को भविष्यवाणी करने की आवश्यकता होती है। Reverso अंत में एक विशेष "डिकोडर" का उपयोग करता है जो अटेंशन के एक हल्के रूप का उपयोग करता है। यह वह हिस्सा है जो वास्तव में कहता है, "मैंने जो कुछ भी देखा है, उसके आधार पर, मुझे लगता है कि आगे क्या होने वाला है।" लेखकों ने पाया कि इस विशिष्ट प्रकार का डिकोडर एक साधारण, सीधे गणना की तुलना में सटीक भविष्यवाणियां करने में बहुत बेहतर था।

परिणाम: छोटा लेकिन शक्तिशाली

टीम ने Reverso के तीन संस्करणों को प्रशिक्षित किया: एक बहुत छोटा (200,000 पैरामीटर्स), एक छोटा (550,000 पैरामीटर्स), और एक मानक संस्करण (2.6 मिलियन पैरामीटर्स)। फिर उन्होंने इन मॉडलों का परीक्षण दुनिया के सबसे बड़े और भारी मॉडलों के खिलाफ किया, जिनमें से कुछ में एक अरब से अधिक पैरामीटर्स हैं।

परिणाम आश्चर्यजनक थे। Gift-Eval बेंचमार्क (विभिन्न प्रकार के डेटा पर पूर्वानुमान कौशल का एक विशाल परीक्षण) पर, मानक Reverso मॉडल ने 0.706 का स्कोर प्राप्त किया। यह अविश्वसनीय रूप से प्रतिस्पर्धी है। इसने उन मॉडलों को भी मात दी जो 100 से 1,000 गुना बड़े थे।

  • इसने FlowState (2.6M पैरामीटर्स) और Tiny-Time Mixers (1M पैरामीटर्स) जैसे मॉडलों को हराया।
  • यह TimesFM-2.5 (200M पैरामीटर्स) और Xihe-Max (1.5B पैरामीटर्स) जैसे दिग्गजों के बहुत करीब रहा।

लेकिन असली जादू केवल सटीकता नहीं थी; यह गति और मेमोरी का उपयोग भी था। क्योंकि Reverso बहुत छोटा है, यह बहुत तेज़ी से चलता है और बहुत कम मेमोरी का उपयोग करता है। लेखकों ने "इन्फरेंस लेटेंसी" (भविष्यवाणी करने में लगने वाला समय) को मापा और पाया कि Reverso विशाल मॉडलों की तुलना में काफी तेज़ था। यह एक स्पोर्ट्स कार की तुलना एक मालगाड़ी से करने जैसा है: ट्रेन बहुत सारा भार ढो सकती है, लेकिन स्पोर्ट्स कार आपको गंतव्य तक बहुत जल्दी पहुँचा देती है और कम ईंधन का उपयोग करती है।

Reverso क्या कर सकता है (और क्या नहीं कर सकता)

पेपर दिखाता है कि Reverso ज़ीरो-शॉट फोरकास्टिंग (उस विशिष्ट डेटा पर पूर्व प्रशिक्षण के बिना भविष्य की भविष्यवाणी करना), वर्गीकरण (डेटा को श्रेणियों में छाँटना), और एनोमली डिटेक्शन (अजीब, अप्रत्याशित घटनाओं को पहचानना) में उत्कृष्ट है। उदाहरण के लिए, अजीब घटनाओं को खोजने के परीक्षणों में, Reverso ने अन्य मॉडलों की तुलना में अधिक अजीब घटनाओं का पता लगाया, भले ही "अजीब" के लिए थ्रेशोल्ड बहुत सख्त था।

हालाँकि, लेखक इसकी सीमाओं के बारे में ईमानदार हैं।

  • यह मुख्य रूप से डेटा की एकल लाइनों के लिए है: Reverso वर्तमान में एक "यूनिवेरिएट" मॉडल के रूप में प्रशिक्षित है, जिसका अर्थ है कि यह एक बार में संख्याओं की एक रेखा को देखता है। यह अभी तक मल्टी-वेरिएट (बहु-चर) डेटा को उतना अच्छा नहीं संभालता है जो एक-दूसरे पर निर्भर होते हैं, जितना कि जटिल अटेंशन मैकेनिज्म का उपयोग करने वाले कुछ विशाल मॉडल करते हैं।
  • छोटी सीक्वेंस (श्रृंखलाएं) कठिन हैं: जबकि Reverso लंबी अवधि की भविष्यवाणियों के लिए अद्भुत है, जब डेटा बहुत छोटा होता है तो यह कभी-कभी विशाल मॉडलों से पीछे रह जाता है।
  • यह नंबरों की भविष्यवाणी करता है, संभावनाओं की नहीं: Reverso एक एकल सर्वोत्तम अनुमान (पॉइंट प्रेडिक्शन) देता है। यह स्वाभाविक रूप से आपको यह नहीं बताता कि वह कितना आश्वस्त है (जैसे "मैं 90% सुनिश्चित हूँ कि बारिश होगी")। लेखक सुझाव देते हैं कि आप बाद में यह सुविधा जोड़ सकते हैं, लेकिन यह अभी तक इसमें शामिल नहीं है।

यह क्यों मायने रखता है

Reverso से मुख्य सबक यह है कि आकार सब कुछ नहीं है। पेपर सुझाव देता है कि कई वास्तविक दुनिया के कार्यों के लिए, बाधा यह नहीं है कि मॉडल कितना बड़ा है, बल्कि यह है कि इसे कितनी अच्छी तरह डिज़ाइन किया गया है। मल्टी-स्केल इनपुट और हाइब्रिड प्रोसेसिंग के चतुर मिश्रण का उपयोग करके, आप एक ऐसा मॉडल बना सकते हैं जो आपके लैपटॉप या फोन पर चलने के लिए पर्याप्त छोटा है लेकिन दिग्गजों के साथ प्रतिस्पर्धा करने के लिए पर्याप्त स्मार्ट है।

यह एक बड़ी बात है क्योंकि इसका मतलब है कि हमें लगातार बड़े मॉडल बनाने की आवश्यकता नहीं हो सकती है जिनके लिए विशाल डेटा केंद्रों की आवश्यकता होती है। इसके बजाय, हम कुशल, कॉम्पैक्ट मॉडल बना सकते हैं जिन्हें कहीं भी तैनात किया जा सकता है—आपकी स्मार्टवॉच पर, एक सेल्फ-ड्राइविंग कार में, या एक दूरस्थ मौसम स्टेशन में। लेखक निष्कर्ष निकालते हैं कि सावधानीपूर्वक डिज़ाइन "परफॉर्मेंस-एफिशिएंसी फ्रंटियर" को बदल सकता है, जिससे शक्तिशाली AI सभी के लिए सुलभ हो जाता है, न कि केवल उनके लिए जिनके पास असीमित कंप्यूटिंग शक्ति है।

संक्षेप में, Reverso साबित करता है कि भविष्य को स्पष्ट रूप से देखने के लिए आपको विशाल होने की आवश्यकता नहीं है; आपको बस इसे सही कोणों से देखने की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →