← नवीनतम पेपर
🤖 machine learning

A Later Test Set Is Not a New Domain: Pretraining Familiarity Survives a Contamination-Free Hold-Out

यह शोध पत्र यह प्रदर्शित करता है कि टेम्पोरल होल्ड-आउट परीक्षण (temporal hold-out tests) टाइम-सीरीज फाउंडेशन मॉडल्स के प्रदर्शन लाभ को पूरी तरह से समाप्त करने में विफल रहते हैं क्योंकि उनकी सफलता मुख्य रूप से सामान्य पूर्वानुमान क्षमता के बजाय विशिष्ट डेटा डोमेन के साथ प्रीट्रेनिंग की परिचितता से उत्पन्न होती है, जिसके लिए निष्पक्ष मूल्यांकन हेतु डोमेन-स्तरीय होल्ड-आउट्स की आवश्यकता है।

मूल लेखक: Mahdi Naser Moghadasi (BrightMind AI), Faezeh Ghaderi (University of Texas at Arlington)

प्रकाशित 2026-09-10
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mahdi Naser Moghadasi (BrightMind AI), Faezeh Ghaderi (University of Texas at Arlington)

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

डेटा साइंस की दुनिया में, यह विश्वास बढ़ रहा है कि एक एकल, विशाल कंप्यूटर प्रोग्राम किसी भी दोहराव वाले पैटर्न के भविष्य की भविष्यवाणी करना सीख सकता है—चाहे वह बिजली का उपयोग हो या शेयर बाजार की कीमतें—बिना उस विशिष्ट पैटर्न के बारे में विशेष रूप से सिखाए गए। ये प्रोग्राम, जिन्हें फाउंडेशन मॉडल्स (foundation models) कहा जाता है, ऐतिहासिक डेटा के विशाल पुस्तकालयों पर प्रशिक्षित होते हैं, जिससे वे समय के आगे बढ़ने के सामान्य "आकार" को समझ लेते हैं। वादा यह है कि एक बार प्रशिक्षित होने के बाद, वे संख्याओं के एक नए सेट को देखकर यह अनुमान लगा सकते हैं कि आगे क्या होगा, जो पारंपरिक तरीकों से बेहतर होता है, जिन्हें आमतौर पर प्रत्येक विशिष्ट कार्य के लिए शून्य से बनाना पड़ता है। हालाँकि, इन दावों पर एक साया मंडरा रहा है। क्योंकि इन मॉडलों को मापने के लिए उपयोग किए जाने वाले परीक्षण पुराने, सार्वजनिक रिकॉर्डों पर आधारित हैं, इसलिए यह बताना असंभव रहा है कि क्या कोई मॉडल वास्तव में भविष्य की भविष्यवाणी करने में सक्षम है या उसने केवल अतीत को याद कर लिया है। यदि किसी मॉडल का परीक्षण उस डेटा पर किया जाता है जो उसके बनने से पहले मौजूद था, तो यह संभावना है कि वह उन तथ्यों को याद कर रहा है जो उसने अपने प्रशिक्षण के दौरान देखे थे, न कि भविष्य बताने की वास्तविक क्षमता प्रदर्शित कर रहा है।

इस पहेली को सुलझाने के लिए, शोधकर्ताओं ने एक नए प्रकार का परीक्षण बनाया जिसे कोई भी मॉडल देख नहीं सकता था। उन्होंने तेरह अलग-अलग पूर्वानुमान उपकरणों को इकट्ठा किया—कुछ पुराने और सरल, कुछ नए और जटिल—और उनसे उस डेटा की भविष्यवाणी करने को कहा जो सबसे नए मॉडल के जारी होने के बाद प्रकाशित हुआ था। यह डेटा मानवीय गतिविधियों के पांच अलग-अलग क्षेत्रों से आया था: कितने लोगों ने विकिपीडिया पेज देखे, प्रति घंटा मौसम के पैटर्न, प्रति घंटा वायु गुणवत्ता रीडिंग, डेनिश पावर ग्रिड पर बिजली का उपयोग, और मुद्राओं के बीच दैनिक विनिमय दरें। परीक्षण के लिए उपयोग किया गया प्रत्येक अवलोकन 2026 में दर्ज किया गया था, एक ऐसा समय जो मॉडलों के प्रशिक्षित होने के समय तक अभी आया नहीं था। इसने यह सुनिश्चित किया कि कोई भी मॉडल उन विशिष्ट संख्याओं को याद न कर सके जिनकी उसे भविष्यवाणी करने के लिए कहा जा रहा था। लक्ष्य यह देखना था कि क्या ये शक्तिशाली, पूर्व-प्रशिक्षित दिग्गज वास्तव में एक बिल्कुल नई चुनौती का सामना करते समय साधारण, पुराने जमाने के उपकरणों से बेहतर प्रदर्शन कर सकते हैं।

परिणामों ने एक कहानी उजागर की जो सुर्खियों के सुझावों की तुलना में अधिक सूक्ष्म थी। पूर्व-प्रशिक्षित मॉडल हर जगह नहीं जीते। दैनिक विनिमय दरों पर, परीक्षण किए गए प्रत्येक तरीके ने—सबसे उन्नत आर्टिफिशियल इंटेलिजेंस से लेकर सबसे सरल अनुमान तक—बिल्कुल एक जैसा प्रदर्शन किया, और कोई भी एक बुनियादी पूर्वानुमान को नहीं हरा सका जो यह मान लेता है कि कल आज जैसा ही होगा। प्रति घंटा बिजली ग्रिड डेटा पर, 'थेटा' (Theta) नामक एक क्लासिक, गैर-मशीन लर्निंग पद्धति शीर्ष पर रही, जहाँ फैंसी पूर्व-प्रशिक्षित मॉडल उससे आगे निकलने में असमर्थ रहे। इन मामलों में, नई तकनीक कोई लाभ नहीं दे सकी। हालाँकि, मॉडल अन्य क्षेत्रों में चमके। उन्होंने विकिपीडिया पेजव्यू डेटा पर काफी बेहतर प्रदर्शन किया, जहाँ उन्होंने शास्त्रीय तरीकों की तुलना में ट्रैफिक स्पाइक्स (ट्रैफिक में अचानक उछाल) की बहुत सटीक भविष्यवाणी की। अंतर स्पष्ट था: साप्ताहिक विकिपीडिया व्यूज पर, सर्वश्रेष्ठ पूर्व-प्रशिक्षित मॉडल ने सबसे अच्छे शास्त्रीय तरीके की तुलना में 28 प्रतिशत कम त्रुटियां कीं।

शोधकर्ताओं ने फिर पूछा कि मॉडल कुछ स्थानों पर क्यों सफल हुए और अन्य में क्यों विफल रहे। उन्हें शुरू में संदेह था कि डेटा की प्रकृति ही इसकी कुंजी है। उन्होंने सोचा कि क्या मॉडल उस डेटा पर बेहतर काम करते हैं जो बहुत शोर वाला (noisy) है या जिसमें जटिल, दोहराव वाले चक्र हैं जिन्हें पहचानना कठिन है। उन्होंने इन चक्रों की शक्ति और डेटा में यादृच्छिकता (randomness) की मात्रा को मापा, लेकिन इन कारकों ने इस पैटर्न की व्याख्या नहीं की। मॉडल केवल इसलिए बेहतर नहीं थे क्योंकि डेटा अव्यवस्थित या अत्यधिक मौसमी था। इसके बजाय, उत्तर स्वयं मॉडलों के प्रशिक्षण इतिहास में निहित था। जिस डोमेन में मॉडलों ने सबसे अच्छा प्रदर्शन किया, वह विकिपीडia पेजव्यू था। यह वही प्रकार का डेटा है जिसे एक प्रमुख मॉडल, 'टाइम्स एफएम' (TimesFM) के रचनाकारों ने अपने प्रशिक्षण पुस्तकालय के बड़े हिस्से के रूप में वर्णित किया था। मॉडल ने वर्षों तक लाखों विकिपीडिया ट्रैफिक पैटर्न को पढ़ा था। भले ही उसने विशिष्ट 2026 के नंबर कभी नहीं देखे थे, लेकिन उसने विकिपीडिया ट्रैफिक के सामान्य व्यवहार को इतनी अच्छी तरह से सीख लिया था कि वह उस विशिष्ट डोमेन के भविष्य की आसानी से भविष्यवाणी कर सकता था।

यह निष्कर्ष बताता है कि इन मॉडलों का लाभ किसी भी चीज़ की भविष्यवाणी करने की सार्वभौमिक क्षमता से कम, और उस विशिष्ट प्रकार के डेटा के साथ उनकी गहरी परिचितता से अधिक है जिस पर उन्हें पाला गया था। जब शोधकर्ताओं ने विभिन्न पूर्व-प्रशिक्षित मॉडलों की तुलना एक ही विकिपीडिया डेटा पर की, तो विकिपीडिया डेटा पर प्रशिक्षित मॉडलों के परिवार ने लगातार दूसरों से बेहतर प्रदर्शन किया। मौसम या वायु गुणवत्ता जैसे अन्य डेटा प्रकारों पर, वह लाभ गायब हो गया। मॉडल जादुई नहीं थे; वे विशेषज्ञ थे जिन्होंने एक विशिष्ट पुस्तकालय की किताबें पढ़ी थीं और वे उनके भीतर की कहानियों को याद कर सकते थे, भले ही अध्याय नए हों।

अध्ययन ने यह भी उजागर किया कि ये मॉडल अपने आत्मविश्वास को कैसे व्यक्त करते हैं, इसमें एक छिपा हुआ दोष है। जबकि पूर्व-प्रधिका मॉडल अक्सर अपने 'पॉइंट प्रेडिक्शन' (एकल अनुमान) में सटीक होते थे, वे व्यवस्थित रूप से अति-आत्मविश्वासी थे। जब उन्होंने संभावित परिणामों की एक सीमा प्रदान की, तो उन्होंने दावा किया कि वे 80 प्रतिशत आश्वस्त हैं, लेकिन उनके वास्तविक अनुमानों ने केवल 70 प्रतिशत समय ही वास्तविक परिणाम को कवर किया। इसके विपरीत, पुराने, शास्त्री적인 तरीके अधिक सतर्क थे, जो अक्सर व्यापक सीमाएँ प्रदान करते थे जो वास्तविक परिणाम को अधिक बार कैप्चर करती थीं। एक व्यक्ति के लिए जो इन पूर्वानुमानों का उपयोग बिजली ग्रिड या आपूर्ति श्रृंखला (supply chain) के प्रबंधन के लिए करता है, यह अति-आत्मविश्वास खतरनाक हो सकता है, जिससे भंडार बहुत कम रह सकता है। शोधकर्ताओं ने नोट किया कि जबकि पूर्व-प्रशिक्षित मॉडल तेज़ और अक्सर अधिक सटीक थे, उनके अंशांकन (calibration) की कमी का मतलब था कि वे हमेशा महत्वपूर्ण निर्णयों के लिए सुरक्षित उपकरण नहीं थे।

अंततः, यह शोध पत्र निष्कर्ष निकालता है कि केवल परीक्षण की तारीख को आगे बढ़ा देना यह साबित करने के लिए पर्याप्त नहीं है कि एक मॉडल वास्तव में सामान्यीकरण (generalizing) कर रहा है। एक मॉडल एक भविष्य की तारीखों पर परीक्षण पास कर सकता है यदि उसने अपने प्रशिक्षण के दौरान एक विशिष्ट डोमेन के "स्वाद" को सीख लिया है। मॉडल की सामान्यीकरण करने की क्षमता को वास्तव में मापने के लिए, भविष्य के बेंचमार्क को पूरे डोमेन को बाहर रखना चाहिए जो प्रशिक्षण डेटा का हिस्सा नहीं थे, न कि केवल भविष्य की तारीखों को। एक अभ्यासकर्ता (practitioner) के लिए, सबक स्पष्ट है: मॉडल चुनने से पहले, केवल यह नहीं पूछना चाहिए कि कौन सा उपकरण सबसे शक्तिशाली है, बल्कि यह भी पूछना चाहिए कि आप जिस डेटा की भविष्यवाणी करने की कोशिश कर रहे हैं, क्या वह उस डेटा जैसा दिखता है जिस पर उस उपकरण को पाला गया था। यदि डेटा अलग है, तो मॉडल की प्रकट प्रतिभा गायब हो सकती है, जिससे सरल, अधिक सतर्क उपकरण अधिक विश्वसनीय विकल्प बन जाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →