← नवीनतम पेपर
🤖 machine learning

Scaling Laws of Global Weather Models

यह शोध पत्र वैश्विक मौसम मॉडलों में अनुभवजन्य स्केलिंग कानूनों का विश्लेषण करता है, जो यह प्रकट करता है कि प्रदर्शन को गहरे मॉडलों या बढ़े हुए पैरामीटर काउंट के बजाय व्यापक आर्किटेक्चर और बड़े प्रशिक्षण डेटासेट को प्राथमिकता देकर अधिकतम किया जाता है, जिसमें कंप्यूट-ऑप्टिमल रणनीतियाँ निश्चित बजट के तहत डेटा विस्तार के पक्ष में होती हैं।

मूल लेखक: Yuejiang Yu, Langwen Huang, Alexandru Calotoiu, Torsten Hoefler

प्रकाशित 2026-06-11
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuejiang Yu, Langwen Huang, Alexandru Calotoiu, Torsten Hoefler

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कंप्यूटर को मौसम की भविष्यवाणी करना सिखाने की कोशिश कर रहे हैं। दशकों से, वैज्ञानिकों ने वायुमंडल का अनुकरण करने के लिए जटिल भौतिकी समीकरणों का उपयोग किया है, जैसे कि एक विशाल, आभासी विंड टनल (wind tunnel) चलाना। लेकिन हाल ही में, एक नया दृष्टिकोण उभरा है: भौतिकी के बजाय, हम "डेटा-संचालित" (data-driven) मॉडल का उपयोग करते हैं। ये उन सुपर-स्मार्ट छात्रों की तरह हैं जो पिछले मौसम के रिपोर्टों के लाखों पन्ने पढ़कर मौसम की भविष्यवाणी करना सीखते हैं।

यह शोध पत्र उन छात्रों के लिए एक अध्ययन मार्गदर्शिका (study guide) है। शोधकर्ताओं ने पूछा: "यदि हम इन मौसम-अध्ययन करने वाले कंप्यूटरों को अधिक मस्तिष्क शक्ति (पैरामीटर्स), अधिक पाठ्यपुस्तकें (डेटा), या अध्ययन करने के लिए अधिक समय (कंप्यूट) दें, तो वे वास्तव में कितने बेहतर हो जाते हैं?"

उन्होंने पांच अलग-अलग "छात्रों" (मॉडल जिन्हें Aurora, GraphCast, Pangu, SFNO, और AIFS नाम दिया गया है) का परीक्षण किया यह देखने के लिए कि वे कैसे स्केल अप होते हैं। यहाँ उन्होंने क्या पाया, जिसे सरल रूप में समझाया गया है:

1. "अधिक डेटा" का नियम: Aurora सबसे अच्छा पाठक है

भाषा मॉडलों (जैसे कि जो निबंध लिखते हैं) की दुनिया में, अधिक डेटा मदद करता है, लेकिन इसकी एक सीमा होती है। शोधकर्ताओं ने पाया कि मौसम मॉडलों के लिए, अधिक डेटा एक सुपरपावर है, लेकिन कुछ मॉडल इसे पढ़ने में दूसरों से बेहतर होते हैं।

  • उपमा: कल्पना कीजिए कि दो छात्र परीक्षा दे रहे हैं। एक (GraphCast) बहुत बुद्धिमान है लेकिन केवल कुछ ही किताबें पढ़ता है। दूसरा (Aurora) एक बहुत बड़ा पाठक है।
  • निष्कर्ष: जब उन्होंने प्रशिक्षण डेटा की मात्रा को 10 गुना बढ़ाया, तो Aurora ने अपनी भविष्यवाणियों में भारी सुधार किया (3.2 गुना तक बेहतर)। यह कच्चे डेटा को मौसम के ज्ञान में बदलने में सबसे कुशल है। अन्य मॉडल भी सुधरे, लेकिन उतने नाटकीय रूप से नहीं।

2. "मस्तिष्क के आकार" का नियम: GraphCast एक कुशल जीनियस है

शोधकर्ताओं ने यह भी देखा कि प्रत्येक मॉडल को अच्छा होने के लिए कितनी "मस्तिष्क शक्ति" (पैरामीटर्स) की आवश्यकता थी।

  • उपमा: मॉडल के आकार को एक लाइब्रेरी के आकार के रूप में सोचें। GraphCast एक छोटी लाइब्रेरी की तरह है जो किसी तरह वह सब जानती है जो उसे जानने की आवश्यकता है। यह अविश्वसनीय रूप से कुशल है; इसे अपना ज्ञान संग्रहीत करने के लिए एक विशाल इमारत की आवश्यकता नहीं है।
  • निष्कर्ष: GraphCast सबसे अधिक "पैरामीटर-कुशल" (parameter-efficient) है। यह अपेक्षाकृत छोटे मॉडल आकार के साथ बेहतरीन परिणाम प्राप्त करता है। हालाँकि, एक पेच है: हालांकि यह स्मार्ट है, लेकिन यह कंप्यूटर पर चलने में धीमा है क्योंकि यह जानकारी को प्रोसेस करने के तरीके (जैसे कि एक जीनियस जो बहुत गहराई से सोचता है लेकिन धीरे चलता है) के कारण धीमा है।

़3. "आकार" का सरप्राइज: चौड़ा और उथला (Wide and Shallow) बेहतर है

यह सबसे बड़ा आश्चर्य है। भाषा मॉडलों (जैसे चैटबॉट्स) की दुनिया में, मॉडल को "गहरा" बनाना (सोचने के अधिक स्तर जोड़ना) आमतौर पर मदद करता है। लेकिन मौसम के लिए, गहराई उतनी मायने नहीं रखती जितनी चौड़ाई।

  • उपमा: कल्पना कीजिए कि एक घर बना रहे हैं।
    • गहरा (Deep): एक गगनचुंबी इमारत बनाना जिसमें 50 मंजिलें हैं लेकिन हर मंजिल पर केवल एक कमरा है।
    • चौड़ा (Wide): एक मंजिला घर बनाना जिसमें केवल 2 मंजिलें हैं, लेकिन प्रत्येक मंजिल पर 50 कमरे हैं।
  • निष्कर्ष: मौसम की भविष्यवाणी के लिए, चौड़ा घर जीतता है। शोधकर्ताओं ने पाया कि जिन मॉडलों में अधिक "चौड़ाई" (एक ही समय में अधिक प्रोसेसिंग पावर) थी, उन्होंने अधिक "गहराई" (सोचने के कई चरणों) वाले मॉडलों की तुलना में बेहतर प्रदर्शन किया। यहाँ तक कि केवल एक या दो स्तरों की "सोच" वाले मॉडल भी आश्चर्यजनक रूप से अच्छा काम करते हैं। यह पता चला कि अगले 6 घंटों के लिए मौसम की भविष्यवाणी करना पूरी तस्वीर का एक व्यापक दृश्य रखने के बारे में है, न कि कई छोटे, गहरे चरणों में जाने के बारे में।

4. "बजट" रणनीति: लंबे समय तक अध्ययन करें, केवल बड़ा न बनें

यदि आपके पास खर्च करने के लिए एक निश्चित राशि (या कंप्यूटर शक्ति) है, तो आपको इसे कैसे खर्च करना चाहिए? क्या आपको एक बड़ा दिमाग (अधिक पैरामीटर्स) खरीदना चाहिए या अधिक पाठ्यपुस्तकें (अधिक डेटा) खरीदनी चाहिए?

  • उपमा: आपके पास एक छात्र के लिए बजट है। क्या आप एक बड़े प्रोफेसर को काम पर रखते हैं (बड़ा मॉडल) या वर्तमान प्रोफेसर को लाइब्रेरी का अधिक वर्षों तक अध्ययन करने के लिए देते हैं (अधिक डेटा)?
  • निष्कर्ष: शोध पत्र कहता है कि उन्हें अधिक डेटा दें और उन्हें लंबे समय तक अध्ययन करने दें। एक निश्चित बजट के तहत, एक विशाल मॉडल को कम डेटा पर प्रशिक्षित करने के बजाय, एक थोड़े छोटे मॉडल को भारी मात्रा में डेटा पर प्रशिक्षित करना बेहतर है। मौसम मॉडलों के लिए "स्वीट स्पॉट" मॉडल के आकार के बजाय डेटा की मात्रा को प्राथमिकता देना है।

5. सभी चर (Variables) समान नहीं होते

शोधकर्ताओं ने यह भी देखा कि मॉडल हर चीज़ में एक ही गति से बेहतर नहीं होते हैं।

  • उपमा: कल्पना कीजिए कि एक छात्र जो गणित में बहुत अच्छा है लेकिन इतिहास में संघर्ष करता है।
  • निष्कर्ष: कुछ मौसम चर (जैसे हवा की गति) अन्य चरों (जैसे तापमान) की तुलना में अलग तरह से सुधरते हैं। एक मॉडल हवा की भविष्यवाणी करने में सर्वश्रेष्ठ हो सकता है लेकिन तापमान की भविष्यवाणी करने में केवल "ठीक" हो सकता है। इसका मतलब है कि आप केवल एक समग्र स्कोर को नहीं देख सकते; आपको यह जांचना होगा कि मॉडल मौसम के प्रत्येक विशिष्ट हिस्से को कैसे संभालता है।

6. "हार्डवेयर" की वास्तविकता की जाँच

अंत में, शोध पत्र ने यह भी देखा कि ये मॉडल वास्तव में वास्तविक कंप्यूटरों पर कितनी अच्छी तरह चलते हैं।

  • उपमा: एक फेरारी इंजन (GraphCast) शक्तिशाली हो सकता है, लेकिन यदि यह ट्रैफिक में फंसा हुआ है (अकुशल हार्डवेयर उपयोग), तो यह तेज़ नहीं जा पाएगा। एक भरोसेमंद ट्रक (Aurora) फेरारी नहीं हो सकता है, लेकिन यह सुचारू रूप से चलता है और सड़क का कुशलतापूर्वक उपयोग करता है।
  • निष्कर्ष: Aurora कंप्यूटर हार्डवेयर का उपयोग करने में अविश्वसनीय रूप से कुशल था (GraphCast की तुलना में कंप्यूटर की क्षमता का लगभग 36 गुना अधिक उपयोग कर रहा था)। GraphCast, स्मार्ट होने के बावजूद, कंप्यूटर संसाधनों के साथ बहुत बर्बादी करता है। यह बताता है कि वास्तविक दुनिया के उपयोग के लिए, एक मॉडल जो हार्डवेयर पर "कुशल" है, वह उतना ही महत्वपूर्ण है जितना कि एक "स्मार्ट" मॉडल।

सारांश

यदि आप इस शोध पत्र के आधार पर सबसे अच्छा मौसम भविष्यवक्ता बनाना चाहते हैं:

  1. चौड़ा जाएँ, गहरा नहीं: मॉडल को चौड़ा और सपाट बनाएँ, ऊँचा और संकीर्ण नहीं।
  2. उन्हें डेटा खिलाएं: मॉडल को बड़ा बनाने के बजाय उन्हें अधिक प्रशिक्षण डेटा देने को प्राथमिकता दें।
  3. अपने चैंपियन को चुनें: Aurora डेटा सीखने और कंप्यूटर शक्ति का कुशलतापूर्वक उपयोग करने में महान है। GraphCast अपने मस्तिष्क के आकार के साथ छोटा और कुशल होने में महान है, लेकिन यह कंप्यूटरों पर धीमा चलता है।
  4. विवरणों की जाँच करें: केवल औसत स्कोर न देखें; यह देखें कि मॉडल हवा या तापमान जैसी विशिष्ट चीजों को कैसे संभालता है, क्योंकि वे अलग-अलग व्यवहार करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →