← नवीनतम पेपर
🤖 machine learning

RESCAST-100K: A Comprehensive Dataset for Cross-Domain Residential Load and Indoor Temperature Forecasting

यह शोध पत्र RESCAST-100K को प्रस्तुत करता है, जो 100,000 सिम्युलेटेड और पांच वास्तविक दुनिया के आवासीय डेटासेट से बना एक बड़े पैमाने का बेंचमार्क है, जिसे उन्नत मशीन लर्निंग आर्किटेक्चर का उपयोग करके अल्पकालिक ऊर्जा लोड और इनडोर तापमान पूर्वानुमान के लिए क्रॉस-डोमेन सामान्यीकरण (cross-domain generalization) का व्यवस्थित रूप से मूल्यांकन करने और सुधारने के लिए डिज़ाइन किया गया है।

मूल लेखक: Jainam Dhruva, Yousaf Raza, A. B. Siddique, Simone Silvestri

प्रकाशित 2026-06-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jainam Dhruva, Yousaf Raza, A. B. Siddique, Simone Silvestri

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक छात्र को घर के अंदर के मौसम की भविष्यवाणी करना सिखाने की कोशिश कर रहे हैं। समस्या यह है कि हर घर अलग होता है: कुछ फ्लोरिडा की गर्मी में होते हैं, कुछ मिनेसोटाटा की ठंड में; कुछ की दीवारें ईंट की होती हैं, तो कुछ की लकड़ी की; कुछ गैस फर्नेस का उपयोग करते हैं, तो कुछ हीट पंप का।

यदि आप केवल एक विशिष्ट शहर के एक विशिष्ट घर के डेटा का उपयोग करके छात्र को सिखाते हैं, तो वे संभवतः तब विफल हो जाएंगे जब आप उन्हें एक पूरी तरह से अलग घर के तापमान की भविष्यवाणी करने के लिए कहेंगे। ऊर्जा पूर्वानुमान (energy forecasting) में यही बड़ी समस्या है: हमारे पास प्रत्येक प्रकार के घर के लिए मॉडल को प्रशिक्षित करने के लिए पर्याप्त डेटा नहीं है।

पेश है RESCAST-100K।

इस पेपर को एक विशाल, सुपर-स्मार्ट "ट्रेनिंग जिम" के रूप में समझें जिसे AI मॉडल के लिए बनाया गया है। उन्होंने क्या बनाया है, इसे सरल भाषा में यहाँ समझाया गया है:

1. 100,000 घरों का "आभासी शहर" (Virtual City)

वास्तविक घरों से डेटा एकत्र करने (जो धीमा, महंगा और अक्सर निजी होता है) के बजाय, लेखकों ने 100,000 अमेरिकी घरों का एक डिजिटल जुड़वां (digital twin) बनाने के लिए EnergyPlus नामक एक उच्च-तकनीकी सिम्युलेटर का उपयोग किया।

  • विविधता: उन्होंने केवल 100,000 एक जैसे बॉक्स नहीं बनाए। उन्होंने एक विविध शहर बनाया। उन्होंने स्थान (भूगोल), जलवायु, दीवारों की सामग्री, हीटिंग सिस्टम और घरों के आकार में भिन्नता रखी।
  • डेटा: प्रत्येक आभासी घर के लिए, उन्होंने एक पूरे वर्ष के लिए हर 15 मिनट में तीन चीजें दर्ज कीं:
    1. कुल ऊर्जा भार (Total Energy Load): पूरे घर ने कितनी बिजली का उपयोग किया।
    2. HVAC लोड: विशेष रूप से हीटिंग और एयर कंडीशनिंग ने कितनी बिजली का उपयोग किया।
    3. इनडोर तापमान: घर के अंदर कितनी गर्मी या ठंड थी।
  • संदर्भ (Context): उन्होंने AI को "सुराग" भी दिए जैसे कि बाहरी मौसम, थर्मोस्टेट सेटिंग्स और घर का स्थिर विवरण (जैसे कि "इसकी दीवार ईंट की है")।

2. "प्रशिक्षण परीक्षण" (क्रॉस-डोमेन चुनौती)

इस डेटासेट का असली जादू केवल इसके आकार में नहीं है; बल्कि यह है कि वे इसका उपयोग AI को परखने के लिए कैसे करते हैं।

कल्पना कीजिए कि आप एक छात्र को न्यूयॉर्क (ठंडा, ईंट की दीवारें, गैस फर्नेस) के घरों पर प्रशिक्षित करते हैं। फिर, आप तुरंत उन्हें एरिजोना (गर्म, स्टुको दीवारें, हीट पंप) के घरों पर टेस्ट करते हैं। इसे "क्रॉस-डोमेन" (Cross-Domain) परीक्षण कहा जाता है।

अधिकांश पुराने डेटासेट केवल आपको उन घरों पर परीक्षण करने देते हैं जिन्हें छात्र पहले देख चुका है। RESCAST-100K आपको विशिष्ट "चुनौतियां" सेट करने की अनुमति देता है:

  • भूगोल में बदलाव (Geography Shift): उत्तर में प्रशिक्षण लें, दक्षिण में परीक्षण करें।
  • जलवायु में बदलाव (Climate Shift): आर्द्र क्षेत्र में प्रशिक्षण लें, शुष्क क्षेत्र में परीक्षण करें।
  • उपकरण में बदलाव (Equipment Shift): फर्नेस वाले घरों पर प्रशिक्षण लें, हीट पंप वाले घरों पर परीक्षण करें।

यह शोधकर्ताओं को यह देखने में मदद करता है कि क्या उनका AI वास्तव में "भौतिकी के नियमों" को सीख रहा है या केवल उन विशिष्ट घरों को याद कर रहा है जिनका उसने अध्ययन किया था।

3. "खोई हुई पहेली के टुकड़े" की समस्या

वास्तविक दुनिया में, डेटा अक्सर अव्यवस्थित होता है। कभी-कभी कोई सेंसर टूट जाता है, या किसी घर में स्मार्ट थर्मोस्टेट नहीं होता, इसलिए AI के पास प्रमुख सुराग (जैसे बाहरी तापमान) गायब हो सकते हैं।

लेखकों ने अपने AI मॉडल का परीक्षण प्रशिक्षण के दौरान जानबूझकर कुछ डेटा छिपाकर किया। वे यह देखना चाहते थे: क्या AI अभी भी एक अच्छा अनुमान लगा सकता है यदि उसके पास मौसम की रिपोर्ट या थर्मोस्टेट सेटिंग गायब हो?

4. परिणाम: खेल में कौन जीता?

उन्होंने यह देखने के लिए कई अलग-अलग प्रकार के AI "मस्तिष्क" (architectures) का परीक्षण किया कि कौन सा उनके कठिन, बदलते परिवेश को संभाल सकता है।

  • हारने वाले: पारंपरिक मॉडल (जैसे साधारण रिकरेंट न्यूरल नेटवर्क) और मानक "ट्रांसफॉर्मर" मॉडल (वे मॉडल जो कई आधुनिक AI टूल्स को शक्ति देते हैं) तब संघर्ष करते हैं जब घर का प्रकार बदल जाता है। जब नियम ठंडी जलवायु से गर्म जलवायु में बदलते हैं, तो वे भ्रमित हो जाते हैं।
  • विजेता: दो विशिष्ट प्रकार के मॉडल सबसे अच्छा प्रदर्शन करते हैं:
    1. MLP-Mixers (TSMixer): ये मॉडल सभी अलग-अलग सुरागों (मौसम, दीवार का प्रकार, आदि) को एक साथ देखने और पैटर्न खोजने के लिए उन्हें मिलाने में बहुत अच्छे हैं। वे ऊर्जा उपयोग की भविष्यवाणी करने में सर्वश्रेष्ठ थे।
    2. Cross-Attention Models (TimeXer): ये मॉडल घर के तापमान के इतिहास की विशिष्ट "कहानी" पर ध्यान केंद्रित करने और साथ ही बाहरी कारकों पर भी ध्यान देने में अच्छे हैं। वे वास्तविक इनडोर तापमान की भविष्यवाणी करने में सर्वश्रेष्ठ थे।

मुख्य निष्कर्ष: जो मॉडल "लापता डेटा" और "अलग-अलग घर के प्रकारों" को संभालने में सक्षम थे, वे उन्नत मिक्सिंग और अटेंशन तकनीकों का उपयोग करने वाले मॉडल थे।

5. "सिम-टू-रियल" (Sim-to-Real) वास्तविकता की जांच

अंत में, लेखकों ने अपने 100,000 आभासी घरों पर प्रशिक्षित मॉडलों को पाँच वास्तविक दुनिया के डेटासेट्स (वास्तविक घर जिनमें वास्तविक लोग रहते हैं) पर परखा।

  • परिणाम: जैसा कि अपेक्षित था, मॉडल वास्तविक घरों पर एकदम सटीक नहीं थे क्योंकि वास्तविक लोग अप्रत्याशित होते हैं (वे खिड़कियां खोलते हैं, लाइट चालू छोड़ देते हैं, आदि, जिन्हें सिम्युलेटर ने नहीं समझा था)।
  • सकारात्मक पक्ष: वास्तविक डेटा पर पुन: प्रशिक्षण दिए बिना भी, उनके वर्चुअल सिटी द्वारा प्रशिक्षित मॉडल ऊर्जा उपयोग के "सामान्य आकार" (प्रोबेबिलिस्टिक फोरकास्टिंग) का अनुमान लगाने में आश्चर्यजनक रूप से अच्छे थे। वे सटीक संख्या बताने के बजाय, यह कहने में बेहतर थे कि, "यह संभवतः 50 और 60 kWh के बीच होगा।"

सारांश

यह पेपर RESCAST-100K को पेश करता है, जो 100,000 सिम्युलेटेड अमेरिकी घरों का एक विशाल, कॉन्फ़िगर करने योग्य डेटासेट है। यह एक कठोर परीक्षण स्थल के रूप में कार्य करता है ताकि यह देखा जा सके कि क्या AI किसी भी घर में ऊर्जा उपयोग की भविष्यवाणी करना सीख सकता है, भले ही उसने उस विशिष्ट प्रकार के घर को पहले कभी न देखा हो। उन्होंने पाया कि उन्नत AI मॉडल (Mixers और Cross-Attention) पुराने मॉडलों की तुलना में नए वातावरण के अनुकूल होने और लापता डेटा को संभालने में बहुत बेहतर हैं, जो भविष्य में स्मार्ट ऊर्जा प्रबंधन के लिए एक आशाजनक मार्ग प्रदान करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →