← नवीनतम पेपर
🤖 machine learning

Building2Building: A Large Scale Benchmark for Generalizable Real-World Reinforcement Learning

यह शोध पत्र बिल्डिंग-टू-बिल्डिंग (B2B) को प्रस्तुत करता है, जो एनर्जीप्लस (EnergyPlus) पर आधारित एक बड़े पैमाने का, भौतिक रूप से सुदृढ़ बेंचमार्क सूट है, जो सामान्यीकरण (generalization), स्थानांतरण (transfer) और बहु-कार्य शिक्षण (multi-task learning) का व्यवस्थित अध्ययन करने के लिए विविध HVAC नियंत्रण वातावरण प्रदान करके वास्तविक दुनिया की तैनाती में सुदृढीकरण शिक्षण (reinforcement learning) की भंगुरता को संबोधित करता है।

मूल लेखक: Vincent Taboga, Justin Veilleux, Doseok Jang, Anushree Rankawat, Pierre-Luc Bacon

प्रकाशित 2026-07-21
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Vincent Taboga, Justin Veilleux, Doseok Jang, Anushree Rankawat, Pierre-Luc Bacon

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ रोबोट वीडियो गेम में लाखों बार अभ्यास करके चलना, खेल खेलना या पहेलियाँ सुलझाना सीखते हैं। यह रीइन्फोर्समेंट लर्निंग (RL) का क्षेत्र है, जो आर्टिफिशियल इंटेलिजेंस की एक शाखा है जहाँ एक कंप्यूटर "एजेंट" प्रयास और त्रुटि (trial and error) के माध्यम से सीखता है, अच्छे कदमों के लिए अंक पाता है और गलत कदमों के लिए अंक खो देता है। इसे एक कुत्ते को गेंद लाना सिखाने जैसा समझें: वह गेंद को पकड़ने की कोशिश करता है, यदि वह सफल होता है तो उसे इनाम (treat) मिलता है, और अंततः वह दौड़ने और कूदने का सबसे अच्छा तरीका समझ जाता है।

लेकिन यहाँ एक पेच है: इनमें से अधिकांश सुपर-स्मार्ट AI एजेंट उन संगीत प्रतिभाओं की तरह हैं जो केवल एक ही गाना पूरी तरह से बजा सकते हैं। यदि आप लय बदल दें, पियानो की जगह गिटार रख दें, या उन्हें कोई अलग धुन बजाने के लिए कहें, तो वे अक्सर ठप पड़ जाते हैं। वास्तविक दुनिया में चीजें अस्त-व्यस्त होती हैं। एक रोबोट जिसे चिकने कंक्रीट पर चलने के लिए डिज़ाइन किया गया है, वह बजरी पर लड़खड़ा सकता है; एक थर्मोस्टेट जिसे धूप वाले कार्यालय के लिए प्रशिक्षित किया गया है, वह बारिश वाले गोदाम में विफल हो सकता है। वैज्ञानिक इसे जनरलाइजेशन (generalization) की समस्या कहते हैं—जो आपने सीखा है उसे नई, थोड़ी अलग स्थितियों में लागू करने की क्षमता, बिना फिर से शुरुआत किए। बड़ा सवाल यह है: हम AI को एक 'वन-हिट-वंडर' के बजाय एक बहुमुखी जैज़ संगीतकार बनने के लिए कैसे सिखाएं?

यहाँ बिल्डिंग टू बिल्डिंग (B2B) का आगमन होता है, जो शोधकर्ताओं द्वारा ठीक इसी समस्या को हल करने के लिए बनाया गया एक विशाल नया खेल का मैदान है। रोबोटों या वीडियो गेमों का उपयोग करने के बजाय, उन्होंने AI को इमारतों में हीटिंग, वेंटिलेशन और एयर कंडीशनिंग (HVAC) सिस्टम को नियंत्रित करना सिखाने का निर्णय लिया। इमारतें क्यों? क्योंकि वे हर जगह हैं, वे भारी मात्रा में ऊर्जा का उपयोग करती हैं, और हर एक इमारत अद्वितीय है। कुछ एक कमरे वाले छोटे घर हैं; अन्य दर्जनों ज़ोन वाले विशाल कार्यालय हैं। कुछ में पुराने, भारी हीटर हैं; दूसरों में हाई-टेक सेंट्रल एयर सिस्टम हैं।

शोधकर्ताओं ने एक विशाल डिजिटल फैक्ट्री बनाई जो 6,000 अलग-अलग आभासी (virtual) इमारतें उत्पन्न कर सकती है, जिनमें से प्रत्येक का अपना व्यक्तित्व, आकार और जलवायु है। फिर उन्होंने AI एजेंटों को इन इमारतों को आरामदायक बनाए रखने के साथ-साथ ऊर्जा बचाने के लिए चुनौती दी। लक्ष्य केवल एक ऐसा AI बनाना नहीं था जो एक इमारत के लिए काम करे, बल्कि एक "यूनिवर्सल" कंट्रोलर बनाना था जो किसी भी बिल्कुल नई इमारत में जा सके जिसे उसने पहले कभी नहीं देखा हो और तुरंत जान सके कि तापमान को कैसे समायोजित करना है।

परिणाम उत्साहजनक थे लेकिन कोई जादुई समाधान नहीं थे। जब उन्होंने अपने AI का परीक्षण किया, तो उन्होंने पाया कि कई अलग-अलग इमारतों के मिश्रण पर प्रशिक्षित एजेंट वास्तव में नई इमारतों के अनुकूल हो सकते हैं, और अक्सर आज के वास्तविक जीवन में उपयोग किए जाने वाले मानक, पूर्व-निर्धारित कंट्रोलरों को मात देते हैं। हालाँकि, AI पूर्ण नहीं था; जब इमारत देखी गई किसी भी चीज़ से बहुत अलग थी, या जब खेल के नियम बदल गए (जैसे अचानक लोगों को गर्म रखने के बजाय पैसे बचाने पर अधिक ध्यान देना), तो वह कभी-कभी संघर्ष करता था।

यह शोध पत्र सुझाव देता है कि इस विविध, विशाल डेटासेट पर प्रशिक्षण देकर, हम AI को अधिक लचीला बना सकते हैं। यह एक छात्र को न केवल एक गणितीय समस्या को हल करना सिखाने जैसा है, बल्कि अंतर्निहित तर्क को समझने के लिए है ताकि वे उन समस्याओं को हल कर सकें जिन्हें उन्होंने पहले कभी नहीं देखा है। हालांकि यह वर्तमान में एक सिमुलेशन है और कल किसी वास्तविक इमारत में जाने वाला रोबोट नहीं है, फिर भी यह AI का परीक्षण करने और सुधारने का एक शक्तिशाली नया तरीका प्रदान करता है। यदि सफल रहा, तो यह स्मार्ट, हरित इमारतों की ओर ले जा सकता है जो ऊर्जा और पैसा बचाती हैं, जिससे यह सिद्ध होगा कि वास्तव में स्मार्ट AI की कुंजी उसे एक बहुत व्यापक, अधिक विविध शिक्षा देने में हो सकती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →