← नवीनतम पेपर
💻 computer science

History-First Reliability-Gated Fusion for Sampled-Peak System and GPU Memory Utilization Prediction in HPC Clusters

यह शोध पत्र एक हिस्ट्री-फर्स्ट, रिलायबिलिटी-गेटेड फ्यूजन फ्रेमवर्क प्रस्तुत करता है जो सटीक-स्क्रिप्ट ऐतिहासिक कैशिंग को LoRA-अनुकूलित Qwen2.5-Coder एनकोडर के साथ जोड़ता है ताकि चयनात्मक अनुमान (सेलेक्टिव इन्फरेंस) के माध्यम से कम्प्यूटेशनल ओवरहेड को कम करते हुए HPC क्लस्टर्स में सिस्टम और GPU मेमोरी उपयोग की भविष्यवाणी की सटीकता में महत्वपूर्ण सुधार किया जा सके।

मूल लेखक: Pan Chang, Xueru Chen, Guangchao Hu

प्रकाशित 2026-09-21
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Pan Chang, Xueru Chen, Guangchao Hu

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

हाई-परफॉर्मेंस कंप्यूटिंग के विशाल, गूंजते हुए हॉलों में, जहाँ सुपरकंप्यूटर उन समस्याओं को हल करते हैं जो किसी एक मशीन के लिए बहुत जटिल हैं, एक शांत लेकिन महत्वपूर्ण चुनौती बनी हुई है: संसाधन प्रबंधन। ये क्लस्टर प्रोसेसर, मेमोरी बैंक और ग्राफिक्स एक्सेलेरेटर के विशाल शहरों की तरह हैं, जो सभी सामंजस्य में काम करते हैं। इस शहर को सुचारू रूप से चलाने के लिए, प्रशासकों को यह तय करना होता है कि किसी कार्य के शुरू होने से पहले ही उसे कितनी शक्ति आवंटित की जाए। वर्तमान में, वे कार्य के अपने अनुरोध पर निर्भर करते हैं—एक उपयोगकर्ता या स्क्रिप्ट जो मेमोरी या समय की एक निश्चित मात्रा मांगती है। हालाँकि, ये अनुरोध अक्सर रूढ़िवादी अनुमान होते हैं, जो यह सुनिश्चित करने के लिए किए जाते हैं कि कार्य क्रैश न हो जाए। जब हर कोई अपनी आवश्यकता से अधिक मांगता है, तो शहर खंडित हो जाता है; मूल्यवान स्थान खाली पड़ा रहता है जबकि अन्य कार्य कतार में प्रतीक्षा करते हैं। इस क्षेत्र में आधुनिक अनुसंधान का लक्ष्य इन मोटे अनुमानों से आगे बढ़कर यह सटीक भविष्यवाणी करना है कि कोई कार्य वास्तव में कितना उपयोग करेगा, जिससे सिस्टम कार्यों को अधिक सघनता और कुशलता से पैक कर सके।

मुख्य कठिनाई स्वयं कार्य की प्रकृति में निहित है। एक कार्य का व्यवहार केवल एक संख्या नहीं है; यह कोड में लिखी गई एक कहानी है। कभी-कभी एक उपयोगकर्ता ठीक उसी स्क्रिप्ट को चलाता है जिसका उसने कल उपयोग किया था, और परिणाम अनुमानित होता है। अन्य समय में, वे कोड की एक पंक्ति बदल देते हैं, एक डेटा फ़ाइल बदलते हैं, या एक अलग प्रकार के कंप्यूटर पर चलते हैं, और संसाधन उपयोग नाटकीय रूप से बदल सकता है। पारंपरिक तरीके जो केवल पिछले नंबरों को देखते हैं, अक्सर विफल हो जाते हैं जब स्क्रिप्ट बदल जाती है, जबकि वे तरीके जो कोड को शुरू से पढ़ने की कोशिश करते हैं, धीमे और गणनात्मक रूप से महंगे हो सकते हैं। शोधकर्ताओं के सामने प्रश्न यह था कि क्या वे एक ऐसा सिस्टम बना सकते हैं जो जानता हो कि कब अतीत पर भरोसा करना है और कब नए कोड को पढ़ना है, और इन दोनों सूचना स्रोतों को सटीक भविष्यवाणी करने के लिए कैसे मिलाना है।

ईस्ट चाइना नॉर्मल यूनिवर्सिटी, रेनमिन यूनिवर्सिटी ऑफ चाइना और न्यूयॉर्क यूनिवर्सिटी शंघाई के शोधकर्ताओं की एक टीम ने एक उच्च-प्रदर्शन कंप्यूटिंग क्लस्टर के लिए एक नए प्रकार का प्रेडिक्शन इंजन बनाकर इसे हल करने का प्रयास किया। उन्होंने दो विशिष्ट संसाधनों पर ध्यान केंद्रित किया: सिस्टम मेमोरी जो सामान्य प्रसंस्करण के लिए डेटा रखती है, और वीडियो मेमोरी, या VRAM, जिसका उपयोग ग्राफिक्स कार्ड भारी गणनाओं के लिए करते हैं। उनका दृष्टिकोण, जिसे वे "हिस्ट्री-फर्स्ट रिलायबिलिटी-गेटेड कैस्केड" कहते हैं, एक स्मार्ट ट्रैफिक कंट्रोलर की तरह कार्य करता है। प्रत्येक कार्य को जटिल विश्लेषण से गुजरने के लिए मजबूर करने के बजाय, सिस्टम पहले यह जांचता है कि क्या उस सटीक स्क्रिप्ट के सफलतापूर्वक चलने का कोई विश्वसनीय रिकॉर्ड मौजूद है। यदि इतिहास स्पष्ट और भरोसेमंद है, तो सिस्टम उस पिछले डेटा का तुरंत उपयोग करता है, जिससे भारी काम से बचा जा सके। यह "बायपास" तंत्र है, जिसे समय और ऊर्जा बचाने के लिए डिज़ाइन किया गया है जब उत्तर पहले से ज्ञात हो।

हालाँकि, सिस्टम परिवर्तन के प्रति अंधा नहीं है। यदि स्क्रिप्ट नई है, या यदि पिछला इतिहास बहुत बिखरा हुआ है और विश्वसनीय नहीं है, तो सिस्टम एक परिष्कृत कोड-रीडिंग टूल को सक्रिय करता है। यह टूल, जो प्रोग्रामिंग भाषाओं को समझने के लिए प्रशिक्षित एक विशेष आर्टिफिशियल इंटेलिजेंस मॉडल पर आधारित है, सबमिट की गई स्क्रिप्ट, उपयोगकर्ता की पहचान और कार्य के लिए किए गए विशिष्ट अनुरोधों का विश्लेषण करता है। यह कोड को पढ़कर कार्य के तर्क को समझने की कोशिश करता है, और इस बात के सुराग ढूंढता है कि कार्य को वास्तव में कितनी मेमोरी या ग्राफिक्स पावर की आवश्यकता होगी। शोधकर्ताओं ने केवल AI को अनुमान लगाने के लिए नहीं छोड़ा; उन्होंने निर्णय लेने का एक दूसरा स्तर बनाया जो AI के बोलने के बाद होता है। यह स्तर AI की भविष्यवाणी की तुलना उपलब्ध ऐतिहासिक डेटा से करता है। यदि इतिहास मजबूत है, तो यह अंतिम भविष्यवाणी को पिछले रिकॉर्ड की ओर खींचता है, लेकिन केवल एक सुरक्षित, गणना की गई सीमा के भीतर, ताकि बड़े उतार-चढ़ाव को रोका जा सके। यदि इतिहास कमजोर है, तो यह AI को कोड के पठन का नेतृत्व करने देता है। यह गतिशील मिश्रण सुनिश्चित करता है कि सिस्टम प्रत्येक एकल कार्य की विशिष्ट स्थिति के अनुसार अनुकूलित हो सके।

इस पद्धति का परीक्षण करने के लिए, शोधकर्ताओं ने एक प्रोडक्शन क्लस्टर के वास्तविक दुनिया के डेटासेट का परीक्षण किया जिसमें ग्यारह महीने और आधे महीने की अवधि में लगभग 20,000 पूर्ण किए गए कार्यों का डेटा था। उन्होंने अपने नए सिस्टम की तुलना कई मौजूदा तरीकों से की, जिसमें पिछली बार किसी उपयोगकर्ता द्वारा कार्य चलाने के सरल लुकअप और केवल मेटाडेटा पर निर्भर मानक मशीन लर्निंग मॉडल शामिल थे। परिणामों ने दिखाया कि उनका हाइब्रिड दृष्टिकोण सबसे सटीक था। सिस्टम मेमोरी उपयोग की भविष्यवाणी करने के लिए, नए तरीके ने सबसे अच्छे पिछले तरीके की तुलना में औसत त्रुटि को लगभग पांच प्रतिशत कम कर दिया। ग्राफिक्स मेमोरी उपयोग की भविष्यवाणी करने के लिए, सुधार और भी महत्वपूर्ण था, जिसने औसत त्रुटि को लगभग चौदह प्रतिशत कम कर दिया। सिस्टम विशेष रूप रूप से उन कार्यों की पहचान करने में प्रभावी था जो त्रुटि के सुरक्षित मार्जिन के भीतर रहेंगे, जो प्रशासकों के लिए एक महत्वपूर्ण कारक है जिन्हें मशीनों को ओवरलोड होने से बचाने की आवश्यकता होती है।

अध्ययन ने यह भी स्पष्ट किया कि ये भविष्यवाणियां कैसे काम करती हैं। शोधकर्ताओं ने पाया कि सिस्टम की सफलता काफी हद तक कार्य के प्रकार पर निर्भर करती है। जब एक उपयोगकर्ता बार-बार एक ही स्क्रिप्ट चलाता है, तो सरल इतिहास-आधारित दृष्टिकोण अक्सर जटिल AI के समान ही अच्छा होता है, जो यह सिद्ध करता है कि दोहराव वाले कार्यों के लिए पिछला प्रदर्शन एक मजबूत संकेतक है। हालाँकि, जब स्क्रिप्ट बदल जाती है या कोई सटीक इतिहास मौजूद नहीं होता है, तो कोड-रीडिंग AI आवश्यक हो जाता है, जो ऐसी अंतर्दृष्टि प्रदान करता है जो शुद्ध इतिहास नहीं दे सकता। सिस्टम ने इन विभिन्न व्यवस्थाओं को पहचानना सीखा, और स्वचालित रूप से रणनीतियों को बदलना सीखा। गति के संदर्भ में, शोधकर्ताओं ने एक उच्च-स्तरीय ग्राफिक्स कार्ड पर एक एकल कार्य को प्रोसेस करने में लगने वाले समय को मापा। बिना किसी शॉर्टकट के, विश्लेषण में लगभग इकतीस मिलीसेकंड लगे, जो एक व्यस्त कंप्यूटिंग क्लस्टर की परिचालन आवश्यकताओं के भीतर एक सेकंड का बहुत छोटा हिस्सा है। बायपास तंत्र का उपयोग करके, सिस्टम ने लगभग आधे कार्यों के लिए इस भारी विश्लेषण से बचकर दक्षता में और सुधार किया।

शोधकर्ताओं ने अपने निष्कर्षों की सीमाओं को नोट करने में सावधानी बरती। अध्ययन एक विशिष्ट हार्डवेयर और वर्कलोड के मिश्रण वाले एक विशिष्ट क्लस्टर पर आयोजित किया गया था, इसलिए परिणाम उस विशेष वातावरण को दर्शाते हैं। उन्होंने इस बात पर भी जोर दिया कि उनकी भविष्यवाणियां सफलतापूर्वक पूरे किए गए कार्यों पर आधारित हैं; सिस्टम विफलताओं या क्रैश की भविष्यवाणी नहीं करता है, बल्कि केवल सफलतापूर्वक पूर्ण होने वाले कार्यों के लिए संसाधनों के शिखर उपयोग की भविष्यवाणी करता है। इसके अलावा, भविष्यवाणियां योजना सहायता के रूप में बनाई गई हैं ताकि प्रशासकों को बेहतर निर्णय लेने में मदद मिल सके, न कि इस गारंटी के रूप में कि सिस्टम को सुरक्षित रूप से ओवरलोड किया जा सकता है। अध्ययन में उपयोग किए गए डेटा में वास्तविक निष्पादन योग्य (executable) स्क्रिप्ट शामिल थीं, जिनमें संवेदनशील जानकारी होती है, इसलिए शोधकर्ता कच्चे डेटा को सार्वजनिक रूप से जारी नहीं कर सके, हालांकि उन्होंने विशिष्ट समझौतों के तहत शैक्षणिक समीक्षा के लिए कोड और व्युत्पन्न डेटा उपलब्ध कराया है।

अंततः, यह कार्य प्रदर्शित करता है कि संसाधन भविष्यवाणी का भविष्य इतिहास और कोड के बीच चयन करने में नहीं, बल्कि उन्हें बुद्धिमानी से फ्यूज करने में है। एक ऐसा सिस्टम बनाकर जो यह जानता है कि अतीत पर कब भरोसा करना है और वर्तमान को कब पढ़ना है, शोधकर्ताओं ने हाई-परफॉर्मेंस कंप्यूटिंग क्लस्टरों को अधिक कुशल बनाने के लिए एक व्यावहारिक उपकरण प्रदान किया है। यह पद्धति बताती है कि विश्वसनीयता जांच और अनुकूलन योग्य शिक्षण के सही संयोजन के साथ, हम एक ऐसी स्थिति के करीब पहुंच सकते हैं जहाँ कंप्यूटिंग संसाधनों का उपयोग सटीकता के साथ किया जा सके, जिससे बर्बादी कम हो और अधिक जटिल वैज्ञानिक कार्य किए जा सकें। निष्कर्ष आधुनिक कंप्यूटिंग की बढ़ती मांगों के प्रबंधन के लिए एक स्पष्ट मार्ग प्रदान करते हैं, यह सिद्ध करते हुए कि थोड़ा सा इतिहास, जो कोड की गहरी समझ द्वारा निर्देशित हो, बहुत काम आ सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →