Semperf: An LLM-assisted Performance Diagnosis for Extreme-Scale Parallel Programs
यह शोध पत्र Semperf प्रस्तुत करता है, जो एक LLM-सहायता प्राप्त फ्रेमवर्क है जो अत्यधिक-पैमाने वाले समानांतर HPC अनुप्रयोगों के लिए स्केलेबल, स्वचालित प्रदर्शन निदान और बॉटलनेक पहचान को सक्षम करने हेतु रैंक-प्रोफ़ाइल मैट्रिसेस का निर्माण करता है और प्रक्रियाओं को क्लस्टर करता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक ऐसी दुनिया की कल्पना करें जहाँ हज़ारों छोटे कामगार, जिनमें से प्रत्येक के पास एक विशाल पहेली का एक टुकड़ा है, मिलकर एक बहुत बड़ी गुत्थी को सुलझाने की कोशिश कर रहे हैं। सुपरकंप्यूटर इसी तरह काम करते हैं: वे मौसम की भविष्यवाणी करने या परमाणु विस्फोट का अनुकरण करने जैसे विशाल, जटिल कार्यों को दसियों हज़ार प्रोसेसरों (जिन्हें "रैंक्स" कहा जाता है) में विभाजित कर देते हैं। लक्ष्य यह है कि सभी लोग एक ही समय में अपना हिस्सा पूरा कर लें ताकि पूरी तस्वीर तुरंत उभर सके। लेकिन कभी-कभी, चीजें गलत हो जाती हैं। एक कामगार भारी काम करने में फंस सकता है जबकि अन्य लोग इंतजार करते हुए बैठे रह जाते हैं, या कुछ लोग संचार के भूलभुलैया में खो सकते हैं। इसे "परफॉर्मेंस बॉटलनेक" (प्रदर्शन संबंधी बाधा) कहा जाता है।
दशकों तक, इन बॉटलनेक्स को ठीक करना एक शहर के आकार के ढेर में सुई खोजने जैसा था, जिसे केवल एक टॉर्च की मदद से ढूँढा जा रहा हो। विशेषज्ञों को संख्याओं में छिपे सूक्ष्म सुरागों को खोजने के लिए डेटा के पहाड़ों को घूरना पड़ता है ताकि यह अनुमान लगाया जा सके कि कंप्यूटर धीमा क्यों हो रहा है। यह धीमा, थकाऊ और विशेषज्ञता के उस स्तर की मांग करता है जो बहुत कम लोगों के पास है। अब, कल्पना करें कि यदि आप उस पूरे ढेर को एक अत्यंत बुद्धिमान, जिज्ञासु जासूस को सौंप सकें जो तुरंत पैटर्न को पहचान सके, आपको सटीक रूप से बता सके कि कौन सा कामगार अटका हुआ है, और सरल अंग्रेजी में समझा सके कि क्यों। यही Semperf नामक एक नए टूल का वादा है, जो एक 'लार्ज लैंग्वेज मॉडल' (LLM) के रूप में एक प्रकार के आर्टिफिशियल इंटेलिजेंस का उपयोग करता है ताकि वह उस जासूस की भूमिका निभा सके।
जासूस का टूलकिट: Semperf
यह शोध पत्र Semperf को पेश करता है, जो इन अत्यधिक बड़े पैमाने वाले समानांतर कार्यक्रमों (parallel programs) में प्रदर्शन संबंधी समस्याओं का निदान करने के लिए डिज़ाइन किया गया एक नया टूलकिट है। शोधकर्ता लियांग काओ, जू लियू और शियाओवेन जू ने एक कठिन समस्या का सामना किया: जबकि LLM तर्क देने और चीजों को समझाने में माहिर हैं, वे 1,00,000 प्रोसेसरों पर चलने वाले सुपरकंप्यूटर द्वारा उत्पन्न डेटा की विशाल मात्रा को नहीं संभाल सकते। यदि आप सारा कच्चा डेटा सीधे AI को खिलाने की कोशिश करेंगे, तो यह आग की बौछार (firehose) से पानी पीने जैसा होगा; AI जानकारी के बोझ से घुट जाएगा।
इस समस्या को हल करने के लिए, Semperf एक चतुर फिल्टर और अनुवादक के रूप में कार्य करता है। AI पर डेटा की पूरी बौछार डालने के बजाय, यह पहले अराजकता को एक व्यवस्थित, प्रबंधनीय संरचना में व्यवस्थित करता है। यह एक ऐसी चीज़ बनाता है जिसे लेखक "रैंक-प्रोफाइल मैट्रिक्स" कहते हैं। इसे एक विशाल स्प्रेडशीट के रूप में समझें जहाँ प्रत्येक पंक्ति हजारों कामगारों (रैंक्स) में से एक का प्रतिनिधित्व करती है, और प्रत्येक कॉलम उनके द्वारा किए गए एक विशिष्ट कार्य या फंक्शन का प्रतिनिधित्व करता है। सेल में दिए गए नंबर बताते हैं कि प्रत्येक कामगार ने प्रत्येक कार्य पर कितना समय बिताया।
एक बार जब यह विशाल स्प्रेडशीट बन जाती है, तो Semperf समान कामगारों को एक साथ समूहबद्ध करने के लिए "क्लस्टरिंग" नामक एक गणितीय तकनीक का उपयोग करता है। यह एक कक्षा के छात्रों को उनके नामों के बजाय उनके व्यवहार के आधार पर वर्गीकृत करने जैसा है। एल्गोरिदम यह पा सकता है कि 2,760 छात्र सभी एक स्थिर, सामान्य गति से काम कर रहे हैं (समूह A), जबकि छात्रों का एक छोटा समूह 1ifferent समस्याओं पर पागलों की तरह लिख रहा है (समूह B)। इन समूहों की पहचान करके, Semperf को हर एक कामगार को देखने की आवश्यकता नहीं है; उसे बस कहानी बताने के लिए प्रत्येक समूह से एक "प्रतिनिधि" चुनने की आवश्यकता है।
AI जासूस काम करते हुए
इन प्रतिनिधि समूहों की पहचान करने के बाद, Semperf AI जासूस (इस मामले में, LLM DeepSeek-V4) के लिए एक संक्षिप्त "रिपोर्ट कार्ड" तैयार करता है। इस रिपोर्ट कार्ड में समूहों के प्रदर्शन पैटर्न शामिल होते हैं और AI से पूछा जाता है: "इन सुरागों के आधार पर, धीमी गति का कारण क्या है?"
AI केवल अनुमान नहीं लगाता; यह बेयसियन रीजनिंग (Bayesian reasoning) का उपयोग करता है, जो साक्ष्यों के आधार पर अपने विश्वासों को अपडेट करने की एक विधि है। यह डेटा को देखता है और कहता है, "आह, मैं देख रहा हूँ कि छोटा समूह अपना 36% समय ज्यामिति गणनाओं (geometry calculations) पर बिता रहा है, जबकि बड़ा समूह 24% समय स्पिन लॉक्स (एक प्रकार का डिजिटल प्रतीक्षा कक्ष) पर प्रतीक्षा कर रहा है। इससे पता चलता है कि छोटा समूह सारा भारी काम कर रहा है, जिससे बड़ा समूह खाली बैठा रह जाता है।"
शोधकर्ताओं ने तीन अलग-अलग परिदृश्यों पर इस प्रणाली का परीक्षण किया:
- JEuler3D.m: 2,880 प्रोसेसरों पर चल रहा एक जटिल फ्लूइड डायनेमिक्स सिमुलेशन। Semperf ने सही ढंग से पहचाना कि रैंकों का एक छोटा समूह कार्यों को समानांतर (parallel) करने के बजाय क्रमिक (serial) रूप से कर रहा था, जिससे बाकी सिस्टम खाली बैठा रह गया।
- BT Benchmark: 81 प्रोसेसरों पर चल रहा एक संतुलित टेस्ट केस। यहाँ, AI ने सही ढंग से रिपोर्ट किया कि वहाँ कोई महत्वपूर्ण बॉटलनेक नहीं था, जो यह सिद्ध करता है कि यह बिना वजह समस्याएँ पैदा नहीं करता।
- JUPITER: 1,02,400 प्रोसेसरों पर चल रहा एक विशाल सिमुलेशन। यह "एक्सट्रीम-स्केल" परीक्षण है। Semperf ने 1,00,000 से अधिक फाइलों के डेटा को प्रोसेस किया, उन्हें 256 के एक छोटे समूह और 1,02,144 के एक विशाल समूह में क्लस्टर किया, और एक गंभीर संचार बॉटलनेक (communication bottleneck) का निदान किया जहाँ छोटा समूह अत्यधिक काम के बोझ से दब गया था, जिससे पूरा सिस्टम रुक गया था।
यह पेपर क्या खारिज करता है और क्या सिद्ध करता है
लेखक इस बात के परीक्षण के प्रति सावधान थे कि क्या उनकी विधि वास्तव में आवश्यक थी। उन्होंने "एब्लेशन स्टडीज" (ablation studies) चलाईं, जो ऐसे प्रयोग हैं जहाँ आप यह देखने के लिए मशीन का एक हिस्सा हटा देते हैं कि क्या वह अभी भी काम करती है।
सबसे पहले, उन्होंने पूछा: "क्या हमें वास्तव में डेटा को क्लस्टर करने की आवश्यकता है? क्या हम बस रैंडम कामगार चुन नहीं सकते?" उन्होंने AI को 1% या 2% प्रोसेसरों के रैंडम सैंपल का डेटा देने की कोशिश की। हालाँकि AI कभी-कभी सही उत्तर का अनुमान लगा सकता था, लेकिन वह कम आत्मविश्वासी था और उसे ऐसा करने के लिए बहुत अधिक डेटा (बड़े "प्रॉम्प्ट्स") की आवश्यकता थी। पेपर सुझाव देता है कि विशाल प्रणालियों तक स्केल करने के लिए एक संक्षिप्त और विश्वसनीय निदान बनाने हेतु क्लस्टरिंग अनिवार्य है।
दूसिला, उन्होंने पूछा: "क्या हमें वास्तव में AI की आवश्यकता है? क्या हम केवल सरल गणितीय नियमों का उपयोग नहीं कर सकते?" उन्होंने Semperf की तुलना एक नियम-आधारित प्रणाली से की जो केवल औसत प्रतीक्षा समय की गणना करती थी। नियम-आधारित प्रणाली यह देख सकती थी कि कुछ कामगार प्रतीक्षा कर रहे थे, लेकिन वह यह नहीं बता सकती थी कि क्यों। वह गहरे संबंध को समझने में विफल रही कि एक छोटा समूह ज्यामिति का काम कर रहा था जिसने दूसरों को प्रतीक्षा करने के लिए मजबूर किया। पेपर प्रदर्शित करता है कि केवल स्ट्रक्चर्ड फीचर्स पर्याप्त नहीं हैं; डेटा बिंदुओं के बीच के संबंधों के बारे में तर्क करने के लिए आपको LLM की क्षमता की आवश्यकता होती है ताकि मानव-पठनीय स्पष्टीकरण दिया जा सके।
निष्कर्ष
पेपर यह निष्कर्ष निकालता है कि Semperf प्रदर्शन संबंधी समस्याओं के निदान के लिए एक स्केलेबल और व्याख्या योग्य (interpretable) तरीका है। इसने 1,02,400 प्रक्रियाओं तक के अनुप्रयोगों को संभालने के लिए स्ट्रक्चर्ड डेटा रिडक्शन और AI रीजनिंग को सफलतापूर्वक संयोजित किया है। लेखक सुझाव देते हैं कि यह दृष्टिकोण कच्चे, भारी डेटा और मानवीय समझ के बीच के अंतर को पाटता है। हालाँकि, वे अपनी सीमाओं के बारे में ईमानदार हैं: उन्होंने हर संभव AI मॉडल का परीक्षण नहीं किया है, और वे स्वीकार करते हैं कि प्रदर्शन निदान अक्सर एक पुनरावृत्ति प्रक्रिया है जहाँ मनुष्य और AI मिलकर काम करते हैं। वे यह दावा नहीं करते कि उन्होंने प्रदर्शन विश्लेषण को हमेशा के लिए "हल" कर दिया है, बल्कि वे कहते हैं कि उन्होंने एक शक्तिशाली नया सहायक बनाया है जो विशेषज्ञों को घास के ढेर में सुई खोजने में पहले की तुलना में बहुत तेज़ी से मदद कर सकता है।
संक्षेप में, Semperf भ्रमित करने वाली संख्याओं के पहाड़ को एक स्पष्ट, कार्रवाई योग्य कहानी में बदल देता है, जिससे सुपरकंप्यूटर सुचारू रूप से और तेज़ी से चलते हैं, भले ही वे एक बड़े शहर की आबादी से अधिक प्रोसेसरों के साथ काम कर रहे हों।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।