← नवीनतम पेपर
🤖 machine learning

Instant GPU Efficiency Visibility at Fleet Scale

यह शोध पत्र ओवरऑल FLOP यूटिलाइजेशन (OFU) को प्रस्तुत करता है, जो ऑन-चिप परफॉरमेंस काउंटर्स से प्राप्त एक हार्डवेयर-स्तरीय, इंस्ट्रुमेंटेशन-मुक्त GPU दक्षता मीट्रिक है, जो विविध वर्कलोड और GPU पीढ़ियों में एप्लिकेशन-लेवल MFU की भविष्यवाणी करने में उच्च सटीकता प्राप्त करता है, जिससे प्रभावी फ्लीट-स्केल मॉनिटरिंग और दक्षता रिग्रेशन का पता लगाना सक्षम होता है।

मूल लेखक: Connor Pedersen, Dong H. Ahn, Michel Migdal, Collin Neale, Nik Konyuchenko

प्रकाशित 2026-05-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Connor Pedersen, Dong H. Ahn, Michel Migdal, Collin Neale, Nik Konyuchenko

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास डिलीवरी ट्रकों (GPUs) का एक विशाल बेड़ा है जिसे भारी कार्गो (AI गणनाओं) को देश भर में ले जाने के लिए तैनात किया जाना चाहिए। आप जानना चाहते हैं: क्या ये ट्रक वास्तव में चल रहे हैं, या वे सिर्फ ट्रैफिक में खड़े होकर आइडल (idle) हो रहे हैं?

लंबे समय तक, यह जांचना एक दुस्वप्न जैसा था। आपको हर एक ड्राइवर (सॉफ्टवेयर) से यह पूछना पड़ता था कि उन्होंने कितना कार्गो ले जाया, और उसका मैन्युअल लॉग रखना पड़ता था। लेकिन ड्राइवर व्यस्त होते हैं, वे भूल सकते हैं, या वे झूठ भी बोल सकते हैं कि उन्होंने कितना माल ढोया। इसके अलावा, यदि आप अगले साल एक नए प्रकार का ट्रक खरीदते हैं, तो आपको कार्गो गिनने के नियम फिर से लिखने होंगे।

यह पेपर इस जांच का एक नया, स्मार्ट तरीका पेश करता है: ओवरऑल FLOP यूटिलाइजेशन (OFU)।

यहाँ इसका सरल विवरण दिया गया है कि लेखकों ने क्या किया और यह क्यों महत्वपूर्ण है।

समस्या: "ड्राइवर का लॉग" टूटा हुआ है

वर्तमान में, बड़ी टेक कंपनियाँ दक्षता मापने के लिए AI सॉफ्टवेयर से अपने काम को गिनने के लिए कहती हैं।

  • दोष: सॉफ्टवेयर अक्सर गणित गलत कर देता है। वह सोच सकता है कि वह 100 बॉक्स ले जा रहा है जबकि वास्तव में वह केवल 50 ही ले जा रहा है।
  • परिणाम: लेखकों ने एक वास्तविक उदाहरण में पाया जहाँ एक ट्रेनिंग जॉब देखने में 54% कुशल (शानदार!) लग रही थी, लेकिन जब उन्होंने वास्तविक हार्डवेयर की जांच की, तो वह केवल 25% कुशल (बहुत खराब!) चल रही थी! सॉफ्टवेयर झूठ बोल रहा था क्योंकि वह उस नए, जटिल प्रकार के कार्गो को नहीं समझ पा रहा था जिसे वह ढो रहा था।

समाधान: "स्पीडोमीटर और इंजन लाइट"

ड्राइवर से यह पूछने के बजाय कि उसने क्या किया, लेखकों ने एक ऐसा सिस्टम बनाया जो सीधे ट्रक के डैशबोर्ड को देखता है। उन्होंने दो सरल संकेतों का उपयोग करके एक मेट्रिक बनाया जिसे OFU कहा जाता है, जो हर NVIDIA GPU पहले से ही रिपोर्ट करता है:

  1. टेन्सर पाइप एक्टिविटी (Tensor Pipe Activity): यह एक ऐसी लाइट की तरह है जो तब जलती है जब इंजन वास्तव में नंबरों की गणना (crunching numbers) कर रहा होता है।
  2. SM क्लॉक फ्रीक्वेंसी (SM Clock Frequency): यह स्पीडोमीटर है, जो बताता है कि इंजन कितनी तेजी से घूम रहा है।

"लाइट चालू होने" के समय को "इंजन की गति" से गुणा करके, उन्हें यह पता चल जाता है कि GPU कितनी मेहनत कर रहा है। इससे कोई फर्क नहीं पड़ता कि किस तरह का कार्गो (AI मॉडल) ढोया जा रहा है या ड्राइवर कौन सी भाषा बोल रहा है; हार्डवेयर बस जानता है कि वह काम कर रहा है या नहीं।

"छिपी हुई लागतें" (क्यों यह 100% परफेक्ट नहीं है)

लेखकों ने महसूस किया कि डैशबोर्ड को देखना भी कुछ अजीब चीजें पैदा कर सकता है, इसलिए उन्होंने उन्हें मैप करने के लिए हजारों परीक्षण किए:

  • "टाइल" की समस्या: कल्पना कीजिए कि आप एक डिब्बा पैक कर रहे हैं। यदि डिब्बा वस्तुओं के लिए थोड़ा बड़ा है, तो आपको खाली जगह को बबल रैप (पैडिंग) से भरना होगा। GPU भी ऐसा ही करता है। वह थोड़ा सा "बबल रैप" वाला गणित भी करता है जो वास्तव में AI में मदद नहीं करता। लेखकों ने पता लगाया कि यह अतिरिक्त गणित कितना जुड़ता है ताकि वे इसे कुल योग में से घटा सकें।
  • "स्पीडोमीटर ग्लिच": कभी-कभी स्पीडोमीटर झिलमिलाता है क्योंकि इंजन की गति तेजी से बदलती है। लेखकों ने पाया कि यदि आप गति की जांच पर्याप्त बार (हर कुछ सेकंड में) करते हैं, तो झिलमिलाहट औसत निकल जाती है और संख्या बहुत सटीक होती है।
  • "छोटे पुर्जों" की समस्या: GPU के पास एक मुख्य इंजन (Tensor Cores) और छोटे कार्यों के लिए एक छोटा साइड इंजन (CUDA cores) होता है। लेखकों ने पाया कि मुख्य इंजन 99.8% भारी काम करता है, इसलिए छोटे साइड इंजन को अनदेखा करने से परिणाम पर कोई खास फर्क नहीं पड़ता।

परिणाम: बग्स को पकड़ना

जब उन्होंने इस नए "डैशबोर्ड" तरीके का परीक्षण 608 वास्तविक दुनिया के AI ट्रेनिंग जॉब्स के खिलाफ किया, तो यह अविश्वसनीय रूप से प्रभावी रहा:

  • यह सच्चाई से मेल खाया: यह किए जा रहे वास्तविक काम के साथ मजबूती से जुड़ा रहा।
  • झूठ पकड़ा: इसने दो प्रमुख मामलों में पकड़ा जहाँ सॉफ्टवेयर काम को गलत गिन रहा था। एक मामला एक जटिल "मिक्सचर ऑफ एक्सपर्ट्स" (Mixture of Experts) मॉडल का था जहाँ सॉफ्टवेयर एक स्टेप को गिनना भूल गया था, जिससे काम वास्तव में जितना था उससे दोगुना कुशल दिख रहा था।
  • पैसे बचाए: रोबोट-ट्रेनिंग AI के एक मामले में, डैशबोर्ड ने दिखाया कि ट्रक आइडल (खाली) खड़े थे। टीम ने जांच की और पाया कि गलती से एक "डिबग मोड" चालू रह गया था, जो ट्रकों को लगातार रुकने और कागजी कार्रवाई चेक करने के लिए मजबूर कर रहा था। उन्होंने इसे बंद कर दिया, और दक्षता 2.5 गुना बढ़ गई।

निष्कर्ष (The Bottom Line)

लेखकों ने केवल एक नया गणितीय सूत्र नहीं बनाया; उन्होंने एक सार्वभौमिक, त्वरित और ईमानदार तरीका बनाया जिससे यह देखा जा सके कि आपके AI कंप्यूटर वास्तव में काम कर रहे हैं या नहीं।

  • कोई इंस्टॉलेशन आवश्यक नहीं: आपको AI कोड बदलने की आवश्यकता नहीं है।
  • हर जगह काम करता है: यह पुराने और नए दोनों GPUs पर काम करता है, और किसी भी प्रकार के AI मॉडल के साथ।
  • तत्काल दृश्यता: यह आपको तुरंत बताता है कि क्या कोई काम पैसा बर्बाद कर रहा है, जिससे टीमें लाखों का नुकसान होने से पहले उसे ठीक कर सकती हैं।

संक्षेप में, OFU आपके बेड़े के हर ट्रक में एक छेड़छाड़-मुक्त फ्यूल गेज लगाने जैसा है, ताकि आपको कभी भी अंदाज़ा न लगाना पड़े कि आपके ड्राइवर वास्तव में सामान पहुँचा रहे हैं या नहीं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →