← नवीनतम पेपर
🤖 machine learning

CuTeGen: An LLM-Based Agentic Framework for Generation and Optimization of High-Performance GPU Kernels using CuTe

CuTeGen एक LLM-आधारित एजेंटिक फ्रेमवर्क है जो मैट्रिक्स गुणन और एक्टिवेशन वर्कलोड में प्रतिस्पर्धी प्रदर्शन और शुद्धता प्राप्त करने के लिए CuTe एब्स्ट्रैक्शन लेयर का उपयोग करते हुए, उच्च-प्रदर्शन वाले GPU कर्नेल्स के जनरेशन और पुनरावृत्ति अनुकूलन को एक संरचित जनरेट-टेस्ट-रिफाइन वर्कफ़्लो के माध्यम से स्वचालित करता है।

मूल लेखक: Tara Saba, Anne Ouyang, Xujie Si, Fan Long

प्रकाशित 2026-04-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tara Saba, Anne Ouyang, Xujie Si, Fan Long

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बेहतरीन, विश्व-स्तरीय सुफ़ले (soufflé) बनाने की कोशिश कर रहे हैं। आपके पास एक रेसिपी (एल्गोरिदम) है, लेकिन परिणाम पूरी तरह से इस बात पर निर्भर करता है कि आप इसे कैसे पकाते हैं: ओवन का तापमान, दरवाजा खोलने का समय, और आप किस प्रकार के पैन का उपयोग करते हैं।

कंप्यूटर की दुनिया में, GPU कर्नल्स (kernels) वे सुफ़ले हैं। वे छोटे, अत्यंत तेज़ प्रोग्राम हैं जो AI चैटबॉट्स से लेकर वीडियो गेम्स तक सब कुछ संचालित करते हैं। उन्हें तेज़ बनाना अविश्वसनीय रूप से कठिन है; आमतौर पर, इसमें एक मानव विशेषज्ञ शेफ (कंप्यूटर वैज्ञानिक) को सही करने के लिए वर्षों के परीक्षण और त्रुटि (trial and error) की आवश्यकता होती है।

CuTeGen एक नया सिस्टम है जो इन सुफ़ले को स्वचालित रूप से पकाने के लिए एक AI शेफ (एक लार्ज लैंग्वेज मॉडल) का उपयोग करता है। लेकिन केवल अनुमान लगाने के बजाय, यह सुनिश्चित करने के लिए एक स्मार्ट, चरण-दर-चरण विधि का उपयोग करता है कि परिणाम स्वादिष्ट (सही) और तेज़ दोनों हो।

यहाँ बताया गया है कि CuTeGen कैसे काम करता है, जिसे सरल उपमाओं (analogies) के माध्यम से विभाजित किया गया है:

1. समस्या: "वन-शॉट" (One-Shot) की गलती

AI का उपयोग करके इन प्रोग्रामों को लिखने के पिछले प्रयास एक शेफ से "सुफ़ले बनाओ" कहने और इस उम्मीद करने जैसे थे कि वह पहली बार में ही इसे सही बना लेगा।

  • समस्या: यदि AI पहली कोशिश में गलत अनुमान लगाता है, तो सुफ़ले ढह जाता है। यदि आप उसे पूरी रेसिपी को फिर से शुरू से लिखने के लिए "ठीक करने" को कहते हैं, तो वह अक्सर उन हिस्सों को भी बिगाड़ देता है जो पहले से ही काम कर रहे थे।
  • परिणाम: AI ऐसा कोड बनाता है जो या तो क्रैश हो जाता है या इतना धीमा चलता है कि वह उपयोगी न रहे।

2. समाधान: "इटरेटिव रिफाइनमेंट" (Iterative Refinement) लूप

CuTeGen खेल बदल देता है। एक वन-शॉट अनुमान के बजाय, यह कर्नेल निर्माण को एक संरचित कार्यशाला (structured workshop) के रूप में मानता है।

  • चरण 1: पकाएं और चखें (परीक्षण): AI एक कर्नेल लिखता है। सिस्टम इसे चलाता है। क्या यह क्रैश हुआ? क्या इसने गलत उत्तर दिया?
  • चरण 2: निदान (डिबगिंग): यदि यह विफल हो जाता है, तो सिस्टम केवल "फिर से प्रयास करें" नहीं कहता। यह एक सख्त 'सॉस-शेफ' (sous-chef) की तरह कार्य करता है। यह AI को बिल्कुल सटीक बताता है कि क्या गलत हुआ (जैसे, "आप ओवन का दरवाजा बंद करना भूल गए," या "आपने गलत पैन का आकार इस्तेमाल किया")।
  • चरण 3: पैच (मरम्मत): AI को केवल उस विशिष्ट गलती को ठीक करने के लिए मजबूर किया जाता है, न कि पूरी रेसिपी को फिर से लिखने के लिए। यह कोड के अच्छे हिस्सों को सुरक्षित रखते हुए खराब हिस्सों को ठीक करता है।

3. गुप्त सामग्री: "CuTe" (ब्लूप्रिंट)

यह सबसे महत्वपूर्ण हिस्सा है। अधिकांश AI कच्चे, अव्यवस्थित निर्देशों में कोड लिखने की कोशिश करते हैं (जैसे कि एक ऐसी भाषा में रेसिपी लिखना जो फ्रेंच, स्पेनिश और गणितीय प्रतीकों को मिला देती है)।

  • CuTeGen की तरकीब: यह AI को CuTe का उपयोग करके कोड लिखने के लिए मजबूर करता है, जो उच्च-प्रदर्शन वाली कुकिंग के लिए डिज़ाइन किया गया एक विशेष "ब्लूप्रिंट" (खाका) भाषा है।
  • उपमा: कल्पना कीजिए कि CuTe विशेष रूप से तेज़ इंजन बनाने के लिए डिज़ाइन किए गए लेगो (Lego) सेट की तरह है। लकड़ी के ब्लॉक से इंजन तराशने (कच्चा कोड) के बजाय, AI पहले से बने, उच्च-प्रदर्शन वाले लेगो ईंटों (टाइलिंग, मेमोरी लेआउट, डेटा मूवमेंट) को आपस में जोड़ता है।
  • यह क्यों मदद करता है: क्योंकि लेगो के टुकड़े पहले से ही इस तरह डिज़ाइन किए गए हैं कि वे पूरी तरह से फिट हो सकें, इसलिए AI के एक डगमगाते टॉवर बनाने की संभावना कम होती है। यह AI को स्वचालित रूप से "फास्ट लेन" की ओर निर्देशित करता है।

4. "डिलेड फीडबैक" (Delayed Feedback) रणनीति

जब आप कार के इंजन को ट्यून करते हैं, तो आप चाबी घुमाते ही तुरंत स्पीडोमीटर नहीं देखते। पहले आप यह सुनिश्चित करते हैं कि इंजन चल रहा है, फिर आप कार्बोरेटर को एडजस्ट करते हैं, और उसके बाद आप गति देखते हैं।

  • गलती: यदि आप AI को बहुत जल्दी स्पीडोमीटर (प्रोफाइलिंग डेटा) दिखाते हैं, तो वह सूक्ष्म बदलावों (जैसे कि एक पेंच को 0.1 मिमी घुमाना) के प्रति जुनूनी हो जाता है, इससे पहले कि इंजन ठीक से बन भी जाए। यह एक "लोकल ऑप्टिमम" (local optimum) में फंस जाता है—एक छोटी पहाड़ी जो पहाड़ जैसी दिखती है लेकिन वास्तव में नहीं है।
  • CuTeGen का कदम: यह डिलेड प्रोफाइलिंग का उपयोग करता है।
    • चरण 1: बिना गति देखे संरचना बनाने और त्रुटियों को ठीक करने के लिए AI को छोड़ दें।
    • चरण 2: एक बार जब कोड ठोस और सही हो जाता है, तब सिस्टम कहता है, "ठीक है, अब अधिकतम गति के लिए इंजन को ट्यून करने के लिए स्पीडोमीटर को देखते हैं।"
  • परिणाम: CuTeGen पहले एक बेहतर आधार बनाता है, जिससे अंततः बहुत तेज़ उत्पाद प्राप्त होता है।

5. परिणाम: एक नया मानक

शोधकर्ताओं ने 26 अलग-अलग "रेसिपी" (मैट्रिक्स मल्टीप्लिकेशन और एक्टिवेशन फंक्शन) पर CuTeGen का परीक्षण किया।

  • परिणाम: AI-जनित कर्नेल न केवल "ठीक" थे। वे मानव विशेषज्ञों के प्रतिस्पर्धी थे।
  • मुख्य आकर्षण: कुछ कार्यों के लिए, CuTeGen PyTorch (एक लोकप्रिय AI टूल) में उपयोग किए जाने वाले मानक कोड की तुलना में 1.7 गुना तेज़ था। दो विशिष्ट मामलों में, इसने उद्योग-मानक लाइब्रेरी (cuBLAS) को भी पीछे छोड़ दिया, जिसे मनुष्यों द्वारा एक दशक से अधिक समय तक परिष्कृत किया गया है।

सारांश

CuTeGen एक समझदार, धैर्यवान प्रशिक्षु (apprentice) की तरह है जो:

  1. शुरुआत से ही चीजों को सही ढंग से बनाने के लिए एक विशेष टूलकिट (CuTe) का उपयोग करता है।
  2. पूरी प्रक्रिया को फिर से शुरू करने के बजाय, गलतियों को एक-एक करके परीक्षण और ठीक करता है।
  3. इंजन बनने तक स्पीडोमीटर देखने के लिए प्रतीक्षा करता है, ताकि वह बहुत जल्दी छोटी-छोटी बारीकियों में विचलित न हो जाए।

यह साबित करता है कि हमें हर सिंगल GPU ऑप्टिमाइज़ेशन को हाथ से कोड करने के लिए मनुष्यों के इंतजार करने की आवश्यकता नहीं है। सही ढांचे के साथ, AI उच्च-प्रदर्शन कंप्यूटिंग का मास्टर शेफ बनना सीख सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →