← नवीनतम पेपर
🤖 machine learning

KernelSkill: A Multi-Agent Framework for GPU Kernel Optimization

KernelSkill एक मल्टी-एजेंट फ्रेमवर्क है जो अपारदर्शी (opaque) LLM ह्यूरिस्टिक्स को विशेषज्ञ कौशलों के ज्ञान-संचालित, द्वि-स्तरीय मेमोरी आर्किटेक्चर से बदलकर GPU कर्नेल अनुकूलन को बढ़ाता है, जिससे KernelBench पर स्टेट-ऑफ-द-आर्ट स्पीडअप और 100% सफलता दर प्राप्त होती है।

मूल लेखक: Qitong Sun, Jun Han, Tianlin Li, Zhe Tang, Sheng Chen, Fei Yang, Aishan Liu, Xianglong Liu, Yang Liu

प्रकाशित 2026-03-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qitong Sun, Jun Han, Tianlin Li, Zhe Tang, Sheng Chen, Fei Yang, Aishan Liu, Xianglong Liu, Yang Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप दुनिया का सबसे कुशल, उच्च-गति वाला रेस कार इंजन बनाने की कोशिश कर रहे हैं। यह इंजन "GPU कर्नल" है, जो आपके कंप्यूटर के ग्राफिक्स कार्ड के उस छोटे से हिस्से का कोड है जो गेम खेलने या AI ट्रेनिंग जैसे भारी कामों को संभालने में मदद करता है।

दशकों से, इन इंजनों को बनाना एक आंखों पर पट्टी बांधकर फेरारी को ठीक करने जैसा रहा है। आपको एक विश्व स्तरीय विशेषज्ञ मैकेनिक की आवश्यकता होती है जो जानता हो कि किस पेचकस का उपयोग करना है, लेकिन उन्हें अंदाज़ा लगाना पड़ता है, परीक्षण करना पड़ता है, चीज़ों को खराब करना पड़ता है, फिर से ठीक करना पड़ता है और फिर से अंदाज़ा लगाना पड़ता है। यह धीमा, महंगा और मशीन की गहरी समझ रखने वाले जीनियस की मांग करता है।

हाल ही में, हमने उस मैकेनिक के रूप में AI (लार्ज लैंग्वेज मॉडल्स) का उपयोग करने की कोशिश की। AI स्मार्ट है और कोड लिख सकता है, लेकिन यह अक्सर एक ऐसे छात्र की तरह व्यवहार करता है जिसने केवल किताब पढ़ी है लेकिन कभी कार चलाई नहीं है। यह अपने "अंतर्ज्ञान" (implicit heuristics) के आधार पर रैंडम सुधार करने की कोशिश करता है, अक्सर एक ही गलती बार-बार करता है या गलत औज़ार चुन लेता है।

पेश है KernelSkill।

KernelSkill एक नया फ्रेमवर्क है जो AI मैकेनिक को एक विशेषज्ञ इंजीनियरों की मास्टर टीम में बदल देता है जिसके पास एक सुपर-ऑर्गनाइज्ड मेमोरी सिस्टम है। यह कैसे काम करता है, इसके कुछ उदाहरण यहाँ दिए गए हैं:

1. समस्या: "भुलक्कड़" मैकेनिक

कल्पना कीजिए कि एक AI मैकेनिक कार ठीक करने की कोशिश कर रहा है।

  • पुराना तरीका: मैकेनिक इंजन को देखता है, सुधार का अंदाज़ा लगाता है, उसे आज़माता है, और यदि वह विफल रहता है, तो वह फिर से अंदाज़ा लगाता है। उसे याद नहीं रहता कि उसने पाँच मिनट पहले "बोल्ट कसने" की कोशिश की थी, इसलिए वह इसे फिर से करता है। उसे यह भी याद नहीं रहता कि पिछले हफ्ते एक दूसरे कार पर "बोल्ट कसना" काम आया था। वह हर बार पहिए का पुनर्जन्म कर रहा है।
  • परिणाम: वे समय बर्बाद करते हैं, लूप में फंस जाते हैं, और कार कभी वास्तव में तेज़ नहीं हो पाती।

2. समाधान: "दो-स्तरीय मेमोरी" सिस्टम

KernelSkill AI को दो अलग-अलग प्रकार की मेमोरी के साथ एक अपग्रेड देता है, जैसे कि एक लाइब्रेरी और एक डेली लॉगबुक

📚 दीर्घकालिक स्मृति (Long-Term Memory): "विशेषज्ञ लाइब्रेरी"

इसे मानव विशेषज्ञों द्वारा लिखे गए सर्वश्रेष्ठ रिपेयर मैनुअल वाली एक विशाल, व्यवस्थित लाइब्रेरी के रूप में सोचें।

  • यह कैसे काम करता है: अंदाज़ा लगाने के बजाय, AI पहले "लाइब्रेरी" की जाँच करता है। यह विशिष्ट समस्या को खोजता है (जैसे, "खराब वायु प्रवाह के कारण इंजन ओवरहीट हो रहा है")।
  • जादू: यह केवल अंदाज़ा नहीं लगाता; यह एक सिद्ध रणनीति निकालता है: "जब आप X देखें, तो Y करें।" यह ज्ञान-संचालित (Knowledge-Driven) है। यह सुनिश्चित करता है कि AI रैंडम अनुमान के बजाय वास्तविक दुनिया के विशेषज्ञता के आधार पर सही उपकरण चुने।
  • उपमा: यह एक शेफ की तरह है जो केवल सूप चखकर यह अंदाज़ा नहीं लगाता कि क्या कम है; बल्कि वह एक मास्टर रेसिपी बुक देखता है जिसमें लिखा है, "यदि सूप नमकीन है, तो एसिड डालें, न कि और अधिक नमक।"

📝 अल्पकालिक स्मृति (Short-Term Memory): "डेली लॉगबुक"

इसे मैकेनिक के डैशबोर्ड पर एक स्टिकी नोट के रूप में सोचें जिस पर लिखा है, "मैंने स्पार्क प्लग बदलने की कोशिश की थी, और यह काम नहीं किया। अब यह दोबारा मत करना।"

  • यह कैसे काम करता है: जैसे-जैसे AI एक विशिष्ट कार (एक विशिष्ट कोड कार्य) पर काम करता है, वह उठाए गए हर कदम को लिखता जाता है। यदि वह कोई सुधार आज़माता है और वह विफल हो जाता है, तो लॉगबुक उसे रिकॉर्ड करती है।
  • जादू: यह AI को उस लूप में फंसने से रोकता है जहाँ वह बार-बार एक ही गलत सुधार करने की कोशिश करता रहता है। यह AI को मरम्मत प्रक्रिया की "बड़ी तस्वीर" देखने में भी मदद करता है, जिससे यह सुनिश्चित होता है कि एक हिस्से को ठीक करने से दूसरा हिस्सा खराब न हो जाए।
  • उपमा: यह एक जासूस की तरह है जो रहस्य सुलझा रहा है। वह हर सुराग और हर संदिग्ध को लिखता है जिसे वह पहले ही हटा चुका है। यह उसे उसी गलत रास्ते पर वापस जाने से रोकता है।

3. टीम: एक मल्टी-एजेंट वर्कफ़्लो

KernelSkill केवल एक AI नहीं है; यह विशेषज्ञों की एक टीम है जो मिलकर काम करती है, जैसे रेस ट्रैक पर एक पिट क्रू:

  • द जेनरेटर (The Generator): शुरुआती इंजन बनाता है (कोड लिखता है)।
  • द रिव्यूअर (The Reviewer): जाँचता है कि क्या इंजन बिना फटे चलता है (कंपाइलेशन) और क्या यह मूल इंजन की तरह ही चलता है (सटीकता)।
  • द प्रोफाइलर (The Profiler): यह देखने के लिए कार को टेस्ट ड्राइव पर ले जाता है कि वास्तव में कहाँ कमी है (परफॉरमेंस मेट्रिक्स)।
  • द प्लानर (The Planner): टेस्ट ड्राइव डेटा और "एक्सपर्ट लाइब्रेरी" को देखता है और सबसे अच्छा सुधार तय करता है।
  • द रिपेयरर (The Repairer): वास्तव में कोड में बदलाव करता है।

4. परिणाम: दुनिया की गति बढ़ाना

शोधकर्ताओं ने इस सिस्टम का परीक्षण KernelBench पर किया, जो इन इंजनों के लिए एक विशाल बाधा दौड़ (obstacle course) की तरह है।

  • सफलता दर: KernelSkill ने 100% स्कोर प्राप्त किया। इसने दी गई हर समस्या को ठीक कर दिया। अन्य AI सिस्टम कठिन स्तरों पर विफल रहे।
  • गति:
    • आसान कार्यों पर, इसने कोड को 5.4 गुना तेज़ बनाया।
    • मध्यम कार्यों पर, 2.8 गुना तेज़
    • कठिन कार्यों पर, 1.9 गुना तेज़
  • दक्षता: यह केवल तेज़ नहीं हुआ; यह तेज़ी से वहाँ पहुँचा। इसे सटीक समाधान खोजने के लिए कम प्रयास करने पड़े क्योंकि यह अंदाज़ा लगाने या गलतियाँ दोहराने में समय बर्बाद नहीं कर रहा था।

सारांश

KernelSkill एक अराजक, भुलक्कड़ प्रशिक्षु मैकेनिक को एक अत्यधिक संगठित, विशेषज्ञ-नेतृत्व वाली पिट क्रू में अपग्रेड करने जैसा है। AI को विशेषज्ञ ज्ञान की लाइब्रेरी (ताकि उसे पता हो कि क्या करना है) और एक डेली लॉगबुक (ताकि उसे याद रहे कि उसने पहले क्या आज़माया था) देकर, यह समय बर्बाद करना बंद करता है और बिजली जैसी तेज़ गति से परिणाम देने लगता है।

इसका मतलब है कि हम जो AI सिस्टम रोज़ाना उपयोग करते हैं—चाहे वह चैटबॉट्स हों या सेल्फ-ड्राइविंग कारें—वे बहुत अधिक कुशलता से चल सकते हैं, जिससे ऊर्जा और समय की बचत होती है, और यह सब मेमोरी को व्यवस्थित करने के एक स्मार्ट तरीके की बदौलत संभव हुआ है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →