← नवीनतम पेपर
🤖 machine learning

KForge: LLM-Driven Cross-Platform Kernel Generation for AI Accelerators

KForge एक क्रॉस-प्लेटफ़ॉर्म फ्रेमवर्क है जो दो सहयोगी LLM एजेंटों का लाभ उठाकर AI एक्सीलरेटरों के लिए उच्च-प्रदर्शन वाले कर्नेल को पुनरावृत्ति से उत्पन्न और परिष्कृत करता है, जिससे मौजूदा हैंड-ट्यून्ड और कंपाइलर-ऑप्टिमाइज़्ड बेसलाइनों की तुलना में NVIDIA B200 और Intel Arc B580 दोनों हार्डवेयर पर महत्वपूर्ण थ्रूपुट सुधार प्राप्त होता है।

मूल लेखक: Taras Sereda, Burak Bartan, Ankita Nayak, Tom St. John, Natalie Serrino, Zain Asgar

प्रकाशित 2026-06-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Taras Sereda, Burak Bartan, Ankita Nayak, Tom St. John, Natalie Serrino, Zain Asgar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, हाई-स्पीड डिलीवरी सर्विस चला रहे हैं। आपका बेड़ा केवल एक प्रकार के ट्रक का नहीं है; यह शहर की सड़कों के लिए छोटे स्कूटरों, राजमार्गों के लिए भारी-भरती सेमी-ट्रकों और इको-ज़ोन के लिए इलेक्ट्रिक वैन का मिश्रण है। प्रत्येक वाहन एक विशिष्ट कार्य के लिए उपयुक्त है, लेकिन वे सभी अलग-अलग भाषाएँ बोलते हैं और उनके इंजन के नियम भी अलग हैं।

आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, यह बिल्कुल वैसा ही है जैसा आज हो रहा है। AI सिस्टम "एजेंटिक" (agentic) होते जा रहे हैं, जिसका अर्थ है कि वे केवल एक प्रश्न का उत्तर नहीं देते; वे कार्यों को चरणों में तोड़ते हैं, टूल्स का उपयोग करते हैं, और अन्य AI एजेंटों के साथ समन्वय करते हैं। कुछ चरणों के लिए भारी गणित (जैसे एक सेमी-ट्रक) की आवश्यकता होती है, जबकि कुछ के लिए त्वरित, हल्के विचार (जैसे एक स्कूटर) की। पूरे सिस्टम को तेज़ बनाने के लिए, आपको प्रत्येक चरण को उस विशिष्ट कंप्यूटर चिप (एक्सेलेरेटर) पर चलाना होगा जो उसके लिए सबसे उपयुक्त हो।

समस्या: अनुवाद का दुःस्वप्न (The Translation Nightmare)
चुनौती यह है कि इन विभिन्न चिप्स के लिए "इंजन कोड" (जिसे कर्नेल कहा जाता है) लिखना अविश्वत रूप से कठिन है। यह एक फेरारी, एक ट्रैक्टर और एक मोटरसाइकिल के लिए एक साथ मैनुअल लिखने जैसा है, लेकिन मैनुअल अलग-अलग भाषाओं (CUDA, Metal, SYCL, आदि) में लिखे गए हैं।

  • पुराना तरीका: मानव विशेषज्ञ इस कोड को हाथ से लिखने और सुधारने में वर्षों बिताते हैं। यह धीमा, महंगा और स्केल करने में कठिन है।
  • नई समस्या: भले ही हम इस कोड को लिखने के लिए AI का उपयोग करने की कोशिश करें, यह अक्सर विफल हो जाता है। AI ऐसा कोड लिख सकता है जो दिखने में सही लगे लेकिन इंजन को क्रैश कर दे, या वह ऐसा कोड लिख सकता है जो NVIDIA चिप पर तो काम करे लेकिन Intel चिप पर पूरी तरह से विफल हो जाए।

समाधान: KForge (AI मैकेनिक टीम)
यह पेपर KForge को पेश करता है, जो एक नया सिस्टम है जो दो विशिष्ट AI मैकेनिकों की एक टीम के रूप में काम करता है जो इन इंजनों को स्वचालित रूप से ठीक करने और अनुकूलित करने के लिए मिलकर काम करते हैं।

एक AI द्वारा सब कुछ करने की कोशिश करने के बजाय, KForge काम को विभाजित करता है:

  1. द जनरेटर (बिल्डर): यह AI कोड लिखता है। यदि कोड क्रैश होता है या कंपाइल नहीं होता है, तो इसे एक "रेड लाइट" मिलती है और यह त्रुटियों को ठीक करते हुए फिर से प्रयास करता है।
  2. द एनालिस्ट (ट्यूनर): एक बार जब कोड काम करने लगता है, तो यह AI "डैशबोर्ड" (प्रोफाइलिंग डेटा) को देखता है। यह देखता है कि "यह इंजन ईंधन बर्बाद कर रहा है" या "पहिए बहुत तेज़ी से घूम रहे हैं।" यह बिल्डर को कोड को तेज़ बनाने के लिए विशिष्ट निर्देश देता है।

वे एक लूप में काम करते हैं: बिल्ड → टेस्ट → एनालाइज़ → ट्वीक → रिपीट। यह तब तक चलता रहता है जब तक कि कोड न केवल सही हो, बल्कि बिजली की तरह तेज़ भी हो।

परिणाम: दो अलग-अलग रेसें
लेखकों ने यह देखने के लिए कि KForge कितनी अच्छी तरह काम करता है, इसे दो बहुत अलग परिदृश्यों में परखा:

  • रेस 1: हेवीवेट चैंपियन (NVIDIA B200)
    यहाँ, KForge को NVIDIA इंजीनियरों द्वारा कई वर्षों में पूर्ण किया गया कोडबेस (TensorRT-LLM) के खिलाफ प्रतिस्पर्धा करनी थी। यह एक फॉर्मूला 1 टीम के पिट क्रू को हराने की कोशिश कर रहे एक नौसिखिया मैकेनिक जैसा था।

  • परिणाम: KForge ने 2.12% की गति वृद्धि निचोड़ ली। हाई-परफॉर्मेंस कंप्यूटिंग की दुनिया में, एक चैंपियन को 1% से भी अधिक से हराना एक बड़ी बात है। यह विश्व-रिकॉर्ड लैप टाइम से एक सेकंड के बहुत छोटे हिस्से को कम करने जैसा है।

  • रेस 2: नया ट्रैक (Intel Arc B580)
    यहाँ, जीतने के लिए कोई "चैंपियन" नहीं था। हार्डवेयर नया था, और कॉपी करने के लिए कोई मौजूदा हाई-परफॉर्मेंस कोड नहीं था। KForge को शून्य से इंजन बनाना था।

  • परिणाम: KForge ने इस चिप के लिए वर्तमान में उपलब्ध मानक, अन-ऑप्टिमाइज्ड कोड की तुलना में 5.13 गुना तेज़ कोड जेनरेट किया। इसने अनिवार्य रूप से एक नए, शक्तिशाली इंजन को वहां जीवन दिया जहां पहले केवल एक धीमा, बुनियादी इंजन था।

यह क्यों मायने रखता है
यह पेपर तर्क देता है कि जैसे-जैसे AI अधिक जटिल होता जा रहा है, हम हर नए चिप के लिए कोड मैन्युअल रूप से लिखने के लिए मनुष्यों पर निर्भर नहीं रह सकते। KForge दिखाता है कि एक AI टीम क्या कर सकती है:

  • विभिन्न हार्डवेयर ब्रांडों (NVIDIA, Intel, Apple, AMD) में कोड को ट्रांसलेट करना।
  • अपनी गलतियों को खुद ठीक करना।
  • तेज़ होने के लिए प्रदर्शन डेटा (performance data) से सीखना।

संक्षेप में, KForge एक ऐसा टूल है जो AI सिस्टम को किसी भी कंप्यूटर चिप पर कुशलतापूर्वक चलाने में मदद करता है, चाहे वह चिप एक अनुभवी दिग्गज हो या एक बिल्कुल नया मॉडल, निम्न-स्तरीय इंजन कोड लिखने के कठिन काम को स्वचालित करके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →