← नवीनतम पेपर
💬 NLP

AdaExplore: Failure-Driven Adaptation and Diversity-Preserving Search for Efficient Kernel Generation

AdaExplore एक नवीन एजेंट फ्रेमवर्क है जो ट्राइटन (Triton) जैसे डोमेन-विशिष्ट भाषाओं के लिए LLM-संचालित कर्नेल कोड जनरेशन को बेहतर बनाने के लिए पुन: प्रयोज्य वैधता नियमों (validity rules) के निर्माण हेतु विफलता-संचालित अनुकूलन (failure-driven adaptation) को विविधता-संरक्षण खोज (diversity-preserving search) के साथ जोड़ता है, जिससे बिना किसी अतिरिक्त फाइन-ट्यूनिंग के महत्वपूर्ण गति वृद्धि प्राप्त होती है।

मूल लेखक: Weihua Du, Jingming Zhuo, Yixin Dong, Andre Wang He, Weiwei Sun, Zeyu Zheng, Manupa Karunaratne, Ivan Fox, Tim Dettmers, Tianqi Chen, Yiming Yang, Sean Welleck

प्रकाशित 2026-04-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Weihua Du, Jingming Zhuo, Yixin Dong, Andre Wang He, Weiwei Sun, Zeyu Zheng, Manupa Karunaratne, Ivan Fox, Tim Dettmers, Tianqi Chen, Yiming Yang, Sean Welleck

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े अनुभवहीन प्रशिक्षु (apprentice) को एक सुपर-फास्ट रोबोट (एक GPU) के लिए भारी बक्से हिलाने के सबसे कुशल निर्देश लिखने के बारे में सिखाने की कोशिश कर रहे हैं। इसे कंप्यूटर वैज्ञानिक GPU Kernel Optimization कहते हैं।

समस्या यह है कि रोबोट बहुत नखरेबाज है। यदि निर्देशों में एक छोटी सी भी टाइपिंग की गलती होती है, तो रोबोट क्रैश हो जाता है। यदि निर्देश सही हैं लेकिन पूरी तरह से व्यवस्थित नहीं हैं, तो रोबोट धीरे काम करता है।

यह शोध पत्र AdaExplore नामक एक नई प्रणाली पेश करता है जो इस AI प्रशिक्षु को बिना अपने मस्तिष्क को फिर से लिखे (जिसे "fine-tuning" कहा जाता है) इस कार्य में महारत हासिल करने में मदद करती है। इसके बजाय, AdaExplore एक चतुर दो-चरणीय रणनीति का उपयोग करता है: गलतियों से सीखना (Learning from Mistakes) और अलग-अलग रास्तों की खोज करना (Exploring Different Paths)

यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

दो बड़ी समस्याएँ

  1. "क्रैश" की दीवार (The "Crash" Wall): अधिकांश समय, AI निर्देश लिखने की कोशिश करता है, और वे गलत होते हैं। यह एक घर बनाने की कोशिश करने जैसा है जहाँ आपके 90% प्रयासों में छत तुरंत गिर जाती है क्योंकि आपने गलत प्रकार के कील का उपयोग किया था।
  2. "लोकल ऑप्टिमम" का जाल (The "Local Optimum" Trap): कभी-कभी, AI ऐसे निर्देश लिखता है जो काम तो करते हैं, लेकिन वे केवल "ठीक-ठाक" होते हैं। वह "काफी अच्छे" के एक छोटे से गड्ढे में फंस जाता है और "परफेक्ट" के शिखर को नहीं देख पाता क्योंकि वह बड़े बदलाव करने से डरता है। वह एक हीरे को खोजने के बजाय उसी छोटे कंकड़ को बार-बार पॉलिश करता रहता है।

समाधान: AdaExplore

AdaExplore इन समस्याओं को दो अलग-अलग चरणों के साथ हल करता है, जैसे एक मास्टर शिल्पकार एक प्रशिक्षु को प्रशिक्षित करता है।

चरण 1: "गलतियों की डायरी" (अनुकूलन - Adaptation)

AI को अपनी विफलताओं को भूलने देने के बजाय, AdaExplore उसे एक गलतियों की डायरी (Mistake Diary) रखने के लिए मजबूर करता है।

  • यह कैसे काम करता है: AI को अभ्यास के लिए कुछ समस्याएं (synthesized tasks) दी जाती हैं। जब वह विफल होता है, तो सिस्टम केवल यह नहीं कहता कि "गलत"। बल्कि यह विश्लेषण करता है कि वह क्यों विफल हुआ।
  • उपमा: कल्पना कीजिए कि एक प्रशिक्षु एक मेज बनाने की कोशिश करता है और मेज का पैर इसलिए गिर जाता है क्योंकि उसने बोल्ट के बजाय पेंच (screw) का उपयोग किया था। सिस्टम डायरी में लिखता है: "नियम #1: मेज के पैरों के लिए पेंचों का उपयोग कभी न करें।"
  • परिणाम: AI अगला कार्य शुरू करने से पहले इस डायरी को पढ़ता है। यह "स्वर्ण नियमों" (जैसे "X न करें," "हमेशा Y करें") का एक सेट सीखता है जो क्रैश होने से बचाते हैं। इसे विफलता-संचालित अनुकूलन (Failure-Driven Adaptation) कहा जाता है। यह त्रुटियों के अराजक ढेर को सुरक्षा नियमों की एक साफ सूची में बदल देता है।

चरण 2: "संभावनाओं का पेड़" (अन्वेषण - Exploration)

एक बार जब AI को एक स्थिर मेज बनाना आ जाता है (वह क्रैश नहीं होता), तो उसे एक सबसे तेज़ मेज बनाने की आवश्यकता होती है। यहीं पर विविधता-संरक्षण खोज (Diversity-Preserving Search) काम आती है।

  • सामान्य AI के साथ समस्या: आमतौर पर, एक AI एक ही कोड में बार-बार छोटे बदलाव करके किसी समस्या को ठीक करने की कोशिश करता है। यह एक टूटे हुए कार इंजन को ठीक करने के लिए बार-बार एक ही विशिष्ट बोल्ट को कसने जैसा है। आप इसे थोड़ा बेहतर बना सकते हैं, लेकिन आपको कभी एहसास नहीं होगा कि आपको पूरे इंजन को बदलने की आवश्यकता है।
  • AdaExplore का दृष्टिकोण: निर्देशों की एक लंबी रेखा बनाने के बजाय, AdaExplore एक पेड़ (Tree) उगाता है।
    • छोटे कदम (Pruning): कभी-कभी, यह वर्तमान कोड में छोटे, सावधानीपूर्वक समायोजन करता है (जैसे बोल्ट कसना)।
    • बड़े कदम (Branching): कभी-कभी, यह कहता है, "यह रास्ता अटक गया है," और एक नया पेड़ की शाखा उगाता है जहाँ यह एक अलग डिज़ाइन का उपयोग करके पूरी संरचना को फिर से लिखता है।
  • उपमा: कल्पना कीजिए कि आप एक गंतव्य तक पहुँचने के लिए सबसे अच्छा रास्ता खोज रहे हैं।
    • सामान्य AI: एक सड़क पर चलता है, ट्रैफिक जाम में फंसता है, वापस मुड़ता है, और उसके बगल वाली अगली गली को आज़माता है। वह उसी मोहल्ले में रहता है।
    • AdaExplore: एक साथ पांच अलग-अलग मोहल्लों में स्काउट्स भेजता है। यदि एक मोहल्ला बंद रास्ता है, तो वह हार नहीं मानता; वह अन्य चार रास्तों को जीवित रखता है। वह कभी-कभी पूरी तरह से दूसरे शहर में कूद जाता है (एक "बड़ा कदम") यह देखने के लिए कि क्या वहां कोई हाईवे है।

परिणाम: यह क्यों मायने रखता है

इस शोध पत्र का परीक्षण KernelBench पर किया गया, जो ग्राफिक्स कार्ड के लिए कोड लिखने का एक कठिन परीक्षण है।

  • AdaExplore के बिना: AI धीमा है, अक्सर क्रैश होता है, और "ठीक-ठाक" समाधानों में फंस जाता है।
  • AdaExplore के साथ:
    • यह क्रैश होना बंद कर देता है (हर बार जब यह एक काम करने वाला समाधान ढूंढता है, तो यह 100% सफल होता है)।
    • यह बहुत तेज़ हो जाता है। सबसे कठिन परीक्षणों पर, AI मानक बेसलाइन की तुलना में 3.12 गुना तेज़ हो गया।
    • यह बेहतर होता जाता है (अन्य तरीकों के विपरीत जो कुछ समय बाद सुधार करना बंद कर देते हैं)।

सारांश

AdaExplore को एक AI कोडर के लिए एक स्मार्ट कोच के रूप में समझें।

  1. कोच सामान्य गलतियों की एक नोटबुक रखता है ताकि छात्र उन्हें दोहराए नहीं (अनुकूलन)।
  2. कोच छात्र को पूरी तरह से अलग दृष्टिकोण आज़माने के लिए प्रोत्साहित करता है यदि वह अटक जाता है, बजाय इसके कि वह केवल एक ही विचार को थोड़ा बहुत बदलता रहे (अन्वेषण)।

इन दोनों को मिलाकर, AI विशेष हार्डवेयर के लिए उच्च-प्रदर्शन वाला कोड लिख सकता है, जिसके लिए उसे शुरू से फिर से प्रशिक्षित करने की आवश्यकता नहीं होती है, जो इसे कंप्यूटिंग के भविष्य के लिए एक शक्तिशाली उपकरण बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →