← नवीनतम पेपर
🤖 machine learning

The Correctness Illusion in LLM-Generated GPU Kernels

यह शोध पत्र एक नियंत्रित सीडेड ट्रांसक्रिप्शन त्रुटियों के संग्रह के माध्यम से वर्तमान LLM-जनित GPU कर्नेल बेंचमार्क में "सत्यता के भ्रम" (correctness illusion) को उजागर करता है, जो मानक फिक्स्ड-शेप 'allclose' जांचों को पास कर लेते हैं, लेकिन विविध हार्डवेयर पर उच्च-परिशुद्धता वाले CPU संदर्भों का उपयोग करने वाले अधिक कठोर, स्कीमा-जागरूक फज़िंग ओरेकल द्वारा विश्वसनीय रूप से पकड़े जाते हैं।

मूल लेखक: Dipankar Sarkar

प्रकाशित 2026-06-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dipankar Sarkar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रेस कार के लिए उच्च-प्रदर्शन वाले इंजन (इन इंजनों को GPU कर्नल्स कहा जाता है) बनाने के लिए AI रोबोटों की एक टीम को काम पर रख रहे हैं। उन्हें दौड़ने देने से पहले, आपको यह सुनिश्चित करना होगा कि इंजन वास्तव में काम कर रहे हैं।

यह पेपर एक दोषपूर्ण परीक्षण (flawed test) के बारे में है जिसका उपयोग हर कोई इन इंजनों की जांच करने के लिए कर रहा है, और एक बेहतर परीक्षण के बारे में जो लेखकों ने उन गलतियों को पकड़ने के लिए बनाया है जिन्हें पुराना परीक्षण मिस कर गया था।

समस्या: "एक-आकार" का भ्रम (The "One-Shape" Illusion)

वर्तमान मानक परीक्षण (जो KernelBench जैसे बेंचमार्क द्वारा उपयोग किया जाता है) एक मैकेनिक की तरह है जो केवल एक इंजन की जांच एक विशिष्ट दूरी पर, एक विशिष्ट गति पर, और एक विशिष्ट दिन पर चलाकर करता है।

  • सेटअप: मैकेनिक ईंधन (इनपुट) का एक छोटा सा नमूना चुनता है, इंजन को एक निश्चित आकार (shape) पर सेट करता है, और यह जांचता है कि गति अपेक्षित गति के "काफी करीब" है या नहीं।
  • दोष: यदि इंजन में कोई छिपा हुआ दोष है जो केवल तब सामने आता है जब आप 10 मील के बजाय 100 मील चलते हैं, या जब ईंधन का प्रकार अलग होता है, तो मैकेनिक उसे कभी देख ही नहीं पाता। इंजन परीक्षण पास कर लेता है, लेकिन वह वास्तव में खराब होता है।
  • परिणाम: पेपर इसे "सत्यता का भ्रम" (Correctness Illusion) कहता है। परीक्षण कहता है कि AI-जनित कोड उत्तम है, लेकिन वास्तव में वह बग्स से भरा हुआ है जो बस उस एक विशिष्ट टेस्ट ड्राइव के दौरान छिप गए थे।

समाधान: "फज़िंग" जासूस (The "Fuzzing" Detective)

लेखकों ने एक नया परीक्षण सिस्टम बनाया है जिसे gpuemu कहा जाता है। एक बार ड्राइव लेने के बजाय, यह सिस्टम एक अराजक, अति-सतर्क जासूस की तरह काम करता है जो इंजन पर हर संभव परिदृश्य (scenario) थोप देता है।

  1. "फज़िंग" (अराजकता फैलाना): एक निश्चित आकार के बजाय, जासूस इंजन को अजीब, बहुत छोटे, बहुत बड़े और "एज-केस" (edge-case) आकारों के साथ आजमाता है। यह इंजन को एक ऊबड़-खाबड़ सड़क, एक खड़ी ढलान और एक फिसलन भरे ट्रैक पर एक साथ टेस्ट करने जैसा है।
  2. "उच्च-परिशुद्धता" वाला रेफरी: पुराने परीक्षण ने एक थोड़े धुंधले पैमाने (small errors की अनुमति देने वाला) का उपयोग किया था। नया परीक्षण एक लेजर-माप (laser-measure) का उपयोग करता है (एक उच्च-परिशुद्धता वाला कंप्यूटर जो डबल-प्रिसिजन गणित पर चलता है) यह देखने के लिए कि इंजन ने जो किया और जो उसे करना चाहिए था, उनके बीच का सटीक अंतर क्या है।
  3. "सीड" (Seed) रीप्ले: यदि जासूस को कोई बग मिलता है, तो वे उस सटीक "सीड" (इनपुट का विशिष्ट संयोजन) को सहेज लेते हैं जिसने क्रैश किया था। बाद में, कोई भी उस सटीक क्रैश को फिर से चलाकर (replay) साबित कर सकता है कि इंजन खराब है।

प्रयोग: "नकली" बग्स (The "Fake" Bugs)

अपनी बात को सिद्ध करने के लिए, लेखकों ने एक नियंत्रित लैब प्रयोग बनाया:

  • उन्होंने 24 इंजन बनाए।
  • 15 एकदम सही थे (कंट्रोल ग्रुप)।
  • 9 "खराब" थे (बग्गी ग्रुप)। ये रैंडम नहीं थे; वे बहुत विशिष्ट तरीकों से खराब थे जो अक्सर LLMs द्वारा की जाने वाली गलतियाँ हैं, जैसे 0.5 से गुणा करना भूल जाना, मास्क के लिए गलत नंबर का उपयोग करना, या वर्गमूल (square root) भूल जाना।

परिणाम:

  • पुराना परीक्षण (The "Allclose" Oracle): इसने 9 खराब इंजनों को देखा और कहा, "सब ठीक है! वे एकदम सही हैं।" इसने 100% बग्स को मिस कर दिया।
  • नया परीक्षण (The "Seeded" Oracle): इसने उन्हीं 9 खराब इंजनों को देखा और कहा, "रुको! ये खराब हैं।" इसने 100% बग्स को पकड़ा।
  • परफेक्ट इंजन: नए परीक्षण ने 15 परफेक्ट इंजनों के लिए सही ढंग से कहा "सब ठीक है"। इसने किसी भी अच्छे कोड पर गलत आरोप नहीं लगाया।

"क्रॉस-प्लेटफ़ॉर्म" जांच

लेखकों ने केवल एक कंप्यूटर पर इसका परीक्षण नहीं किया। उन्होंने एक ही परीक्षण को पाँच अलग-अलग प्रकार के शक्तिशाली ग्राफिक्स कार्डों पर चलाया (RTX 3060 जैसे कंज्यूमर कार्ड से लेकर H100 जैसे सुपर-कंप्यूटर कार्ड तक)।

फैसला: परिणाम सभी पाँच मशीनों पर समान थे। "खराब" इंजन हर जगह फेल हुए, और "परफेक्ट" इंजन हर जगह पास हुए। यह साबित करता है कि समस्या विशिष्ट कंप्यूटर की नहीं है; समस्या परीक्षण (test) की है

पकड़े गए दो प्रकार के बग्स

पेपर ने पाया कि पुराने परीक्षण ने दो मुख्य प्रकार की त्रुटियों को मिस किया:

  1. "कॉन्स्टेंट" (Constant) गलती: इंजन हमेशा थोड़ा सा गलत होता है (जैसे एक घड़ी जो हमेशा 5 मिनट पीछे रहती है)। पुराने परीक्षण के "ढीले पैमाने" ने इस त्रुटि को सोख लिया। नए परीक्षण के "लेजर" ने इसे तुरंत देख लिया।
  2. "एज केस" (Edge Case) गलती: इंजन बड़े नंबरों पर ठीक काम करता है लेकिन छोटे, अजीब नंबरों पर क्रैश हो जाता है (जैसे एक टेलगेट जो केवल तभी फंसता है जब कार ठीक 3 फीट लंबी हो)। पुराने परीक्षण ने कभी छोटे नंबरों को नहीं आजमाया। नए परीक्षण ने सब कुछ आजमाया, जिसमें अजीब आकार भी शामिल थे, और जाम को ढूंढ निकाला।

निष्कर्ष

पेपर निष्कर्ष निकालता है कि ग्राफिक्स कार्ड के लिए AI-जनित कोड वर्तमान में ऐसे परीक्षणों द्वारा प्रमाणित किया जा रहा है जो बहुत आसान हैं।

लेखक यह नहीं कह रहे हैं कि AI बेकार है; वे कह रहे हैं कि जिस पैमाने (ruler) से हम इसे माप रहे हैं वह टूटा हुआ है। अपने नए तरीके को अपनाकर—विभिन्न आकारों का परीक्षण करके और एक सख्त, उच्च-परिशुद्धता वाले पैमाने का उपयोग करके—हम अंततः उन बग्स को पकड़ सकते हैं जो वर्तमान में दरारों से निकल जा रहे हैं।

मुख्य बात: सिर्फ इसलिए कि एक AI-जनित इंजन एक त्वरित, एक-बार के परीक्षण में पास हो जाता है, इसका मतलब यह नहीं है कि वह सुरक्षित है। छिपी हुई दरारों को खोजने के लिए आपको अराजकता और सटीकता के साथ उसका स्ट्रैस-टेस्ट (stress-test) करना होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →