VeriScale: Adversarial Test-Suite Scaling for Verifiable Code Generation
यह शोध पत्र VeriScale को प्रस्तुत करता है, जो एक एडवर्सरियल फ्रेमवर्क (adversarial framework) है जो अधिक कठोर बेंचमार्क जैसे कि VerinaPlus और VerinaLite बनाने के लिए टेस्ट सूट्स का विस्तार और डिस्टिलेशन करता है, जो अत्याधुनिक LLMs की कोड जनरेशन और स्पेसिफिकेशन क्षमताओं में महत्वपूर्ण कमजोरियों को उजागर करते हैं जिन्हें मौजूदा बेंचमार्क पकड़ने में विफल रहते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जटिल भोजन पकाने के लिए एक रोबोट शेफ को काम पर रख रहे हैं। आप रोबोट को एक रेसिपी (एक "विशिष्टता" या specification) देते हैं और उसे वह व्यंजन पकाने के लिए कहते हैं (यह "कोड" है)। यह देखने के लिए कि रोबोट कितना अच्छा है, आप भोजन का स्वाद लेते हैं।
समस्या: "आसान क्विज़" का जाल
वर्तमान में, जो परीक्षण हम इन AI शेफ की जांच करने के लिए उपयोग करते हैं, वे एक बहुत ही आसान क्विज़ की तरह हैं। हम उन्हें केवल कुछ साधारण सामग्रियां (जैसे "नमक" और "पानी") देते हैं और एक सरल परिणाम ("सूप") मांगते हैं। यदि रोबोट सूप बनाता है, तो हम उसे A+ दे देते हैं।
लेकिन यहाँ एक पेंच है: रोबोट धोखाधड़ी कर सकता है। वह "नमक + पानी = सूप" को याद कर सकता है, लेकिन अगर आप उसे कोई अजीब सामग्री जैसे "टूथपेस्ट" देते हैं, तो वह अभी भी सूप बनाने की कोशिश कर सकता है और दावा कर सकता है कि यह सही है। या, वह एक ऐसी रेसिपी लिख सकता है जिसमें लिखा हो "नमक डालें," लेकिन वह यह लिखना भूल जाए कि "ज़हर न डालें।" क्योंकि परीक्षण में "टूथपेस्ट" या "ज़हर" शामिल नहीं था, इसलिए रोबोट पास हो जाता है, भले ही वह खतरनाक या दोषपूर्ण हो।
लेख का तर्क है कि वर्तमान परीक्षण बहुत छोटे और बहुत आसान हैं, जो AI को वास्तव में जितना बुद्धिमान है, उससे कहीं अधिक स्मार्ट दिखाते हैं।
समाधान: VeriScale (एक "स्ट्रेस टेस्ट" फ्रेमवर्क)
लेखकों ने एक नया सिस्टम बनाया है जिसे VeriScale कहा जाता है। इसे AI कोड के लिए एक "स्ट्रेस टेस्ट" या "रेड टीम" अभ्यास के रूप में समझें। केवल AI को सूप पकाने के लिए कहने के बजाय, VeriScale AI को विफल होने के लिए फंसाने की कोशिश करता है।
यह दो मुख्य चरणों में काम करता है:
चरण 1: "बाधा दौड़" (विस्तार/Expansion)
सबसे पहले, VeriScale सामग्रियों का एक विशाल, अराजक बाधा पथ (obstacle course) बनाता है।
- बीज (The Seed): यह सामान्य सामग्रियों से शुरू होता है।
- उत्परिवर्तन (The Mutation): यह इन सामग्रियों को बदलने और घुमाने के लिए एक "म्यूटेशन मशीन" का उपयोग करता है। यह एक कप पानी को बर्फ की बाल्टी में बदल देता है, या नमक की एक चुटकी को नमक के पहाड़ में। यह अजीब, 'एज-केस' परिदृश्य बनाता है जिन्हें AI ने पहले कभी नहीं देखा है।
- "धूर्त" शेफ (Adversarial Synthesis): यह सबसे चतुर हिस्सा है। VeriScale एक दूसरे, बहुत बुद्धिमान AI को "धूर्त" (Trickster) के रूप में कार्य करने के लिए कहता है। यह धूर्त एक नकली रेसिपी लिखने की कोशिश करता है जो दिखने में नियमों का पालन करती हुई लगती है, लेकिन वास्तव में कचरा पैदा करती है।
- उदाहरण: यदि नियम है "सूप गर्म होना चाहिए," तो धूर्त एक ऐसी रेसिपी लिख सकता है जिसका आउटपुट "आइसक्रीम" हो लेकिन वह दावा करे, "तकनीकी रूप से, आइसक्रीम एक खाद्य पदार्थ है, इसलिए मैंने नियम का पालन किया!"
- VeriScale इन धूर्त रेसिपीज़ को AI के नियमों के विरुद्ध चलाता है। यदि AI के नियम आइसक्रीम को "गर्म सूप" के रूप में स्वीकार कर लेते हैं, तो VeriScale उस खामी को पकड़ लेता है। यह ऐसे "पकड़ने वाले" (gotcha) क्षणों की एक विशाल सूची तैयार करता है।
चरण 2: "अनिवार्य चेकलिस्ट" (न्यूनीकरण/Reduction)
अब, VeriScale के पास हजारों ऐसे ट्रिकी टेस्ट केस हैं। इन सभी को हर AI पर चलाना बहुत समय लेगा और बहुत महंगा होगा। इसलिए, यह एक "रिडक्शन" (न्यूनीकरण) करता है।
- यह पूछता है: "इन 1,000 ट्रिक्स में से कौन सी सबसे महत्वपूर्ण हैं?"
- यह उन विशिष्ट ट्रिक्स को रखता है जो सबसे अधिक गलतियों को पकड़ते हैं और उन्हें फेंक देता है जो केवल दोहराव हैं।
- परिणाम एक कॉम्पैक्ट, सुपर-चैलेंजिंग टेस्ट है जो इतना छोटा है कि इसे तेज़ी से चलाया जा जा सके, लेकिन फिर भी यह हर उस खामी को पकड़ लेता है जिसे विशाल सूची ने पाया होता।
परिणाम: "सत्य का सीरम" (The Truth Serum)
लेखकों ने इस नए सिस्टम का परीक्षण उपलब्ध सर्वोत्तम AI मॉडल्स (जैसे GPT-5.5 और अन्य) पर किया।
- पुराना टेस्ट: AI का स्कोर 96% या 98% जैसा था। वे जीनियस दिख रहे थे।
- VeriScale टेस्ट: जब स्ट्रेस टेस्ट के दौर से गुजरा, तो स्कोर नाटकीय रूप से गिर गया। एक शीर्ष मॉडल का स्कोर कोडिंग के लिए 96% से गिरकर 86% हो गया, और नियम (विशिष्टीकरण) लिखने के लिए 68% से गिरकर 44% रह गया।
बड़ी सीख
लेख यह दर्शाता है कि पुराने परीक्षण हमें झूठ बोल रहे थे। वे इस बात को बढ़ा-चढ़ाकर बता रहे थे कि AI सुरक्षित, सही कोड लिखने में कितना अच्छा है। नया "VeriScale" परीक्षण प्रकट करता है कि हालांकि AI ऐसा कोड लिखने में महान है जो सही दिखता है, लेकिन यह नियम लिखने में अभी भी बहुत खराब है जो हर संभावित गलती को पकड़ सके।
उन्होंने इस नए टेस्ट के दो संस्करण भी जारी किए हैं:
- VERINAPLUS: विशाल, पूर्ण-पैमाने का स्ट्रेस टेस्ट (मूल से 83 गुना बड़ा)।
- VERINALITE: "लाइट" संस्करण। यह मूल से 14 गुना बड़ा है लेकिन तेज़ और सस्ता होने के लिए "रिडक्शन" ट्रिक का उपयोग करता है, फिर भी उन्हीं गलतियों को पकड़ता है जिन्हें विशाल सूची ने पकड़ा होता।
संक्षेप में: VeriScale एक ऐसा उपकरण है जो हमें उस AI द्वारा मूर्ख बनाए जाने से रोकता है जो केवल आसान परीक्षणों को पास करना जानता है। यह AI को यह साबित करने के लिए मजबूर करता है कि वह अजीब, अस्त-व्यस्त और कठिन वास्तविक दुनिया को संभाल सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।