VeruSAGE: A Study of Agent-Based Verification for Rust Systems
यह शोधपत्र VeruSAGE-Bench को प्रस्तुत करता है, जो आठ ओपन-सोर्स Verus-वेरिफाइड Rust सिस्टम से 849 प्रूफ कार्यों का एक नया बेंचमार्क है, और यह प्रदर्शित करता है कि अनुकूलित LLM-एजेंट संयोजन इन कार्यों में से 80% से अधिक और अधूरे सिस्टम प्रूफ के 90% से अधिक को सफलतापूर्वक हल कर सकते हैं, जो सिस्टम सॉफ्टवेयर के लिए AI-सहायता प्राप्त सत्यापन की महत्वपूर्ण क्षमता को उजागर करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, उच्च गति वाली ट्रेन प्रणाली (जैसे कंप्यूटर का ऑपरेटिंग सिस्टम) बना रहे हैं। आप 100% सुनिश्चित होना चाहते हैं कि ब्रेक हमेशा काम करेंगे और ट्रेन कभी पटरी से नहीं उतरेगी।
पुराने दिनों में, आप हर बोल्ट और गियर के लिए गणितीय "प्रमाण" (proof) लिखने के लिए सुपर-स्मार्ट, सतर्क इंजीनियरों की एक टीम को काम पर रखते थे। इसे फॉर्मल वेरिफिकेशन (Formal Verification) कहा जाता है। यह अविश्वसनीय रूप से सुरक्षित है, लेकिन यह धीमा, महंगा है और इसे पढ़ने के लिए गणित में पीएचडी की आवश्यकता होती है।
फिर, आर्टिफिशियल इंटेलिजेंस (LLMs) आ गया। ये एआई बहुत तेज़, रचनात्मक इंटर्न की तरह हैं। वे सेकंडों में कोड लिख सकते हैं। लेकिन एक पेंच है। वे आत्मविश्वासी तो हैं लेकिन अक्सर गलत होते हैं। वे एक ऐसी ट्रेन बना सकते हैं जो दिखने में तो शानदार है लेकिन जिसमें ब्रेक ही नहीं हैं।
बड़ा सवाल: क्या हम एआई इंटर्न की गति को सतर्क इंजीनियर की सुरक्षा के साथ जोड़ सकते हैं? क्या एक एआई कोड को सुरक्षित रखने की गारंटी देने के लिए "गणितीय प्रमाण" लिख सकता है?
यह पेपर, VeruSAGE, कहता है: "हाँ, लेकिन यह इस पर निर्भर करता है कि आप एआई को कैसे प्रबंधित करते हैं।"
यहाँ उनकी खोज का विवरण दिया गया है, कुछ रोजमर्रा के उपमाओं (analogies) का उपयोग करते हुए:
1. समस्या: छोटे पहेलियाँ बनाम विशाल भूलभुलैया
पिछले अध्ययनों में एआई को छोटी गणितीय पहेलियाँ हल करने के लिए कहा गया (जैसे "एक सूची में बीच की संख्या खोजें")। एआई इनमें बहुत अच्छा था।
लेकिन वास्तविक दुनिया की प्रणालियाँ (जैसे ऑपरेटिंग सिस्टम) विशाल, उलझी हुई भूलभुलैया की तरह हैं। उनमें हजारों चलते हुए पुर्जे, जटिल नियम होते हैं, और कोई सरल "बीच की संख्या" नहीं होती।
- निष्कर्ष: जब शोधकर्ताओं ने इन विशाल भूलभुलैया पर एआई का परीक्षण किया, तो पुराने तरीके बुरी तरह विफल रहे। एआई तुरंत रास्ता भटक गया।
2. समाधान: दो अलग-अलग प्रबंधन शैलियाँ
शोधकर्ताओं ने चार अलग-अलग "सुपर-इंटेलिजेंट" एआई मॉडल (जैसे GPT और Claude के नवीनतम संस्करण) का परीक्षण किया। उन्होंने पाया कि एक ही आकार सबके लिए उपयुक्त नहीं होता। आपको अलग-अलग एआई को अलग-अलग तरह से प्रबंधित करना होगा।
शैली A: "दूरी बनाए रखने वाला" बॉस (सबसे स्मार्ट एआई के लिए)
सबसे उन्नत मॉडलों (जैसे Sonnet 4.5) के लिए, शोधकर्ताओं ने एक दूरी बनाए रखने वाले बॉस की तरह काम किया।
- सेटअप: उन्होंने एआई को एक फ़ाइल, नियमों का एक सेट (Verus टूल), और एक "चीट डिटेक्टर" (यह सुनिश्चित करने के लिए कि एआई केवल नकली प्रमाण न दे दे) दिया।
- परिणाम: एआई इतना स्मार्ट था कि उसने पूरी भूलभुलैया को अपने आप सुलझा लिया। उसे चरण-दर-चरण निर्देशों की आवश्यकता नहीं थी।
- उपमा: कल्पना कीजिए कि एक जीनियस शतरंज खिलाड़ी को बोर्ड देकर कहना, "मुझे चेकमेट करो।" उन्हें यह बताने की ज़रूरत नहीं है कि कौन सा मोहरा कहाँ चलना है; वे पूरा खेल देखते हैं और जीत जाते हैं।
- सफलता दर: इन मॉडलों ने जटिल कार्यों को 81% तक हल किया!
शैली B: "करीबी मार्गदर्शन करने वाला" कोच (थोड़े स्मार्ट लेकिन संघर्ष करने वाले एआई के लिए)
थोड़े कम शक्तिशाली मॉडलों (जैसे o4-mini) के लिए, "दूरी बनाए रखने वाला" दृष्टिकोण विफल रहा। वे भ्रमित हो गए और सिंटैक्स एरर (गणित की भाषा में टाइपो) करने लगे।
- सेटअप: शोधकर्ताओं ने एक कोचिंग सिस्टम बनाया जिसे VeruSAGE कहा गया। यह सिस्टम विशाल भूलभुलैया को छोटे चरणों में तोड़ देता है।
- द प्लानर (Planner): एआई त्रुटि को देखता है और कहता है, "ठीक है, मुझे यहाँ एक विशिष्ट रणनीति का उपयोग करने की आवश्यकता है।"
- द स्पेशलिस्ट (Specialist): सिस्टम एक विशिष्ट "एजेंट" (जैसे गणित विशेषज्ञ या तर्क विशेषज्ञ) को बुलाता है ताकि केवल उस एक त्रुटि को ठीक किया जा सके।
- द रिव्यूअर (Reviewer): सिस्टम जांचता है कि क्या सुधार वास्तव में मदद कर रहा है, इससे पहले कि अगले चरण पर आगे बढ़ा जाए।
- परिणाम: इस कोचिंग ने इन मॉडलों की सफलता दर को दोगुना कर दिया।
- उपमा: यह एक छात्र को जटिल समीकरण हल करना सिखाने जैसा है। आप केवल यह नहीं कहते कि "इसे हल करो।" आप कहते हैं, "पहले, X को अलग करें। बहुत अच्छे। अब, 2 से विभाजित करें। बहुत अच्छे। अब, अपना काम जांचें।"
3. आश्चर्य: एआई मानवीय गलतियों को भी सुधार सकता है
शोधकर्ताओं ने एआई को एक ऐसा प्रोजेक्ट दिया जिस पर इंसान अभी भी काम कर रहे थे (Atmosphere, एक ऑपरेटिंग सिस्टम)।
- जादू: एआई ने न केवल प्रमाण पूरे किए; बल्कि उसने इंसानों के अपने नियमों में बग (गलतियाँ) भी ढूँढ निकाले।
- कहानी: इंसानों ने एक नियम लिखा था कि "यदि आप सूची में पहले आइटम को छोड़ देते हैं, तो बाकी में वह आइटम नहीं होगा।" एआई ने इसे देखा, सोचा, "रुको, यह गलत है यदि सूची में डुप्लिकेट आइटम हैं!" और सुधार का सुझाव दिया। मानव विशेषज्ञों ने सहमति जताई और इसे ठीक किया।
- सीख: एआई केवल एक कार्यकर्ता नहीं है; यह एक गहन सोच वाला साथी (critical thinking partner) है।
4. पेंच: समय और पैसा
- गति: "दूरी बनाए रखने वाले" जीनियस मॉडल तेज़ थे (प्रति कार्य लगभग 7 मिनट)।
- लागत: "करीबी मार्गदर्शन करने वाला" कोचिंग धीमा और अधिक महंगा था क्योंकि इसमें कई छोटे चरणों की आवश्यकता थी।
- समझौता (Trade-off): यदि आपके पास बजट है, तो "दूरी बनाए रखने वाले" जीनियस का उपयोग करें। यदि आपको पैसे बचाने हैं और आपके पास थोड़ा कम स्मार्ट मॉडल है, तो "करीबी मार्गदर्शन करने वाले" कोच का उपयोग करें, लेकिन इसके लिए तैयार रहें कि इसमें समय लगेगा।
निचोड़ (The Bottom Line)
यह पेपर साबित करता है कि एआई हमारे सबसे महत्वपूर्ण सॉफ्टवेयर (जैसे सेल्फ-ड्राइविंग कार या बैंकिंग सिस्टम) के लिए सुरक्षा प्रमाण लिखने में मदद करने के लिए तैयार है।
- सबसे स्मार्ट एआई के लिए: बस उन्हें उपकरण दें और उन्हें चलने दें।
- दूसरों के लिए: आपको समस्या को तोड़ने और उन्हें चरण-दर-चरण मार्गदर्शन करने के लिए एक स्मार्ट सिस्टम की आवश्यकता है।
हम अभी भी मानव इंजीनियरों की जगह नहीं ले रहे हैं (इंसान अभी भी सिस्टम और नियमों को डिज़ाइन करते हैं), लेकिन हमें अंततः एक ऐसा उपकरण मिल रहा है जो उस उबाऊ, कठिन गणितीय काम को कर सकता है जो सिस्टम को सुरक्षित रखता है। यह घर बनाने के साथ-साथ बिल्डिंग इंस्पेक्टर के टेस्ट को भी पास करने वाले रोबोट को प्राप्त करने जैसा है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।