Harnessing Code Agents for Automatic Software Verification
यह शोध पत्र यह प्रदर्शित करता है कि एक सामान्य-उद्देश्य वाले LLM कोड एजेंट को मानव-डिज़ाइन की गई निश्चित रणनीतियों के साथ सीमित करने के बजाय, उसे एक साउंडनेस-प्रवर्तक सत्यापन हार्नेस (soundness-enforcing verification harness) में लपेटने से जटिल सॉफ्टवेयर प्रणालियों का पूर्णतः स्वचालित और पूर्ण औपचारिक सत्यापन सक्षम होता है, जो विशेषज्ञ हस्तक्षेप के बिना Coq और Lean 4 में हजारों लेम्मा पर 100% प्रमाण कवरेज प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक गगनचुंबी इमारत बनाने की कोशिश कर रहे हैं, लेकिन ब्लूप्रिंट एक ऐसी भाषा में लिखे गए हैं जो इतनी जटिल और सख्त है कि दुनिया के केवल कुछ ही विशेषज्ञ उन्हें पढ़ सकते हैं। यदि आप गणित में एक छोटी सी भी गलती करते हैं, तो पूरी इमारत ढह सकती है। यह फॉर्मल सॉफ्टवेयर वेरिफिकेशन (formal software verification) की दुनिया है। यह कंप्यूटर कोड के बग-मुक्त होने को गणितीय रूप से सिद्ध करने की प्रक्रिया है।
दशकों से, यह एक बाधा बना हुआ है। हालांकि हम सॉफ्टवेयर को पूर्ण साबित कर सकते हैं, लेकिन प्रमाण लिखने में मानव विशेषज्ञों को वर्षों का कठिन परिश्रम करना पड़ता है। यह एक शहर की हर एक ईंट को, एक-एक करके, मैन्युअल रूप से जांचने के लिए इंजीनियरों की एक टीम को काम पर रखने जैसा है।
यह पेपर एक नया तरीका पेश करता है जिसे आर्या (Aria) कहा जाता है। यह सिखाने के बजाय कि कंप्यूटर को एक मानव आर्किटेक्ट की तरह कैसे सोचना चाहिए (जो कि अतीत में विफल रहा है), लेखकों ने एक स्मार्ट कंप्यूटर एजेंट को एक "सैंडबॉक्स" दिया और उसे अपने आप समाधान खोजने दिया।
यह कैसे काम करता है, यहाँ सरल उपमाओं का उपयोग किया गया है:
1. समस्या: "विशेषज्ञ" की बाधा
फॉर्मल वेरिफिकेशन को एक विशाल, बहु-चरणीय तर्क पहेली (logic puzzle) को हल करने जैसा समझें।
- पुराना तरीका: आप एक मानव विशेषज्ञ को काम पर रखते हैं। वे पहेली को देखते हैं, घंटों तक सोचते हैं, और समाधान लिखते हैं।
- सीमा: विशेषज्ञ महंगे और धीमे होते हैं। वे एक दिन में केवल कुछ ही पहेलियाँ हल कर सकते हैं।
- विफल AI प्रयास: पिछले AI प्रयास एक रोबोट को एक सख्त चेकलिस्ट देने जैसे थे। "चरण 1: इस टुकड़े को देखें। चरण 2: यह चाल आजमाएं।" रोबोट नियमों का पालन करता था लेकिन फंस जाता था क्योंकि चेकलिस्ट बहुत कठोर थी। वह केवल आसान पहेलियों को ही हल कर पाता था।
2. समाधान: "कोड एजेंट" और "सेफ्टी हार्नेस"
लेखकों ने एक अलग दृष्टिकोण अपनाया। उन्होंने AI को चेकलिस्ट नहीं दी। इसके बजाय, उन्होंने इसे एक सामान्य-उद्देश्य वाला कोडिंग सहायक (जैसे "क्लोड कोड" नाम का एक सुपर-स्मार्ट इंटर्न) और एक सख्त सेफ्टी हार्नेस (सुरक्षा कवच) दिया।
- एजेंट (इंटर्न): आप AI को पूरी पहेली (लेम्मा/lemma) सौंप देते हैं और कहते हैं, "इसे सुलझाओ।" AI कुछ भी आज़माने के लिए स्वतंत्र है। यह नियमों को देख सकता है, एक चाल चल सकता है, असफल हो सकता है, कोड के दूसरे हिस्से को देख सकता है, या पूरी तरह से नई रणनीति आजमा सकता है। यह किसी इंसान की कठोर योजना का पालन नहीं कर रहा है; यह अपने स्वयं के निर्णय का उपयोग कर रहा है।
- हार्नेस (सुरक्षा निरीक्षक): यह सबसे महत्वपूर्ण हिस्सा है। AI को गलतियाँ करने की अनुमति है, लेकिन यह उन्हें सिस्टम से छिपकर पार नहीं कर सकता।
- यदि AI एक प्रमाण (proof) लिखता है, तो "हार्नेस" उसे एक सख्त मशीन-चेकर ("कोक कर्नेल"/Coq kernel) के माध्यम से चलाता है।
- यदि यह गलत है: मशीन कहती है, "नहीं। चरण 4 गलत है। यहाँ बताया गया है कि क्यों।"
- लूप: AI फीडबैक सुनता है, अपनी गलती सुधारता है, और फिर से प्रयास करता है। यह एक ही पहेली के लिए 30 बार तक ऐसा कर सकता है।
- नियम: प्रमाण तभी स्वीकार किया जाता है जब मशीन-चेकर कहता है "हाँ, यह 100% सही है।" AI झूठ नहीं बोल सकता, और न ही वह चरणों को छोड़ सकता है।
3. परिणाम: "असंभव" पहेलियों को हल करना
लेखकों ने इस सिस्टम का परीक्षण सॉफ्टवेयर जगत की सबसे कठिन तर्क पहेलियों पर किया, विशेष रूप से आइरिस (Iris) नामक एक लाइब्रेरी पर।
- चुनौती: आइरिस का उपयोग जटिल, समवर्ती (concurrent) सॉफ्टवेयर (जैसे ऑपरेटिंग सिस्टम और सुरक्षित लाइब्रेरी) को सत्यापित करने के लिए किया जाता है। इसे सॉफ्टवेयर वेरिफिकेशन का "माउंट एवरेस्ट" माना जाता है।
- उपलब्धि: AI ने, बिना किसी मानवीय सहायता के, 100% पहेलियों को हल किया।
- इसने कोर आइरिस लाइब्रेरी में 4,257 जटिल लेम्मा (lemmas) को सिद्ध किया।
- इसने रस्ट (Rust) की स्टैंडर्ड लाइब्रेरी (एक लोकप्रिय प्रोग्रामिंग भाषा के लिए सुरक्षा नियम) के 217 लेम्मा को सिद्ध किया।
- इसने एक अलग लाइब्रेरी में भी 318 पहेलियाँ हल कीं, जहाँ पिछले AI सिस्टम 8 में से 7 प्रयासों में विफल रहे थे।
- इसने एक अलग प्रकार के गणितीय सिस्टम (Lean) पर भी काम किया, जिससे यह सिद्ध हुआ कि यह केवल एक विशिष्ट टूल के लिए कोई ट्रिक नहीं थी।
4. यह क्यों काम करता है (असली मंत्र)
पेपर का तर्क है कि कुंजी AI को अधिक स्मार्ट बनाने में नहीं थी, बल्कि AI और चेकर के बीच के संबंध को बदलने में थी।
- भरोसा मुफ्त है: कई AI कार्यों में, आपको चिंता करनी पड़ती है कि कहीं AI भ्रमित (hallucinating) तो नहीं हो रहा है। इस सिस्टम में, "सेफ्टी हार्नेस" एक अचूक निर्णायक के रूप में कार्य करता है। यदि AI कहता है "मैंने इसे हल कर लिया है," तो जज इसकी जांच करता है। यदि यह गलत है, तो जज इसे खारिज कर देता है। AI बहलाने या धोखा देने में सक्षम नहीं है।
- कोई कठोर नियम नहीं: AI को अपनी खुद की रणनीति चुनने की अनुमति देकर (मानव की चरण-दर-चरण योजना थोपने के बजाय), यह शॉर्टकट और समाधान खोजने के लिए अपनी "अंतर्ज्ञान" (intuition) का उपयोग कर सका, जिसे कठोर सिस्टम मिस कर देते थे।
5. पॉलिश (सुधार)
कभी-कभी AI एक ऐसा समाधान ढूंढता है जो सही तो है लेकिन अव्यवस्थित है (जैसे कि एक गणितीय प्रमाण जो बहुत भ्रमित करने वाली शैली में लिखा गया हो)। सिस्टम में एक "पॉलिशर" (Polisher) एजेंट शामिल है जो अव्यवस्थित प्रमाण को एक साफ, पेशेवर शैली में फिर से लिखता है, यह सुनिश्चित करता है कि यह एक मानव विशेषज्ञ द्वारा लिखे गए प्रमाण की तरह दिखे, जबकि यह अभी भी सख्त मशीन चेक को पास करता रहे।
सारांश
पेपर का दावा है कि एक स्मार्ट, स्वतंत्र रूप से सोचने वाले AI एजेंट को एक सख्त, अडिग सेफ्टी हार्नेस के साथ जोड़कर, हम अब यह प्रमाणित कर सकते हैं कि जटिल सॉफ्टवेयर बग-मुक्त है। यह एक प्रतिभाशाली, रचनात्मक इंटर्न को काम पर रखने जैसा है जिसे समस्या को हल करने के लिए कोई भी तरीका आज़माने की अनुमति है, लेकिन उसकी निगरानी एक ऐसे रोबोट द्वारा की जाती है जो पूर्णता से कम कुछ भी स्वीकार करने से इनकार करता है। परिणाम? AI ने अपने सामने दी गई हर समस्या को हल किया, जिनमें वे भी शामिल थीं जिन्हें मनुष्य यह कहते हैं कि ऑटोमेट करना बहुत कठिन है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।