← नवीनतम पेपर
🤖 AI

Automated Proof Generation for Rust Code via Self-Evolution

यह शोध पत्र SAFE को प्रस्तुत करता है, जो एक स्व-विकसित (self-evolving) फ्रेमवर्क है जो पुनरावृत्ति डेटा जनरेशन और सिम्बोलिक वेरीफायर द्वारा निर्देशित स्व-डिबगिंग के माध्यम से रस्ट (Rust) कोड के लिए औपचारिक प्रमाणों (formal proofs) को संश्लेषित और परिष्कृत करता है, जिससे ओपन-सोर्स मॉडल स्वचालित प्रमाण जनरेशन में 52.52% सटीकता दर प्राप्त करने में सक्षम होते हैं—जो GPT-4o की 14.39% दर की तुलना में एक महत्वपूर्ण सुधार है।

मूल लेखक: Tianyu Chen, Shuai Lu, Shan Lu, Yeyun Gong, Chenyuan Yang, Xuheng Li, Md Rakib Hossain Misu, Hao Yu, Nan Duan, Peng Cheng, Fan Yang, Shuvendu K Lahiri, Tao Xie, Lidong Zhou

प्रकाशित 2026-02-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tianyu Chen, Shuai Lu, Shan Lu, Yeyun Gong, Chenyuan Yang, Xuheng Li, Md Rakib Hossain Misu, Hao Yu, Nan Duan, Peng Cheng, Fan Yang, Shuvendu K Lahiri, Tao Xie, Lidong Zhou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मास्टर शेफ (एक Large Language Model, या LLM) हैं जो स्वादिष्ट व्यंजन बनाने में अविश्वसनीय रूप से प्रतिभाशाली है (कोड लिखना)। आप केवल एक रेसिपी के विवरण को पढ़कर एक बेहतरीन पास्ता डिश या एक जटिल सूफ़ले (soufflé) तैयार कर सकते हैं। हालाँकि, इसमें एक पेंच है: कभी-कभी आपका पास्ता कच्चा रह जाता है, या आपका सूफ़ले ढह जाता है। सॉफ़्टवेयर की दुनिया में, एक "ढहा हुआ सूफ़ले" केवल एक खराब भोजन नहीं है; यह एक सुरक्षा उल्लंघन (security breach) या सिस्टम क्रैश है।

भोजन को सुरक्षित सुनिश्चित करने के लिए, आपको एक खाद्य सुरक्षा निरीक्षक (एक Formal Verifier जैसे Verus) की आवश्यकता है। यह निरीक्षक केवल भोजन का स्वाद नहीं चखता; वह भोजन की रासायनिक संरचना, तापमान के इतिहास और स्वच्छता लॉग की जांच करता है ताकि गणितीय रूप से सिद्ध किया जा सके कि भोजन सुरक्षित है।

समस्या:
समस्या यह है कि जबकि लाखों रेसिपी (कोड स्निपेट्स) मौजूद हैं, "सुरक्षा निरीक्षण रिपोर्ट" (फॉर्मल प्रूफ) लगभग न के बराबर हैं। इन रिपोर्टों को लिखने के लिए खाद्य रसायन विज्ञान और गणित की पीएचडी-स्तर की समझ की आवश्यकता होती है। चूंकि ऐसी रिपोर्टें बहुत कम हैं, इसलिए हमारा मास्टर शेफ उन्हें लिखना कभी सीख ही नहीं पाया। वह खाना तो बना सकता है, लेकिन वह यह सिद्ध नहीं कर सकता कि भोजन सुरक्षित है।

समाधान: SAFE (Self-evolving Automated prooF gEneration)
यह पेपर एक फ्रेमवर्क पेश करता है जिसे SAFE कहा जाता है। इसे SAFE के रूप में न देखें, बल्कि एक स्व-सुधारने वाली कुकिंग एकेडमी के रूप में जो शेफ को सुरक्षा रिपोर्ट लिखना सिखाती है, भले ही पहले में से किसी ने भी कोई रिपोर्ट न लिखी हो।

SAFE कैसे काम करता है, यहाँ इसके तीन सरल चरणों में विवरण दिया गया है:

1. "अनुवाद" चरण (सामग्री को सुसंगत बनाना)

Verus निरीक्षक केवल "Rust" की एक बहुत विशिष्ट बोली बोलता है। शेफ की मूल रेसिपी Python या मानक Rust में हो सकती है, जिसे निरीक्षक नहीं समझ सकता।

  • उपमा: कल्पना कीजिए कि शेफ के पास "स्पाइसी टैकोस" की एक रेसिपी है, लेकिन निरीक्षक केवल "फ्रेंच" भाषा में लिखी गई रेसिपी स्वीकार करता है।
  • SAFE क्या करता है: यह हजारों मौजूदा रेसिपी को उस विशिष्ट "फ्रेंच" बोली में अनुवादित करने के लिए एक सुपर-स्मार्ट AI (GPT-4o) का उपयोग करता है जिसे निरीक्षक समझ सके। यदि कोई रेसिपी किसी ऐसे घटक का उपयोग करती है जिसे निरीक्षक नापसंद करता है (जैसे कि एक विशिष्ट लूप), तो AI उसे एक सुरक्षित विकल्प से बदल देता है।

2. "अनुमान" चरण (नियमों का अनुमान लगाना)

निरीक्षक द्वारा भोजन की जांच करने से पहले, शेफ को यह लिखना होगा कि भोजन कैसा दिखना चाहिए (जैसे, "सॉस लाल होना चाहिए," "मांस 160°F तक पका होना चाहिए")। इन्हें Specifications (विनिर्देश) कहा जाता है।

  • उपमा: शेफ को सुरक्षा निरीक्षण के नियमों का अनुमान लगाना होता है।
  • चुनौती: यदि शेफ गलत अनुमान लगाता है (जैसे, "सॉस नीला होना चाहिए"), तो निरीक्षक तुरंत भोजन को खारिज कर देगा।
  • SAFE क्या करता है: यह शेफ द्वारा नियमों का अनुमान लगाने के साथ शुरू होता है। फिर, यह एक "क्वालिटी स्कोर" (जैसे कि स्वाद परीक्षण) का उपयोग करता है यह देखने के लिए कि क्या अनुमानित नियम तर्कसंगत हैं।
    • यदि नियम बहुत आसान हैं (जैसे, "भोजन मौजूद होना चाहिए"), तो उन्हें बाहर कर दिया जाता है क्योंकि वे शेफ को कुछ भी नहीं सिखाते।
    • यदि नियम असंभव हैं, तो उन्हें बाहर कर दिया जाता है।
    • यदि नियम "काफी अच्छे" हैं (तर्कसंगत लेकिन पूर्ण नहीं), तो उन्हें रखा जाता है।
    • जादू: शेफ फिर इन नियमों को बार-बार लिखने का अभ्यास करता है, प्रत्येक दौर में बेहतर होता जाता है, और "अच्छे अनुमानों" का एक विशाल पुस्तकालय बनाता है।

3. "प्रूफ और डीबग" चरण (वास्तविक प्रशिक्षण)

अब शेफ नियमों (Specifications) के आधार पर वास्तविक Proof (सुरक्षा रिपोर्ट) लिखने का प्रयास करता है।

  • संघर्ष: शुरुआत में, वह 80% बार विफल होता है। निरीक्षक कहता है, "त्रुटि: आपने यह सिद्ध करने के लिए प्रमाण नहीं दिया कि मांस जला नहीं है!"
  • "सेल्फ-डीबगिंग" की महाशक्ति: यह SAFE का सबसे शानदार हिस्सा है। विफल प्रयासों को केवल फेंक देने के बजाय, SAFE उन्हें प्रशिक्षण पाठों में बदल देता है।
    • यह शेफ के लिए एक "स्टडी कार्ड" बनाता है:
      • गलती: "आपने रिपोर्ट लिखी कि मांस सुरक्षित था।"
      • निरीक्षक की टिप्पणी: "त्रुटि: आपने तापमान की जांच नहीं की।"
      • सुधार: "यहाँ वह सही वाक्य है जिसे आपको जोड़ना चाहिए।"
    • शेफ इन कार्डों का अध्ययन करता है। समय के साथ, शेफ न केवल रिपोर्ट को शून्य से लिखना सीखता है, बल्कि जब निरीक्षक उनकी गलतियों की ओर इशारा करता है, तो वे अपनी गलतियों को सुधारना भी सीख जाता है।

परिणाम: नौसिखिए से मास्टर तक

इस "कुकिंग एकेडमी" का परीक्षण दुनिया के सर्वश्रेष्ठ शेफ (GPT-4o) और एक मानक छात्र (ओपन सोर्स मॉडल) के विरुद्ध किया गया।

  • GPT-4o (एकेडमी के बिना प्रो): एक बहुत ही विस्तृत निर्देश पुस्तिका के साथ भी, GPT-4o केवल 14% सुरक्षा रिपोर्ट सही कर सका। यह एक प्रो शेफ की तरह था जो बिना फ्रेंच सीखे फ्रेंच सुरक्षा रिपोर्ट लिखने की कोशिश कर रहा था।
  • SAFE-प्रशिक्षित मॉडल (एकेडमी का स्नातक): स्व-विकसित चक्र से गुजरने के बाद, ओपन-सोर्स मॉडल ने 52.5% सटीकता प्राप्त की।
    • बड़ी छलांग: यह लगभग कुछ भी न जानने से लेकर सुरक्षा रिपोर्ट लिखने के कार्य में दुनिया के सबसे उन्नत AI से 3 गुना अधिक बेहतर होने तक पहुँच गया।

यह क्यों महत्वपूर्ण है

वास्तविक दुनिया में, सॉफ़्टवेयर बग अरबों डॉलर का नुकसान करते हुए और खतरनाक हो सकते हैं (जैसे कि सेल्फ-ड्राइविंग कार या चिकित्सा उपकरण)।

  • SAFE से पहले: हमें ये सुरक्षा प्रमाण लिखने के लिए महंगे मानव विशेषज्ञों को नियुक्त करना पड़ता था, जो धीमा और महंगा था।
  • SAFE के साथ: हमने एक ऐसी मशीन बनाई है जो हजारों उदाहरणों पर अभ्यास करके और अपनी गलतियों से सीखकर खुद को सुरक्षा प्रमाण लिखना सिखा सकती है। यह चलते-चलते अपना स्वयं का पाठ्यपुस्तक (textbook) बनाती है।

संक्षेप में: SAFE एक ऐसा सिस्टम है जो एक स्मार्ट AI लेता है, उसे कोड का ढेर देता है, और कहता है, "जाओ सुरक्षा रिपोर्ट लिखो। यदि तुम विफल होते हो, तो त्रुटि संदेश को पढ़ो, उसे ठीक करो, और फिर से प्रयास करो।" ऐसा लाखों बार करने से, AI कोड-लेखक से कोड-वेरिफायर (code-verifier) में विकसित हो जाता है, जिससे एक ऐसी समस्या हल होती है जिसे पहले मानवीय प्रतिभा की आवश्यकता माना जाता था।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →