← नवीनतम पेपर
💻 computer science

Formal-Method-Guided Vibe Coding: Closing the Verification Loop on AI-Generated Safety-Critical Software Through Model-Driven Engineering

यह शोध पत्र Forge को प्रस्तुत करता है, जो एक क्लोज्ड-लूप पाइपलाइन है जो मॉडल-ड्रिवन इंजीनियरिंग को औपचारिक सत्यापन (formal verification) उपकरणों के साथ एकीकृत करता है ताकि सुरक्षा-महत्वपूर्ण प्रणालियों के लिए LLM-जनित "वाइब कोडेड" जावा सॉफ्टवेयर को बार-बार परिष्कृत और प्रमाणित किया जा सके, जिसमें डेवलपर्स के लिए औपचारिक मॉडलों का मैन्युअल निरीक्षण करने की आवश्यकता नहीं होती है।

मूल लेखक: Ran Wei, Le Zhu, Haochi Wang, Jim Woodcock, Fang Yan, Simon Foster, Xiangyang Ji

प्रकाशित 2026-06-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ran Wei, Le Zhu, Haochi Wang, Jim Woodcock, Fang Yan, Simon Foster, Xiangyang Ji

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत तेज़, अविश्वसनीय रूप से रचनात्मक, लेकिन थोड़े लापरवाह आर्किटेक्ट (AI) को एक पनडुब्बी के लिए लाइफ-सपोर्ट सिस्टम डिजाइन करने के लिए काम पर रख रहे हैं। आप उसे एक सरल निर्देश देते हैं: "एक ऐसी मशीन बनाओ जो ऑक्सीजन के स्तर को सुरक्षित रखे।"

आर्किटेक्ट तुरंत एक नैपकिन पर एक ब्लूप्रिंट (नक्शा) बना देता है। यह दिखने में अच्छा है, और शायद यह एक खिलौना पनडुब्बी के लिए काम भी कर जाए। लेकिन एक असली पनडुब्बी के लिए, आप केवल उनके कहने पर भरोसा नहीं कर सकते। यदि ब्लूप्रिंट में कोई छिपा हुआ दोष है, तो लोग मारे जा सकते हैं। यही "वाइब कोडिंग" (Vibe Coding) की समस्या है: बिना किसी कठोर जांच के, केवल एक अनौपचारिक बातचीत के आधार पर AI को कोड लिखने देना। यह तेज़ और मज़ेदार है, लेकिन सुरक्षा-महत्वपूर्ण चीज़ों (जैसे विमान, कार, या चिकित्सा उपकरण) के लिए, यह बहुत जोखिम भरा है क्योंकि AI कोई गणितीय गारंटी नहीं देता कि कोड एकदम सही है।

यह पेपर Forge नामक एक समाधान पेश करता है। Forge को एक अत्यधिक सख्त गुणवत्ता नियंत्रण फैक्ट्री के रूप में समझें जो रचनात्मक आर्किटेक्ट और अंतिम उत्पाद के बीच स्थित है।

यहाँ Forge फैक्ट्री चरण-दर-चरण इस प्रकार कार्य करती है:

1. ड्राफ्ट (द "वाइब" वाला हिस्सा)

AI शुरुआती कोड (ब्लूप्रिंट) को Java में तैयार करता है, जो एक ऐसी भाषा है जिसका उपयोग वास्तविक दुनिया के इंजीनियर वास्तव में करते हैं। AI को जटिल गणित जानने की आवश्यकता नहीं है; यह बस आपके प्राकृतिक भाषा के निर्देशों के आधार पर कोड लिखता है।

2. ट्रांसलेटर (द "मॉडल-ड्रिवन" वाला हिस्सा)

यही असली जादू है। Forge फैक्ट्री AI से गणितीय प्रमाण (math proofs) लिखने के लिए नहीं कहती। इसके बजाय, यह AI के Java कोड को लेता है और स्वचालित रूप से इसे तीन अलग-अलग औपचारिक भाषाओं (गणितीय ब्लूप्रिंट) में अनुवादित कर देता है।

  • इसे ऐसे समझें जैसे किसी रफ स्केच को तुरंत तीन अलग-अलग प्रकार के तकनीकी रेखाचित्रों में बदलना: एक स्ट्रक्चरल इंजीनियर के लिए, एक इलेक्ट्रिकल इंजीनियर के लिए, और एक सुरक्षा निरीक्षक के लिए।
  • डेवलपर्स को इन जटिल रेखाचित्रों को पढ़ने की कभी आवश्यकता नहीं होती; फैक्ट्री यह अनुवाद स्वचालित रूप से करती है।

3. तीन निरीक्षक (द "वेरिफिकेशन" लूप)

फैक्ट्री इन तीन गणितीय रेखाचित्रों को तीन अलग-अलग, अत्यंत सख्त निरीक्षकों (वेरिफायर) के पास भेजती है:

  • निरीक्षक A (Dafny): यह जाँचता है कि क्या प्रत्येक फंक्शन ठीक वही करता है जिसका उसने वादा किया था। यह एक दरवाजे के ताले को चेक करने जैसा है कि क्या चाबी घुमाने पर वह वास्तव में लॉक होता है।
  • निरीक्षक B (FDR4): यह पूरे सिस्टम के लिए "डेडलॉक्स" (deadlocks) की जाँच करता है। यह पूछता है, "यदि सिस्टम किसी विशिष्ट स्थिति में फंस जाता है, तो क्या वह कभी बाहर निकल सकता है?" यह सुनिश्चित करता है कि मशीन कभी फ्रीज़ न हो।
  • निरीक्षक C (Isabelle): यह मुख्य निरीक्षक है। यह पूरे तार्किक ढांचे को देखता है ताकि यह सिद्ध किया जा सके कि सिस्टम का विशिष्ट तरीकों से टूटना गणितीय रूप से असंभव है।

4. फीडबैक लूप (द "करेक्शन" वाला हिस्सा)

यदि तीनों में से कोई भी निरीक्षक कोई दोष पाता है, तो वे केवल "फेल" नहीं कहते। वे AI को एक स्ट्रक्चर्ड नोट (व्यवस्थित नोट) भेजते हैं।

  • उदाहरण: "निरीक्षक B ने पाया कि यदि रोबोट मुड़ते समय किसी बाधा का पता लगाता है, तो उसके पास रुकने का कोई तरीका नहीं है। कृपया टर्निंग मोड में एक 'स्टॉप' कमांड जोड़ें।"
  • AI इस नोट को पढ़ता है, कोड को ठीक करता है, और काम को फैक्ट्री में वापस भेज देता है।
  • यह चक्र स्वचालित रूप से दोहराया जाता है। AI कोड को तब तक परिष्कृत करता रहता है जब तक कि तीनों निरीक्षक "पास" नहीं दे देते।

परिणाम: क्या यह काम करता है?

लेखकों ने इसका परीक्षण तीन वास्तविक दुनिया के रोबोटिक परिदृश्यों (एक ग्राउंड रोबोट, एक अंडरवॉटर व्हीकल सेफ्टी सिस्टम, और एक केमिकल डिटेक्टर रोबोट) पर किया।

  • फैक्ट्री के बिना: यदि वे केवल AI को एक बार कोड लिखने देते और उसकी जाँच करते, तो वह कभी भी पास नहीं होता। AI ने 100% प्रयासों में गलतियाँ कीं।
  • फैक्ट्री के साथ: जब उन्होंने इस लूप का उपयोग किया, तो हर एक प्रयास अंततः तीनों निरीक्षणों में पास हो गया। इसमें सुधार के केवल 2 या 3 दौर ही लगे।

यह क्यों महत्वपूर्ण है?

पेपर का तर्क है कि हमें AI को जटिल गणितीय भाषाएँ सीखने के लिए मजबूर नहीं करना चाहिए (जिसमें वह खराब है क्योंकि उसके प्रशिक्षण में इसे पर्याप्त रूप से नहीं देखा गया है), बल्कि हमें उसे वह करने देना चाहिए जिसमें वह अच्छा है (मानक कोड लिखना) और हमारे मौजूदा, प्रमाणित इंजीनियरिंग टूल्स (फैक्ट्री) का उपयोग उसके काम की जाँच और सुधार के लिए करना चाहिए।

संक्षेप में: Forge AI को एक "अनिश्चित तत्व" (wildcard) से एक विश्वसनीय ड्राफ्ट्समैन में बदल देता है। AI पहला ड्राफ्ट लिखता है, और फैक्ट्री के स्वचालित गणित-चेकर्स एक संपादक के रूप में कार्य करते हैं, जो AI को कोड को फिर से लिखने के लिए मजबूर करते हैं जब तक कि वह गणितीय रूप से सटीक न हो जाए। यह उन चीजों के लिए AI-जनरेटेड सॉफ्टवेयर को प्रमाणित करने का एक मार्ग बनाता है जहाँ विफलता की कोई गुंजाइश नहीं है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →