← नवीनतम पेपर
💻 computer science

BlueprintRepair: Typed Local Edits for Failed Lean Proof Blueprints

यह शोध पत्र BlueprintRepair को पेश करता है, जो विफल लीन (Lean) प्रूफ ब्लूप्रिंट्स को सुधारने के लिए एक स्कीमा-जांचित स्थानीय संपादन इंटरफ़ेस है, जो नए BlueprintTrace बेंचमार्क द्वारा प्रमाणित किया गया है कि यह मुक्त-रूप पैचिंग और रीराइटिंग विधियों की तुलना में समान या बेहतर लागत और टोकन दक्षता प्राप्त करता है।

मूल लेखक: Ruslan Khrulev

प्रकाशित 2026-07-31
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ruslan Khrulev

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को एक जटिल गणितीय समस्या हल करना सिखाने की कोशिश कर रहे हैं। आप केवल रोबोट को यह नहीं कह सकते, "जाओ और इसे खुद सुलझा लो!" और उम्मीद नहीं कर सकते कि वह पहली बार में ही इसे सही कर लेगा। इसके बजाय, आप उसे एक नक्शा देते हैं—एक ब्लूप्रिंट। यह ब्लूपिंट उत्तर का चित्र नहीं है; यह छोटे चरणों (लेम्मा) की एक चेकलिस्ट है जिन्हें अंतिम लक्ष्य तक पहुँचने के लिए सत्य होना आवश्यक है। यदि रोबोट अटक जाता है, तो इसका कारण आमतौर पर यह होता है कि चेकलिस्ट का कोई एक चरण गलत है, कोई संबंध गायब है, या रोबोट एक चरण को सिद्ध करना भूल गया है।

कंप्यूटर विज्ञान की दुनिया में, इसे "फॉर्मल वेरिफिकेशन" (औपचारिक सत्यापन) कहा जाता है। यह एक गगनचुंबी इमारत बनाने जैसा है जहाँ प्रत्येक ईंट को गणितीय रूप से यह सिद्ध करना होगा कि वह अपने ऊपर वाली ईंट का भार सह सकती है। यदि एक भी ईंट कमजोर है, तो पूरी इमारत ढह जाएगी। हाल ही में, वैज्ञानिकों ने इन प्रमाणों (प्रूफ़्स) को लिखने में मदद करने के लिए आर्टिफिशियल इंटेलिजेंस (AI) का उपयोग करना शुरू किया है। लेकिन AI एक प्रतिभाशाली लेकिन कभी-कभी लापरवाह वास्तुकार की तरह है: वह एक सुंदर ब्लूप्रिंट तो बना सकता है, लेकिन वह गलती से एक सपोर्ट बीम छोड़ सकता है या ऐसा नियम लिख सकता है जिसका कोई अर्थ न हो। जब ब्लूप्रिंट विफल हो जाता है, तो सवाल यह है: हम इसे कैसे ठीक करें? क्या हम AI से पूरे भवन को गिराकर फिर से शुरू करने के लिए कहते हैं? क्या हम उसे दीवार पर एक छेद को भरने के लिए एक त्वरित नोट लिखने के लिए कहते हैं? या क्या हम उसे केवल उस टूटे हुए हिस्से को ठीक करने के लिए उपकरणों का एक विशिष्ट सेट देते हैं?

BlueprintRepair नामक यह शोध पत्र ठीक इसी प्रश्न की खोज करता है। शोधकर्ताओं ने इन AI-जनित गणितीय ब्लूप्रिंट्स के लिए एक विशेष "रिपेयर शॉप" (मरम्मत की दुकान) बनाई है। उन्होंने एक ऐसी प्रणाली बनाई है जहाँ एक AI दस विशिष्ट, पूर्व-अनुमोदित उपकरणों (जैसे "इस नियम को कमजोर करें" या "यह कनेक्शन जोड़ें") का उपयोग करके एक टूटे हुए प्रमाण योजना को ठीक कर सकता है, बजाय इसके कि वह पूरी चीज़ को शून्य से फिर से लिखे। उन्होंने इसका परीक्षण दो अन्य विधियों के विरुद्ध किया: एक जहाँ AI मुक्त-रूप (free-form) टेक्स्ट परिवर्तनों के साथ कोड को पैच करने की कोशिश करता है, और दूसरा जहाँ AI पूरे मॉड्यूल को फिर से लिख देता है।

यहाँ उन्हें क्या मिला। जब ब्लूप्रिंट में एक छोटी, स्थानीय त्रुटि थी—जैसे कि एक गायब लिंक या गलत संख्या—तो "टाइप्ड लोकल एडिट्स" विधि (विशिष्ट उपकरणों का उपयोग करना) मुक्त-रूप विधियों के लगभग बराबर प्रभावी थी। वास्तव में, DeepSeek-V4-Flash नामक मॉडल के साथ, टूल-आधारित विधि ने 91 में से 79 छोटी त्रुटियों को हल किया, जबकि मुक्त-रूप विधियों ने 81 को हल किया। अंतर बहुत मामूली था। हालाँकि, टूल-आधारित विधि बहुत तेज़ और सस्ती थी। इसने केवल 10,000 "टोकन" (AI द्वारा उत्पन्न टेक्स्ट की एक माप) का उपयोग करके अपनी अधिकतम सफलता दर प्राप्त कर ली, जबकि अन्य विधियों को बराबरी करने के लिए बहुत अधिक टेक्स्ट उत्पन्न करने की आवश्यकता थी। लागत के मामले में, टूल-आधारित विधि प्रति हल की गई समस्या सबसे सस्ती थी, जबकि मुक्त-रूप पैचिंग 1.30 गुना अधिक महंगी थी, और पूर्ण पुनर्लेखन (full rewrite) 2.06 गुना अधिक महंगा था।

शोधकर्ताओं ने एक दूसरा AI मॉडल, Qwen3.6-Flash का भी परीक्षण किया। इस मॉडल ने कुल मिलाकर कम समस्याएं हल कीं, लेकिन पैटर्न वही रहा: विशिष्ट टूल-आधारित मरम्मत अभी भी सबसे अधिक लागत प्रभावी थी और इसने अन्य विधियों की तुलना में बहुत तेज़ी से अपनी सफलता की सीमा प्राप्त कर ली। दिलचस्प बात यह है कि जब ब्लूप्रिंट में कई, जटिल त्रुटियाँ एक साथ जुड़ी हुई थीं, तो मुक्त-रूप विधियों को कभी-कभी थोड़ा लाभ मिला, लेकिन अधिकांश छोटे, सुधारा जात्मक गलतियों के लिए, विशिष्ट उपकरणों का उपयोग करने वाला "सर्जिकल" दृष्टिकोण ही विजेता रहा।

यह शोध पत्र एक नया डेटासेट BLUEPRINTTRACE भी पेश करता है जो प्रत्येक प्रयास, सफलता और विफलता को रिकॉर्ड करता है। यह गणितीय प्रमाणों के लिए एक "ब्लैक बॉक्स फ्लाइट रिकॉर्डर" की तरह है, जो दिखाता है कि AI कहाँ गलत हुआ और क्यों। इस प्रणाली का सबसे महत्वपूर्ण नियम यह है कि AI अंतिम लक्ष्य (लक्ष्य प्रमेय) को नहीं बदल सकता। यदि AI उस प्रश्न को बदलने की कोशिश करता है जिसका उत्तर उसे देना है, तो सिस्टम इसे तुरंत अस्वीकार कर देता है। यह सुनिश्चित करता है कि AI वास्तव में उसी समस्या को हल कर रहा है जो उसे दी गई है, न कि केवल एक आसान समस्या ढूंढ रहा है।

संक्षेप में, यह शोध पत्र सुझाव देता है कि जब एक AI का गणितीय ब्लूप्रिंट काफी हद तक सही होता है लेकिन उसमें कुछ टूटे हुए हिस्से होते हैं, तो उन हिस्सों को ठीक करने के लिए उपकरणों का एक विशिष्ट सेट देना, पूरी चीज़ को फिर से लिखने की तुलना में एक स्मार्ट, तेज़ और सस्ता तरीका है। यह एक सर्जन द्वारा ट्यूमर निकालने के लिए एक सटीक चीरा लगाने और एक विध्वंस दल (demolition crew) द्वारा पाइप लीक होने पर पूरे अस्पताल को गिरा देने के बीच का अंतर है। हालांकि विध्वंस दल अंततः काम पूरा कर सकता है, लेकिन सर्जन कम गंदगी और कम लागत के साथ वहां तक पहुँच जाता है। यह अध्ययन यह दावा नहीं करता कि यह हर एक गणितीय समस्या के लिए पूर्ण समाधान है, लेकिन उनके द्वारा परीक्षण किए गए विशिष्ट प्रकार के "स्थानीयकृत" (localized) दोषों के लिए, टाइप्ड लोकल एडिट्स सबसे कुशल मार्ग है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →