APE-Bench: Evaluating Automated Proof Engineering for Formal Math Libraries
यह शोध पत्र APE-Bench प्रस्तुत करता है, जो वास्तविक दुनिया के रिपॉजिटरी-स्केल कार्यों को निकालने और विविध एजेंट कार्यान्वयनों में सिंटैक्टिक संकलन (syntactic compilation) और सिमेंटिक शुद्धता (semantic correctness) दोनों को मान्य करने के लिए एक एकीकृत हार्नेस प्रदान करके औपचारिक गणित पुस्तकालयों में स्वचालित प्रमाण इंजीनियरिंग (automated proof engineering) के मूल्यांकन के लिए पहला व्यवस्थित ढांचा और बेंचमार्क है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को गणितीय प्रमाणों (mathematical proofs) के एक विशाल, जीवित पुस्तकालय, जिसे Mathlib कहा जाता है, का मास्टर लाइब्रेरियन बनने के लिए सिखाने की कोशिश कर रहे हैं। यह पुस्तकालय लाखों पृष्ठों का है। यह केवल एक स्थिर पुस्तक नहीं है; इसे मानव विशेषज्ञों द्वारा लगातार फिर से लिखा, विस्तारित और सुधारा जा रहा है।
लंबे समय तक, शोधकर्ताओं ने रोबोटों का परीक्षण एकल, अलग-थलग गणितीय पहेलियों (जैसे "सिद्ध करें कि 2+2=4") को हल करने की उनकी क्षमता पर किया। लेकिन वास्तविक दुनिया में, गणितज्ञ होना केवल एक पहेली को हल करने के बारे में नहीं है; यह प्रूफ इंजीनियरिंग (proof engineering) के बारे में है। इसका अर्थ है पूरे पुस्तकालय में नेविगेट करना, सही उपकरणों को खोजना, टूटे हुए पृष्ठों को ठीक करना, और यह सुनिश्चित करना कि आपके नए जुड़ाव पहले से मौजूद लाखों पृष्ठों के साथ पूरी तरह फिट बैठें और किसी भी चीज़ को खराब न करें।
यह पेपर इन वास्तविक दुनिया के कौशल पर रोबोटों का परीक्षण करने का एक नया तरीका पेश करता है। यहाँ सरल उपमाओं (analogies) का उपयोग करके इसका विवरण दिया गया है:
1. समस्या: "अलग-थलग पहेली" बनाम "जीवित पुस्तकालय"
- पुराना तरीका (miniF2F): कल्पना कीजिए कि एक शेफ का परीक्षण करने के लिए उन्हें एक एकल रेसिपी कार्ड दिया जाता है और उनसे एक व्यंजन बनाने के लिए कहा जाता है। यदि व्यंजन स्वादिष्ट है, तो वे पास हो जाते हैं। यह आपको यह नहीं बताता कि क्या वे एक पूरे रेस्टोरेंट किचन को संभाल सकते हैं, सामग्री मंगवा सकते हैं, या खराब ओवन को ठीक कर सकते हैं।
- वास्तविकता: वास्तविक गणित का काम उस रेस्टोरेंट को चलाने जैसा है। आपको अन्य शेफ के साथ समन्वय करना होता है, विशिष्ट उपकरणों का उपयोग करना होता है, और यह सुनिश्चित करना होता है कि आपका नया व्यंजन मेनू को खराब न कर दे।
- अंतराल (Gap): मौजूदा परीक्षण केवल यह जाँचते थे कि क्या रोबोट उस एकल व्यंजन को बना सकता है। उन्होंने यह नहीं जाँचा कि क्या रोबोट वास्तविक रसोई के शोर-शराबे और अराजकता को संभाल सकता है।
2. समाधान: APE-Bench ("जीवित पुस्तकालय" परीक्षण)
लेखकों ने APE-Bench बनाया, जो वास्तविक जीवन के पुस्तकालय रखरखाव की नकल करता है।
- यह कैसे काम करता है: रोबोट को एक नकली पहेली देने के बजाय, सिस्टम Mathlib लाइब्रेरी के वास्तविक इतिहास को देखता है। यह एक ऐसा क्षण ढूँढता है जहाँ एक मानव विशेषज्ञ ने एक बदलाव (एक "commit") किया था, उस बदलाव को छिपा देता है, और रोबोट से पूछता है: "बदलाव से पहले का पुस्तकालय यहाँ है। यहाँ एक नोट है कि मानव क्या करना चाहता था। क्या आप वह बदलाव कर सकते हैं?"
- ट्विस्ट: रोबोट को केवल इस आधार पर ग्रेड नहीं दिया जाता कि कोड "रन" (syntax) होता है या नहीं। इसे दो चीजों पर ग्रेड दिया जाता है:
- कंपाइलेशन (Compilation): क्या कोड बिना किसी त्रुटि के कंपाइल हुआ? (क्या व्यंजन जल गया?)
- सिमेंटिक चेक (Semantic Check): क्या रोबोट ने वास्तव में वही किया जो पूछा गया था? (क्या उन्होंने सही समस्या को ठीक किया, या उन्होंने बस यादृच्छिक रूप से लाइनें बदल दीं?)
3. इंफ्रास्ट्रक्चर: APE-Harness ("यूनिवर्सल किचन")
इन परीक्षणों को निष्पक्ष रूप से चलाने के लिए, उन्होंने APE-Harness नामक एक प्रणाली बनाई है। इसे एक यूनिवर्सल किचन सिम्युलेटर समझें।
- "अनुबंध" (The Contract): प्रत्येक परीक्षण के साथ एक सख्त अनुबंध आता है। यह कहता है: "आप लाइब्रेरी के इस विशिष्ट संस्करण में हैं। आप केवल इन फाइलों को छू सकते हैं। आपको सिद्ध करना होगा कि आपने काम किया है।"
- "स्कैफोल्ड्स" (The Scaffolds): सिस्टम को इस तरह डिज़ाइन किया गया है कि आप अलग-अलग रोबोटों (जैसे Claude Code, Codex, या अपना स्वयं का APE-Agent) को एक ही किचन में प्लग कर सकें। क्योंकि किचन के नियम (अनुबंध) सभी के लिए समान हैं, इसलिए आप निष्पक्ष रूप से तुलना कर सकते हैं कि कौन वास्तव में बेहतर शेफ है, बजाय इसके कि केवल यह देखें कि किसे निर्देशों में भाग्य मिला।
- "टाइम ट्रैवल" ट्रिक: लाइब्रेरी के 67 विभिन्न संस्करण हैं (जैसे एक पुस्तक के 67 विभिन्न संस्करण)। उन सभी को स्टोर करने के लिए बहुत अधिक स्थान की आवश्यकता होगी। लेखकों ने एक चतुर "डुप्लीकेशन हटाने" (deduplication) प्रणाली बनाई है। यदि संस्करण 1 और संस्करण 67 में एक पेज समान है, तो सिस्टम उसे केवल एक बार स्टोर करता है और बस उसकी ओर संकेत करता है। इसने डेटा को प्रोसेस करने के लिए आवश्यक स्टोरेज स्पेस को 85% और पैसे को 98% बचा लिया।
4. परिणाम: परीक्षण में कौन पास हुआ?
उन्होंने तीन शीर्ष-स्तरीय AI मॉडल (GPT-5.2, Gemini 3 Pro, और Gemini 3 Flash) का इस नए, कठिन परीक्षण पर परीक्षण किया।
- कठिनाई: नया परीक्षण पुराने "एकल पहेली" परीक्षणों की तुलना में बहुत कठिन था।
- पुराने परीक्षणों पर, रोबोट 80-90% सही थे।
- नए "लाइब्रेरी मेंटेनेंस" परीक्षण पर, सर्वश्रेष्ठ रोबोट केवल 47% सही था।
- विजेता: Gemini 3 Flash सबसे कुशल था। इसने सबसे कम लागत में सबसे अधिक समस्याओं को हल किया। अन्य मॉडलों ने अधिक प्रयास किए (अधिक कन्वर्सेशन टर्न) लेकिन काम पूरा करने से पहले ही अपना "बजट" समाप्त कर दिया।
- सबक: रोबोट अलग-थलग गणितीय समस्याओं को हलने में माहिर हैं, लेकिन वे एक विशाल, विकसित होते कोडबेस को प्रबंधित करने के जटिल कार्य के साथ अभी भी संघर्ष कर रहे हैं।
5. यह क्यों महत्वपूर्ण है
पेपर का दावा है कि यह पहली बार है जब हमारे पास यह परीक्षण करने का एक व्यवस्थित, स्वचालित तरीका है कि क्या AI "प्रमाणों के लिए सॉफ्टवेयर इंजीनियरिंग" कर सकता है।
- यह लक्ष्य को "क्या AI एक गणित की समस्या हल कर सकता है?" से बदलकर "क्या AI एक टीम वातावरण में एक पेशेवर गणितज्ञ के रूप में काम कर सकता है?" पर ले जाता है।
- यह एक समान खेल का मैदान प्रदान करता है जहाँ विभिन्न AI सिस्टमों की तुलना बिल्कुल समान नियमों और उपकरणों का उपयोग करके की जा सकती है।
संक्षेप में: लेखकों ने एक विशाल, अव्यवस्थित गणित पुस्तकालय का एक यथार्थवादी सिमुलेशन और यह परीक्षण करने के लिए नियमों का एक सेट बनाया है कि क्या AI इसे ठीक कर सकता है। उन्होंने पाया कि जबकि AI बेहतर हो रहा है, लेकिन जटिल, वास्तविक दुनिया के गणितीय प्रोजेक्ट्स को स्वतंत्र रूप से प्रबंधित करने के लिए अभी भी उसे लंबा रास्ता तय करना है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।