Construction-Verification: A Benchmark for Applied Mathematics in Lean 4
यह शोध पत्र AMBER को प्रस्तुत करता है, जो अनुप्रयुक्त गणित के लिए एक नया Lean 4 बेंचमार्क है जो सत्यापन से पहले स्पष्ट समाधानों के निर्माण पर जोर देता है, जिससे यह पता चलता है कि सामान्य-उद्देश्य वाले रीजनिंग मॉडल विशिष्ट थ्योरम प्रूवर्स (theorem provers) से बेहतर प्रदर्शन करते हैं क्योंकि बाद वाले में "टैक्टिकल ओवरफिटिंग" (tactical overfitting) की प्रवृत्ति होती है जो जटिल निर्देश पालन में बाधा डालती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को गणित सिखा रहे हैं। लंबे समय तक, हमने इस रोबोट को जो परीक्षण दिए वे इस तरह के थे जैसे उससे पूछना, "क्या इस पहेली का कोई समाधान मौजूद है?" रोबोट "हाँ" कहकर उत्तर दे सकता था, जैसे "मुझे पता है कि यह कहीं न कहीं मौजूद है," बिना कभी उस टुकड़े को वास्तव में खोजे या आपको यह दिखाए कि उसे कैसे जोड़ा जाए।
यह नया शोध पत्र, जिसका शीर्षक "Construction–Verification" (निर्माण-सत्यापन) है, यह तर्क देता है कि अनुप्रयुक्त गणित (applied mathematics - वह गणित जिसका उपयोग पुल बनाने, डिलीवरी रूट को अनुकूलित करने या डेटा का विश्लेषण करने के लिए किया जाता है) के लिए, केवल यह कहना कि "यह मौजूद है" पर्याप्त नहीं है। आपको यह भी चाहिए कि रोबमाट पहले समाधान को वास्तव में बनाए (build), और फिर सिद्ध करे कि वह काम करता है।
यहाँ एक सरल विवरण दिया गया है कि शोधकर्ताओं ने क्या किया और क्या पाया:
1. समस्या: "जादुई छड़ी" बनाम "ब्लूप्रिंट"
पारंपरिक गणितीय परीक्षणों में, एक रोबोट "जादुई छड़ी" (एक गैर-रचनात्मक प्रमाण/non-constructive proof) का उपयोग कर सकता है, समस्या को एक झटके में दूर कर सकता है और घोषित कर सकता है, "एक समाधान मौजूद है!" और आगे बढ़ सकता है।
- पुराना तरीका: "मैंने सिद्ध किया कि एक पुल बनाया जा सकता है।" (लेकिन आपको नहीं पता कि इसे कैसे बनाना है)।
- नया तरीका (AMBER बेंचमार्क): "यहाँ ब्लूप्रिंट और सामग्रियाँ हैं। पुल का निर्माण करें, और फिर मुझे दिखाएं कि यह गिरता क्यों नहीं है।"
शोधकर्ताओं ने एक नया परीक्षण बनाया जिसे AMBER (Applied Mathematics BEnchmark for Reasoning) कहा जाता है। यह AI को एक सख्त दो-चरणीय वर्कफ़्लो का पालन करने के लिए मजबूर करता है:
- निर्माण (Construction): आपको वह कोड या फॉर्मूला लिखना होगा जो वास्तव में उत्तर की गणना करता है।
- सत्यापन (Verification): आपको सिद्ध करना होगा कि आपका उत्तर सही है।
उन्होंने AI का चार कठिन क्षेत्रों पर परीक्षण किया:
- कॉन्वेक्स एनालिसिस (Convex Analysis): एक घुमावदार घाटी में सबसे निचले बिंदु को खोजना।
- ऑप्टिमाइज़ेशन (Optimization): सबसे कुशल योजना बनाना।
- न्यूमेरिकल अलजेब्रा (Numerical Algebra): विशाल ग्रिडों में नंबरों की गणना करना।
- हाई-डायमेंशनल प्रोबेबिलिटी (High-Dimensional Probability): कई चरों (variables) के साथ परिणामों की भविष्यवाणी करना।
2. आश्चर्य: विशेषज्ञों से बेहतर निकले सामान्यज्ञ (Generalists)
शोधकर्ता उम्मीद कर रहे थे कि जो रोबोट विशेष रूप से "गणित के प्रमाणक" (Math Provers) बनने के लिए प्रशिक्षित किए गए हैं, वे इस परीक्षण में सबको पछाड़ देंगे। वे गलत थे।
- विशेषज्ञ (The Specialists - "टैक्टिकल ओवरफिटिंग" का जाल): वे रोबोट जो केवल गणितीय प्रमाणों पर प्रशिक्षित किए गए थे, वे फंस गए। वे केवल चीजों को सिद्ध करने के इतने आदी हो गए थे कि वे चीजों को बनाने के निर्देशों का पालन करना ही भूल गए। यह एक शतरंज के ग्रैंडमास्टर की तरह है जो खेल जीतने में इतना अच्छा है कि वह बोर्ड सेट करना ही भूल गया है। उन्होंने वास्तव में गणना किए बिना ही उत्तर के अस्तित्व को "सिद्ध" करने की कोशिश की, जो इस परीक्षण में विफल रहा।
- सामान्यज्ञ (The Generalists - "स्विस आर्मी नाइफ"): वे रोबोट जो सामान्य तर्क (जैसे DeepSeek या GPT) पर प्रशिक्षित किए गए थे, उन्होंने बहुत बेहतर प्रदर्शन किया। क्योंकि वे विभिन्न संदर्भों में जटिल, बहु-चरणीय निर्देशों का पालन करने के आदी हैं, वे यह कहने में बेहतर थे कि, "ठीक है, पहले मुझे इस फंक्शन को परिभाषित करने की आवश्यकता है, फिर मुझे इसे सिद्ध करने की आवश्यकता है।" वे "बस सिद्ध करने" की आदत में नहीं फंसे।
3. यह परीक्षण वास्तव में कैसा दिखता है
शोध पत्र तीन प्रकार की चुनौतियों का वर्णन करता है जिनका सामना AI को करना पड़ा, जो मानक गणितीय परीक्षणों से भिन्न हैं:
- मूल्यांकन समस्याएं (Evaluation Problems): "क्या के लिए कोई संख्या है जो इसे हल करती है?" पूछने के बजाय, परीक्षण पूछता है, "यहाँ के लिए फॉर्मूला है। इसे कैलकुलेट करने के लिए कोड लिखें।"
- एल्गोरिदम डिज़ाइन (Algorithm Design): यह सिद्ध करने के बजाय कि एक लूप काम करता है, AI को खुद वह लूप लिखना होता है। यह एक शेफ से केक बनाया जा सकता है यह सिद्ध करने के बजाय, सटीक रेसिपी और मिश्रण के निर्देश लिखने के लिए कहने जैसा है।
- रिप्रेजेंटेशन ट्रांसफॉर्मेशन (Representation Transformation): यह एक अव्यवस्थित, वास्तविक दुनिया की समस्या (जैसे "हम इन बसों को कैसे शेड्यूल करें?") को एक साफ, मानक गणितीय प्रारूप (जैसे "यह एक लीनियर प्रोग्रामिंग समस्या है") में अनुवाद करने जैसा है जिसे कंप्यूटर हल कर सके। AI को केवल एक सॉल्वर के रूप में नहीं, बल्कि एक अनुवादक के रूप में कार्य करना होता है।
4. रोबोट कहाँ विफल हुए
जब शोधकर्ताओं ने देखा कि रोबोट क्यों विफल हुए, तो उन्हें चार मुख्य कारण मिले:
- भ्रम/हैलुसिनेशन (Hallucinations - 47%): रोबोटों ने ऐसे गणितीय प्रमेय या लाइब्रेरी के नाम बना दिए जो वास्तव में मौजूद नहीं थे। वे आत्मविश्वास से भरे लग रहे थे लेकिन तथ्य गढ़ रहे थे।
- औपचारिकता त्रुटियां (Formalization Errors - 33%): वे सही गणितीय अवधारणाओं को जानते थे लेकिन उन्हें सख्त कंप्यूटर भाषा (Lean 4) में सही ढंग से अनुवादित नहीं कर सके।
- हार मान लेना (Giving Up - 15%): उन्होंने कोड शुरू किया लेकिन उसे अधूरा छोड़ दिया, कठिन हिस्से को पूरा करने के बजाय "सॉरी" (एक प्लेसहोल्डर) लिख दिया।
- टाइपो (Typos - 5%): साधारण फॉर्मेटिंग की गलतियाँ।
निष्कर्ष
शोध पत्र निष्कर्ष निकालता है कि AI को वास्तव में उपयोगी प्रयुक्त गणित (applied math) के लिए बनाने हेतु, हम केवल इसे "प्रूफ मशीन" के रूप में प्रशिक्षित नहीं कर सकते। हमें ऐसे सिस्टम चाहिए जो पहले समाधानों को बना सकें और फिर उनका सत्यापन कर सकें। वर्तमान में, सामान्य-उद्देश्य वाले AI मॉडल इस "निर्माण" कार्य में विशेष गणित मॉडल की तुलना में बेहतर हैं, क्योंकि विशेषज्ञ सोचने के मामले में बहुत अधिक कठोर (rigid) हो गए हैं।
शोधकर्ता सुझाव देते हैं कि भविष्य के AI को एक हाइब्रिड होना चाहिए: चीजें बनाने के लिए जटिल निर्देशों का पालन करने के लिए पर्याप्त स्मार्ट, और यह सिद्ध करने के लिए पर्याप्त सटीक कि वे सही हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।