MathAtlas: A Benchmark for Autoformalization in the Wild
यह शोध पत्र MathAtlas प्रस्तुत करता है, जो 103 पाठ्यपुस्तकों से लगभग 52,000 स्नातक-स्तरीय गणितीय अवधारणाओं से युक्त पहला बड़े-स्तर का ऑटोफॉर्मलाइजेशन बेंचमार्क है, जो जटिल, निर्भरता-युक्त शोध गणित को संभालने में वर्तमान मॉडलों की अत्यधिक कठिनाई को प्रकट करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक शानदार अनुवादक है जो मानवीय कहानियों को "Lean" नामक एक सख्त, कंप्यूटर-पठनीय भाषा में बदल सकता है। लंबे समय तक, इस अनुवादक का परीक्षण केवल सरल कहानियों पर किया गया है—जैसे हाई स्कूल की गणित की समस्याएं या बुनियादी पहेलियाँ। कंप्यूटर इसे आसानी से अनुवाद कर सकता था क्योंकि नियम सरल थे और कंप्यूटर ने पहले भी ऐसे नियमों को देखा था।
लेकिन क्या होता है जब आप इस अनुवादक से एक जटिल, स्नातक-स्तर (graduate-level) के शोध पत्र का अनुवाद करने के लिए कहते हैं? यही वह समस्या है जिसे MathAtlas हल करता है।
यहाँ इस शोध पत्र का एक सरल विवरण दिया गया, जिसमें कुछ रोजमर्रा के उपमाओं (analogies) का उपयोग किया गया है:
1. समस्या: "लाइब्रेरी" बहुत बड़ी है
कल्पना कीजिए कि आप एक ब्लूप्रिंट (एक गणित की पाठ्यपुस्तक) के आधार पर एक घर (एक औपचारिक प्रमाण/formal proof) बनाने की कोशिश कर रहे हैं।
- पुराने बेंचमार्क: पिछले परीक्षणों में अनुवादक से केवल एक छोटा सा शेड बनाने के लिए कहा गया था। निर्माण सामग्री टूलबॉक्स में ही मौजूद थी, और निर्देश छोटे थे।
- वास्तविक दुनिया: स्नातक स्तर की गणित एक गगनचुंबी इमारत बनाने की तरह है। ऊपरी मंजिल बनाने के लिए आपको 50वीं मंजिल की आवश्यकता है। 50वीं मंजिल बनाने के लिए आपको 49वीं की आवश्यकता है, और इसी तरह, नीचे नींव तक।
- मुद्दा: उन्नत गणित में, "नींव" (परिभाषाएं और सिद्धांत) अक्सर कंप्यूटर की भाषा में अभी तक बनाई नहीं गई होती है। यदि अनुवादक को "Lie Algebra" (एक जटिल अवधारणा) की परिभाषा नहीं पता है, तो वह उस प्रमेय (theorem) का अनुवाद नहीं कर सकता जो इसका उपयोग करता है।
2. समाधान: MathAtlas (एक "जंगली" मानचित्र)
लेखकों ने MathAtlas बनाया, जो एक विशाल नया टेस्ट सेट है।
- पैमाना: उन्होंने 103 स्नातक-स्तरीय गणित की पाठ्यपुस्तकों को खंगाला। यह एक लाइब्रेरी के 52,000 पृष्ठों की उन्नत गणित को एक डिजिटल मानचित्र में बदलने जैसा है।
- "डिपेंडेंसी ग्राफ" (Dependency Graph): यह इस शोध पत्र की महाशक्ति है। एक "चूज़ योर ओन एडवेंचर" (Choose Your Own Adventure) पुस्तक की कल्पना करें जहाँ प्रत्येक पृष्ठ पर अन्य पृष्ठों की ओर संकेत करने वाले तीर हैं जिन्हें आपको पहले पढ़ना आवश्यक है। MathAtlas ये तीर खींचता है। यह दिखाता है कि Proposition 15 को समझने के लिए, आपको पहले Dedekind Rings को समझना होगा, जिसके लिए बदले में Prime Ideals को समझना आवश्यक है।
- यह क्यों महत्वपूर्ण है: यह AI को केवल एक वाक्य का अनुवाद करने के लिए नहीं, बल्कि यह सोचने के लिए मजबूर करता है: "क्या मेरे पास उपकरण हैं? यदि नहीं, तो क्या मैं पहले उन उपकरणों को खोज या बना सकता हूँ?"
3. परिणाम: AI कीचड़ में फँस गया है
लेखकों ने MathAtlas पर उपलब्ध सबसे स्मार्ट AI मॉडलों का परीक्षण किया, और परिणाम विनम्र करने वाले थे।
- स्कोर: सबसे अच्छे AI को भी प्रमेय कथनों (theorem statements) में 10% से भी कम सफलता मिली। परिभाषाओं के लिए, यह लगभग 16% था।
- "डेप्थ" (गहराई) का जाल: जितना गहरा "डिपेंडेंसी ट्री" (अर्थात, परिभाषाओं को खोजने के लिए जितने अधिक चरणों में पीछे जाना पड़ता है), AI का प्रदर्शन उतना ही खराब होता गया।
- उपमा: यदि AI को एक वाक्य का अनुवाद करने के लिए 10 पिछली अवधारणाओं को देखना पड़ता है, तो वह भ्रमित हो जाता है और हार मान लेता है। सबसे कठिन समस्याओं पर (जहाँ डिपेंडेंसी ट्री सबसे गहरा था), AI केवल 2.6% सही था।
- "Mathlib" प्रभाव: AI का प्रदर्शन थोड़ा बेहतर था जब वह अवधारणा जिसे उसे अनुवाद करना था, पहले से ही "Mathlib" नामक एक प्रसिद्ध लाइब्रेरी में मौजूद थी (जो एक पूर्व-निर्मित टूलबॉक्स की तरह है जिसे AI ने संभवतः पढ़ा है)। यदि वह अवधारणा नई थी और उस लाइब्रेरी में नहीं थी, तो AI को बहुत अधिक संघर्ष करना पड़ा।
4. "विश्वास" की परीक्षा (MA-Align)
शोध पत्र ने MA-Align नामक एक नया परीक्षण भी बनाया।
- समस्या: कभी-कभी एक AI एक वाक्य को ऐसे कोड में अनुवाद करता है जो देखने में एकदम सही लगता है और बिना किसी त्रुटि के चलता है, लेकिन वास्तव में इसका अर्थ मूल गणित से बिल्कुल अलग होता है। यह "बिल्ली चटाई पर बैठी है" को एक कंप्यूटर प्रोग्राम में अनुवाद करने जैसा है जो कहता है "कुत्ता पिज्जा खा गया।" प्रोग्राम काम करता है, लेकिन वह गलत है।
- परीक्षण: उन्होंने AI जजों से पूछा कि क्या अनुवाद "वफादार" (अर्थ के प्रति सच्चा) था। उन्होंने पाया कि सबसे अच्छे AI जज भी अक्सर धोखा खा जाते थे, विशेष रूप से जटिल स्नातक-स्तरीय परिभाषाओं के मामले में।
मुख्य निष्कर्ष
शोध पत्र यह निष्कर्ष निकालता है कि जबकि AI सरल गणित में अच्छा हो रहा है, यह वर्तमान में जटिल, वास्तविक दुनिया की स्नातक गणित को अनुवाद करने में बहुत खराब है। मुख्य बाधा केवल शब्दों का अनुवाद करना नहीं है; बल्कि विचारों के बीच के विशाल संबंधों को समझना और प्रमेय (घर) बनाने से पहले आवश्यक "उपकरणों" (परिभाषाओं) को बनाने का ज्ञान होना है।
MathAtlas अब सभी के लिए एक चुनौती पाठ्यक्रम के रूप में उपयोग करने के लिए खुला है ताकि AI को इन गहरे, जटिल निर्भरताओं को संभालने में मदद मिल सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।