QED: An Open-Source Multi-Agent System for Generating Mathematical Proofs on Open Problems
यह शोध पत्र QED को प्रस्तुत करता है, जो एक ओपन-सोर्स मल्टी-एजेंट सिस्टम है जिसे एक विशेष आर्किटेक्चर का उपयोग करके LLM बेंचमार्क प्रदर्शन और अनुसंधान-स्तरीय गणित के बीच के अंतर को पाटने के लिए डिज़ाइन किया गया है जो सात विशिष्ट विफलता मोडों को संबोधित करता है, और इसने एप्लाइड एनालिसिस और PDEs में पांच विशेषज्ञ-प्रदत्त खुले प्रश्नों में से तीन के लिए मौलिक और गैर-तुच्छ प्रमाण सफलतापूर्वक उत्पन्न किए हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
द "मैथ डिटेक्टिव" सिस्टम: AI कैसे वास्तविक रहस्यों को सुलझाना सीख रहा है
कल्पना कीजिए कि आपके पास एक प्रतिभाशाली छात्र है जो बहुविकल्पीय परीक्षाओं (multiple-choice tests) और पाठ्यपुस्तक के सवालों को हल करने में अद्भुत है। वह निर्देशों का पूरी तरह से पालन कर सकता है और जो उसने सीखा है उसे दोहरा सकता है। लेकिन यदि आप उस छात्र को एक वास्तविक जासूसी मामले से जुड़ा एक बिल्कुल नया, अनसुलझा रहस्य थमा दें—ऐसा कुछ जिसे इतिहास में पहले कभी किसी ने नहीं सुलझाया—तो वह शायद सुन्न हो जाएगा। वह एक "नकली" उत्तर देने की कोशिश कर सकता है, किताब से कोई समान मामला कॉपी कर सकता है, या बस अनुमान लगाने के चक्र में फंसकर रह जाएगा।
गणित में AI की वर्तमान स्थिति यही है। अधिकांश AI "होमवर्क" वाले सवालों को हल कर सकते हैं, लेकिन वे "रिसर्च" वाले सवालों के लिए संघर्ष करते हैं—वे गहरे, मौलिक प्रश्न जिन्हें हल करने में गणितज्ञ वर्षों बिता देते हैं।
शोधकर्ताओं के एक समूह ने अभी-अभी QED नामक एक नया सिस्टम जारी किया है। QED को एक एकल "स्मार्ट छात्र" के रूप में नहीं, बल्कि एक अत्यधिक संगठित डिटेक्टिव एजेंसी (जासूसी एजेंसी) के रूप में समझें।
समस्या: क्यों "स्मार्ट" AI वास्तविक गणित में विफल रहता है
शोधकर्ताओं ने पाया कि जब आप एक मानक AI को कठिन गणितीय समस्या हल करने के लिए कहते हैं, तो वह आमतौर पर सात विशिष्ट, अनुमानित तरीकों से विफल होता है। वास्तविक जीवन में ये विफलताएं इस प्रकार दिखती हैं:
- द इको चैंबर (संदर्भ संदूषण/Context Contamination): AI अपने काम की जांच करने की कोशिश करता है, लेकिन क्योंकि यह एक ही "मस्तिष्क" है, इसलिए यह खुद को विश्वास दिला देता है कि उसकी गलतियाँ वास्तव में सही हैं। यह एक ऐसे व्यक्ति की तरह है जो आईने में खुद से बहस कर रहा है और अपने ही झूठ पर विश्वास कर रहा है।
- द फेक रेफरेंस (साइटेशन हैलुसिनेशन/Citation Hallucination): AI ऐसे "तथ्य" या "प्रमेय" (theorems) बना देता है जो अस्तित्व में ही नहीं हैं ताकि उसका तर्क बेहतर सुनाई दे। यह एक ऐसे वकील की तरह है जो ऐसे कानून का हवाला देता है जो कभी लिखा ही नहीं गया था।
- द "स्किप द हार्ड पार्ट" मूव (हैंड-वेविंग/Hand-Waving): जब गणित वास्तव में कठिन हो जाता है, तो AI कहता है, "यह स्पष्ट है कि X, Y का अनुसरण करता है," बिना इसे वास्तव में सिद्ध किए। यह एक ऐसे शेफ की तरह है जो कहता है, "अब, इसे स्वादिष्ट बनाने के लिए बस थोड़ा जादू डालें," बजाय इसके कि वह वास्तव में रेसिपी का पालन करे।
- द नर्वस प्लानर (अस्थिर योजनाएं/Unstable Plans): जैसे ही AI किसी बाधा से टकराता है, वह अपनी पूरी रणनीति को कूड़े में फेंक देता है और एक नई रणनीति शुरू कर देता है, एक ऐसे हाइकर की तरह भटकता है जो हर बार पत्थर देखने पर अपनी दिशा बदल लेता है।
- द डिस्ट्रैक्टेड इंस्पेक्टर (अकेंद्रित सत्यापन/Unfocused Verification): जब एक प्रमाण (proof) की जांच करने के लिए कहा जाता है, तो AI एक साथ सब कुछ जांचने की कोशिश करता है—व्याकरण, तर्क, साइटेशन और गणित—और अंत में वह बड़े दोषों को मिस कर देता है क्योंकि वह बहुत अधिक बिखरा हुआ होता है।
- द गोलपोस्ट शिफ्टर (समस्या संशोधन/Problem Modification): समस्या को आसान बनाने के लिए, AI सूक्ष्म रूप से प्रश्न को बदल देता है। यह एक ऐसे धावक की तरह है जो मैराथन के बीच में ही तय कर लेता है कि फिनिश लाइन वास्तव में 10 मील करीब है।
- द सिंगल-ब्रेन लिमिट (सिंगल-मॉडल बॉटलनेक/Single-Model Bottleneck): प्रत्येक AI की अपनी "अंध बिंदु" (blind spots) होती हैं। यदि आप केवल एक ही AI का उपयोग करते हैं, तो आप उसकी विशिष्ट कमजोरियों तक ही सीमित रह जाते हैं।
समाधान: द QED "डिटेक्टिव एजेंसी"
एक अकेले AI द्वारा सब कुछ करने के बजाय, QED विशेष एजेंटों की एक टीम बनाता है जो एक-दूसरे की निगरानी करते हैं। वे जाँच और संतुलन (checks and balances) की एक सख्त प्रणाली का उपयोग करते हैं:
- पृथक भूमिकाएं (The Separated Roles): "प्रूवर" (वह जो गणित लिख रहा है) और "वेरिफायर" (वह जो इसकी जांच कर रहा है) को अलग-अलग कमरों में रखा जाता है। उन्हें एक-दूसरे से बात करने की अनुमति नहीं है, ताकि वेरिफायर को प्रूवर के तर्क से "धोखा" न दिया जा सके।
- दो-चरणीय निरीक्षण (The Two-Stage Inspection): एक प्रमाण को स्वीकार करने से पहले, इसे दो गहन निरीक्षणों से गुजरना पड़ता है। पहले, एक स्ट्रक्चरल इंस्पेक्टर यह जांचता है कि क्या प्रमाण का "कंकाल" ठोस है (क्या उन्होंने प्रश्न बदल दिया? क्या साइटेशन वास्तविक हैं?)। यदि कंकाल पूर्ण है, तभी यह डिटेल्ड इंस्पेक्टर के पास जाता है, जो हर एक छोटे गणितीय चरण की जांच करता है।
- "नो शॉर्टकट" नियम (The "No Shortcuts" Rule): QED AI को प्रमाण के सबसे कठिन हिस्सों को "टैग" करने के लिए मजबूर करता है। यदि AI "स्पष्ट रूप से" जैसे अस्पष्ट शब्दों का उपयोग करने की कोशिश करता है, तो सिस्टम इसे फ्लैग करता है और कहता है, "नहीं, अपना काम दिखाओ!"
- मास्टर स्ट्रैटेजिस्ट (डिकंपोजिशन मोड/Decomposition Mode): सबसे कठिन समस्याओं के लिए, QED एक "मैनेजर" एजेंट का उपयोग करता है। यह मैनेजर विशाल समस्या को छोटे, प्रबंधनीय चरणों के एक "मानचित्र" में तोड़ देता है। यदि कोई चरण विफल होता है, तो मैनेजर निर्णय लेता है: "क्या हमें बस इस एक चरण को ठीक करने की आवश्यकता है, या हमें पूरे मानचित्र को फिर से बनाने की आवश्यकता है?"
परिणाम: वास्तविक खोजें
शोधकर्ताओं ने QED का परीक्षण केवल गणित के होमवर्क पर नहीं किया; उन्होंने इसे भौतिकी (physics) और फ्लूइड डायनेमिक्स (द्रव गतिज विज्ञान - जो तरल पदार्थों और गैसों के संचलन को समझने के लिए उपयोग किया जाता है) के वास्तविक विशेषज्ञों से प्राप्त पाँच अनसुलझे प्रश्नों के साथ टेस्ट किया।
परिणाम आश्चर्यजनक था: QED ने पाँच में से तीन समस्याओं को सफलतापूर्वक हल किया।
इससे भी महत्वपूर्ण बात यह है कि ये केवल "सही" उत्तर नहीं थे—ये मौलिक खोजें थीं। एक मामले में, AI ने एक ऐसा गणितीय संबंध खोज निकाला जिसे मानव विशेषज्ञों ने भी महसूस नहीं किया था। इसने केवल समस्या को हल नहीं किया; इसने गणित को देखने का एक नया तरीका भी प्रकट किया।
मुख्य निष्कर्ष (The Bottom Line)
QED दिखाता है कि "आर्टिफिशियल इंटेलिजेंस" के "साइंटिफिक इंटेलिजेंस" बनने का मार्ग केवल AI को "स्मार्ट" बनाने के बारे में नहीं है—यह जाँच, संतुलन और विशिष्ट भूमिकाओं के एक बेहतर सिस्टम के निर्माण के बारे में है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।