RMA: an Agentic System for Research-Level Mathematical Problems
यह शोध पत्र रिसर्च मैथ एजेंट्स (RMA) को पेश करता है, जो एक ऐसा एजेंटिक फ्रेमवर्क है जो साहित्य ग्राउंडिंग (literature grounding), प्रमाण निर्माण (proof generation) और सत्यापन (verification) के लिए कार्यों को विशिष्ट मॉड्यूल में विभाजित करने वाले एक बहु-भूमिका, पुनरावृत्ति वर्कफ़्लो का उपयोग करके शोध-स्तर की गणितीय समस्याओं पर GPT-5.2R जैसे मजबूत बेसलाइन से बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप गणित की दुनिया में एक बिल्कुल नए, अनसुलझे रहस्य को हल करने की कोशिश कर रहे हैं। यह किसी हाई स्कूल की पाठ्यपुस्तक के पहेली जैसा नहीं है जहाँ उत्तर किताब के पीछे छिपा होता है और आपको बस एक ज्ञात विधि का पालन करना होता है। इसके बजाय, यह एक ऐसे शब्दकोश का नया अध्याय लिखने जैसा है जो अभी तक लिखा ही नहीं गया है। आपको नियम बनाने होंगे, सही शब्द खोजने होंगे और अपने विचारों को सच साबित करना होगा, और यह भी सुनिश्चित करना होगा कि आपने अनजाने में किसी और के काम की नकल नहीं की है।
यह शोध पत्र RMA (रिसर्च मैथ एजेंट्स) पेश करता है, जो AI "रोबोटों" की एक नई टीम है जिसे विशेष रूप से इन कठिन, अनसुलझे गणितीय रहस्यों से निपटने के लिए डिज़ाइन किया गया है।
RMA कैसे काम करता है, यहाँ एक सरल उपमा के माध्यम से समझाया गया है:
समस्या: "अकेला जीनियस" बनाम "रिसर्च टीम"
पिछले AI सिस्टम अकेले जीनियस की तरह थे। वे प्रतियोगिता गणित (जैसे इंटरनेशनल मैथ ओलंपियाड) की समस्याओं को हल करने में बहुत अच्छे थे क्योंकि उन समस्याओं के ज्ञात उत्तर और स्पष्ट मार्ग होते हैं। लेकिन जब वास्तविक, खुले-अंत वाले शोध गणित का सामना करने की बात आती है, तो वे अक्सर अटक जाते हैं, तथ्य बना लेते हैं (hallucinations), या हार मान लेते हैं।
RMA इस खेल को बदल देता है और एक विश्वविद्यालय की लैब में एक पेशेवर रिसर्च टीम की तरह कार्य करता है। एक अकेले रोबोट द्वारा सब कुछ करने के बजाय, RMA काम को एक संरचित टीम प्रयास में विभाजित करता है।
RMA टीम: श्रम का विभाजन
RMA को एक निर्माण दल के रूप में सोचें जो शून्य से एक गगनचुंबी इमारत (प्रमाण/proof) बना रहा है। वे केवल अनुमान नहीं लगाते; वे तीन मुख्य भूमिकाओं के साथ एक सख्त वर्कफ़्लो का पालन करते हैं:
द इनिशियलाइज़र (द आर्किटेक्ट - वास्तुकार):
- कार्य: यह एजेंट बिखरे हुए, भ्रमित करने वाले समस्या विवरण को देखता है और उसे एक स्पष्ट ब्लूप्रिंट (खाके) में बदल देता है। यह बड़ी समस्या को छोटे, प्रबंधनीय लक्ष्यों में तोड़ देता है।
- उपमा: एक वास्तुकार की तरह जो क्लाइंट के अस्पष्ट विचार ("मुझे एक ऐसी इमारत चाहिए जो तैरती हो") को लेता है और पहला सेट ब्लूप्रिंट बनाता है, यह परिभाषित करता है कि वास्तव में क्या बनाया जाना चाहिए।
द प्रोपोज़र्स (द बिल्डर्स एंड इंजीनियर्स - निर्माता और इंजीनियर):
- कार्य: ये एजेंट ब्लूप्रिंट लेते हैं और प्रमाण बनाने की कोशिश करते हैं। यदि वे किसी बाधा (तार्किक अंतराल) से टकराते हैं, तो वे हार नहीं मानते। वे वापस "लाइब्रेरी" में जाते हैं, एक नया टूल या एक समान निर्माण डिजाइन (पाठ्यपुस्तक से एक प्रमेय/theorem) ढूंढते हैं, और एक अलग निर्माण विधि आज़माते हैं।
- उपमा: इंजीनियरों की एक टीम की तरह जो विभिन्न सामग्रियों और डिजाइनों को आज़मा रहे हैं। यदि एक बीम टूट जाता है, तो वे केवल यह नहीं कहते कि "यह असंभव है"; वे लाइब्रेरी में एक मजबूत स्टील मिश्र धातु या एक बेहतर डिजाइन की तलाश करते हैं और फिर से प्रयास करते हैं।
द वेरीफायर (द इंस्पेक्टर्स - निरीक्षक):
- कार्य: ये एजेंट सख्त बिल्डिंग इंस्पेक्टरों की तरह कार्य करते हैं। वे कुछ भी निर्माण नहीं करते; वे केवल काम की जाँच करते हैं। वे तर्क में दरारें, छूटे हुए चरण या नकली सामग्री देखते हैं। यदि उन्हें कोई गलती मिलती है, तो वे निर्माताओं को इसे ठीक करने के लिए वापस भेज देते हैं।
- उपमा: एक सुरक्षा निरीक्षक की तरह जो इमारत में घूमता है, दीवारों को थपथपाता है और ब्लूप्रिंट की जाँच करता है। यदि उसे कोई दोष मिलता है, तो वह एक "फिक्स-इट" टिकट जारी करता है, और निर्माताओं को आगे बढ़ने से पहले उसे ठीक करना होता है।
"साझा नोटबुक" (संरचित स्मृति)
RMA का एक प्रमुख हिस्सा यह है कि हर कोई एक डिजिटल नोटबुक (एक साझा स्मृति) साझा करता है।
- आर्किटेक्ट ब्लूप्रिंट लिखता है।
- बिल्डर्स अपने निर्माण नोट्स और नए विचार जोड़ते हैं।
- इंस्पेक्टर्स अपने आलोचनात्मक नोट्स लिखते हैं।
- महत्वपूर्ण रूप से: कोई भी जो पहले हुआ है उसे मिटाता नहीं है। वे बस नए पन्ने जोड़ते हैं। इसका मतलब है कि टीम अपनी हर गलती और मिले हुए हर टूल को याद रखती है, ताकि वे गलतियों को न दोहराएं।
"फेयर प्ले" के नियम
यह सुनिश्चित करने के लिए कि AI उत्तर देखकर नकल न करे, RMA में एक फेयर कंपैरिजन मॉड्यूल है।
- यह एक सख्त रेफरी की तरह कार्य करता है जो उन सभी वेबसाइटों के दरवाजे बंद कर देता है जहाँ समाधान मिल सकता है।
- यह सुनिश्चित करता है कि AI केवल उन पुरानी पाठ्यपुस्तकों और शोध पत्रों को देखे जो समस्या के बनने से पहले प्रकाशित हुए थे, जिससे AI को वास्तव में सोचने और खोज करने के लिए मजबूर किया जा सके, न कि केवल कॉपी-पेस्ट करने के लिए।
परिणाम: क्या यह काम आया?
शोधकर्ताओं ने RMA का परीक्षण "फर्स्ट प्रूफ" बेंचमार्क पर किया, जिसमें प्रसिद्ध गणितज्ञों द्वारा दिए गए 10 वास्तविक, अनसुलझे गणित के प्रश्न शामिल हैं।
- प्रतियोगिता: उन्होंने RMA की तुलना अन्य शीर्ष AI सिस्टम के साथ की, जिनमें "GPT-5.2R" (OpenAI से) और "Aletheia" (Google DeepMind से) शामिल हैं।
- परिणाम:
- Aletheia किसी भी समस्या को हल नहीं कर सका।
- GPT-5.2R ने 10 में से 3 समस्याओं को हल किया, लेकिन कभी-कभी छोटी तार्किक त्रुटियां कीं या कमजोर उत्तर दिए।
- RMA ने 10 में से 8 समस्याओं को हल किया।
- इससे भी महत्वपूर्ण बात यह है कि जब मानव गणितज्ञों ने प्रमाणों की समीक्षा की, तो उन्होंने कहा कि RMA के समाधान दूसरों की तुलना में अधिक तार्किक, स्पष्ट और विश्वसनीय थे।
निचोड़
पेपर का दावा है कि कठिन गणित को हल करना एक स्मार्ट "दिमाग" (एक शक्तिशाली एकल AI मॉडल) होने के बारे में नहीं है; यह एक बेहतर प्रक्रिया के बारे में है। काम को विशिष्ट भूमिकाओं (आर्किटेक्ट, बिल्डर, इंस्पेक्टर) में तोड़ने, उन्हें एक साझा नोटबुक देने और उन्हें बार-बार अपने काम की जाँच करने के लिए मजबूर करके, RMA उन समस्याओं से निपट सकता है जिनसे सबसे बुद्धिमान एकल AI भी नहीं निपट सकता।
यह अंधेरे में अकेले घर बनाने के लिए एक व्यक्ति को बुलाने और एक टीम को ब्लूप्रिंट, एक लाइब्रेरी और एक सुरक्षा निरीक्षक के साथ नियुक्त करने के बीच का अंतर है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।