← नवीनतम पेपर
🤖 AI

AXIOM: A Trust-First Neuro-Symbolic Execution Architecture for Verifiable Mathematical Reasoning

यह शोध पत्र AXIOM को प्रस्तुत करता है, जो एक 'ट्रस्ट-फर्स्ट' न्यूरो-सिंबोलिक आर्किटेक्चर है जो प्राकृतिक भाषा की समस्याओं को एक नियतात्मक कंप्यूटर-अलजेब्रा-सिस्टम पाइपलाइन में कैनोनालाइज़ करने के लिए केवल भाषा मॉडलों का लाभ उठाता है, जिससे गणितीय बेंचमार्क पर 94.36% शुद्धता और 100% विश्वास (शून्य आत्मविश्वासी त्रुटियाँ) प्राप्त होता है और यह सुनिश्चित होता है कि सिस्टम में सुधार कभी भी पहले से सत्यापित परिणामों को कम नहीं करता है।

मूल लेखक: Alessio Bruno

प्रकाशित 2026-06-02✓ Author reviewed
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Alessio Bruno

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जटिल गणितीय समस्या को हल करने की कोशिश कर रहे हैं, लेकिन एक प्रतिभाशाली लेकिन कभी-कभी अति-आत्मविश्वासी जीनियस से पूछने के बजाय, आप एक बहुत ही व्यवस्थित, थोड़े कठोर, लेकिन अविश्वसनीय रूप से ईमानदार लाइब्रेरियन (पुस्तकालयाध्यक्ष) से पूछ रहे हैं।

यही AXIOM का मूल विचार है, जो "विश्वास-प्रथम" (trust-first) मानसिकता के साथ गणितीय तर्क करने के लिए डिज़ाइन किया गया एक नया सिस्टम है। यह कैसे काम करता है, यहाँ सरल अवधारणाओं और उपमाओं के माध्यम से बताया गया है।

समस्या: "आत्मविश्वासी रूप से गलत" जीनियस

वर्तमान AI मॉडल (जैसे वे जिनसे आप चैट करते हैं) उन प्रतिभाशाली छात्रों की तरह हैं जिन्हें अनुमान लगाना पसंद है। यदि उन्हें उत्तर नहीं पता होता है, तो वे बस एक उत्तर बना सकते हैं और उसे पूरे आत्मविश्वास के साथ प्रस्तुत कर सकते हैं। गणित में, यह खतरनाक है क्योंकि एक गलत उत्तर उपयोगकर्ता को बिल्कुल सही उत्तर जैसा ही दिखाई देता है। आपके पास यह जानने का कोई तरीका नहीं है कि AI झूठ बोल रहा है या केवल भ्रमित (hallucinating) हो रहा है।

AXIOM समाधान: "विशेषज्ञ असेंबली लाइन"

AXIOM सब कुछ शून्य से हल करने वाले जीनियस बनने की कोशिश नहीं करता है। इसके बजाय, यह चार सख्त नियमों वाली एक अत्यधिक कुशल फैक्ट्री असेंबली लाइन की तरह कार्य करता है:

1. सॉर्टर (द रेगेक्स राउटर - The Regex Router)

जब कोई प्रश्न आता है, तो वह सीधे AI के पास नहीं जाता। पहले, वह एक सॉर्टर (Sorter) से टकराता है। इसे एक मेलरूम क्लर्क की तरह समझें जो लिफाफे के आकार को देखता है।

  • यदि पत्र एक "सरल अंकगणित" (simple arithmetic) वाला नोट दिखता है, तो इसे फास्ट लेन (Fast Lane) में भेज दिया जाता है।
  • यदि यह एक "बीजगणित" (algebra) वाला नोट दिखता है, तो इसे बीजगणित स्टेशन (Algebra Station) पर भेज दिया जाता है।
  • यदि आकार किसी भी ज्ञात श्रेणी से मेल नहीं खाता है, तो क्लर्क तुरंत इसे "अज्ञात" (Unknown) का स्टैम्प लगा देता है और रुक जाता है। वह कभी अनुमान नहीं लगाता।

2. ट्रांसलेटर (द AI एज अ "रीराइटर" - The AI as a "Rewriter")

यदि कोई पत्र किसी स्टेशन तक पहुँचता है, तो वह AI से समस्या को हल करने के लिए नहीं कहता। इसके बजाय, AI एक अनुवादक (Translator) के रूप में कार्य करता है।

  • पुराना तरीका: "यह एक शब्द समस्या (word problem) है, कृपया इसे हल करें।" (AI चरणों का अनुमान लगाता है)।
  • AXIM का तरीका: "यह एक शब्द समस्या है। कृपया इसे इस विशिष्ट, संकीर्ण प्रारूप में फिर से लिखें जिसे हमारा कैलकुलेटर समझ सके।"
    AI को स्वयं गणित करने से सख्ती से प्रतिबंधित किया गया है। वह केवल वाक्य को साफ करता है ताकि अगला चरण इसे पूरी तरह से पढ़ सके।

3. कैलकुलेटर (द डिटरमिनिस्टिक इंजन - The Deterministic Engine)

एक बार जब AI समस्या को फिर से लिख देता है, तो वह इसे एक कैलकुलेटर (कंप्यूटर अलजेब्रा सिस्टम) को सौंप देता है। यह एक रोबोट है जो कभी अनुमान नहीं लगाता, कभी थकता नहीं है, और कभी भ्रमित (hallucinate) नहीं होता।

  • यह पुनर्गठित समस्या को लेता है और गणना करता है।
  • यदि यह इसे हल कर सकता है, तो यह उत्तर देता है।
  • यदि यह इसे हल नहीं कर सकता (शायद गणित बहुत अजीब है या इनपुट थोड़ा गलत था), तो यह रुक जाता है और कहता है, "मैं इसकी पुष्टि नहीं कर सकता।"

4. "ईमानदारी" का नियम (एब्स्टेनिंग - The "Honesty" Rule)

यह सबसे महत्वपूर्ण हिस्सा है। अधिकांश प्रणालियों में, यदि कैलकुलेटर विफल हो जाता है, तो सिस्टम फिर से अनुमान लगाने की कोशिश कर सकता है। AXIOM में, "मुझे नहीं पता" कहना एक वैध, संरचित उत्तर है।
यदि लाइन का कोई भी हिस्सा विफल हो जाता है (सॉर्टर ने आकार को नहीं पहचाना, ट्रांसलेटर को फिर से लिखने में असमर्थ रहा, या कैलकुलेटर समस्या को हल नहीं कर सका), तो सिस्टम एक स्पष्ट संदेश आउटपुट करता है: "मैं इससे बच रहा हूँ (I am abstaining)।" यह कभी भी आत्मविश्वासी गलत उत्तर नहीं देता।

परिणाम: गति और सुरक्षा

पेपर परीक्षणों में इस सिस्टम के कुछ प्रभावशाली आंकड़े रिपोर्ट करता है:

  • शून्य आत्मविश्वासी गलतियाँ: हजारों परीक्षणों में, सिस्टम ने कभी भी गलत उत्तर नहीं दिया जो सही उत्तर जैसा दिखता हो। यदि इसने उत्तर दिया, तो वह सत्यापित था।
  • उच्च सटीकता: मानक गणित परीक्षणों पर, इसने लगभग 94% प्रश्नों को सही हल किया।
  • गति: सरल गणित (जैसे "2 + 2") के लिए, यह AI ट्रांसलेटर को पूरी तरह से छोड़ देता है और इसे 1 मिलीसेकंड में हल करता है (पलक झपकने से भी तेज़)। कठिन चीजों के लिए, यह अभी भी एक मानक AI से "चरण-दर-चरण सोचने" के लिए कहने की तुलना में बहुत तेज़ है।
  • लागत: क्योंकि यह AI को लंबे निबंध लिखने या अनुमान लगाने के लिए नहीं कहता, इसलिए इसे चलाना लगभग मुफ्त है।

"फॉरवर्ड डायनेमिक": बिना तोड़े बेहतर होना

लेखक इस बात पर जोर देते हैं कि यह सिस्टम बढ़ने के लिए डिज़ाइन किया गया है।

  • कल्पना कीजिए कि सिस्टम को एक नए प्रकार की गणितीय समस्या का सामना करना पड़ता जिसे वह नहीं जानता। चुपचाप विफल होने या अनुमान लगाने के बजाय, यह लॉग करता है: "मैंने यह आकार देखा, लेकिन मेरे पास इसके लिए कोई स्टेशन नहीं है।"
  • डेवलपर्स फिर उस आकार के लिए विशेष रूप से एक नया "स्टेशन" (एक नया नियम) बना सकते हैं।
  • क्योंकि प्रत्येक स्टेशन अलग-थད་ (isolated) है, एक नया स्टेशन जोड़ना पुराने स्टेशनों को कभी नहीं तोड़ता। यह एक हाईवे में नया लेन जोड़ने जैसा है; इससे मौजूदा लेन में ट्रैफिक जाम नहीं होता है।

सारांश उपमा

एक मानक AI को एक जादूगर के रूप में सोचें जो टोपी से उत्तर निकालता है। कभी-कभी टोपी में खरगोश होता है; कभी-कभी वह एक मोजा होता है, लेकिन जादूगर व्यवहार ऐसे करता है जैसे वह खरगोश ही हो।

AXIOM एक गुणवत्ता नियंत्रण निरीक्षक (Quality Control Inspector) है।

  1. यह जाँचता है कि क्या वस्तु बॉक्स में फिट बैठती है।
  2. यह वस्तु को स्पष्ट रूप से लेबल करता है।
  3. यह इसे मापने वाली मशीन के माध्यम से चलाता है।
  4. यदि मशीन इसे माप नहीं सकती है, तो यह एक "रिजेक्टेड" (Rejected) टैग लगा देता है।

यह जादूगर की तुलना में अधिक वस्तुओं को रिजेक्ट कर सकता है, लेकिन प्रत्येक वस्तु जो "पास" टैग के साथ फैक्ट्री से बाहर निकलती है, वह गारंटीकृत रूप से सही होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →