← नवीनतम पेपर
🤖 AI

Evaluating Research-Level Math Proofs via Strict Step-Level Verification

यह शोध पत्र एक सख्त चरण-स्तरीय (step-level) सत्यापन ढांचे का प्रस्ताव करता है जो विस्तृत संदर्भ बनाए रखने और प्रमेय स्रोतों को सीमित करने के माध्यम से अनुसंधान-स्तरीय गणितीय प्रमाणों में तार्किक त्रुटियों का पता लगाने में वैश्विक मूल्यांकन से बेहतर प्रदर्शन करता है, जो अंततः यह प्रकट करता है कि शेष अस्वीकृतियाँ अक्सर "व्याकरणिक अति-कठोरता" (pedantic hyper-rigor) से उत्पन्न होती हैं जो विशेषज्ञ बेंचमार्क में निहित अस्पष्टताओं को उजागर करती हैं।

मूल लेखक: Yifeng Sun

प्रकाशित 2026-06-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yifeng Sun

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ इस शोध पत्र (paper) का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।

बड़ी समस्या: "स्मूथ टॉकर" (मीठी बातें करने वाला) का जाल

कल्पना कीजिए कि आप एक छात्र द्वारा लिखा गया एक बहुत लंबा और भव्य निबंध पढ़ रहे हैं। छात्र ने बड़े-बड़े शब्दों का प्रयोग किया है, पैराग्राफ एकदम सटीक हैं, और कहानी बहुत सुचारू रूप से बह रही है। आप सोच सकते हैं, "यह तो बहुत बढ़िया लग रहा है!" लेकिन यदि आप बारीकी से देखें, तो आपको बीच में छिपा हुआ एक छोटा सा झूठ मिल सकता है जो पूरी कहानी को बर्बाद कर देता है।

यही तब होता है जब आर्टिफिशियल इंटेलिजेंस (AI) जटिल गणितीय प्रमाणों (math proofs) की जाँच करने की कोशिश करता है। AI एक "ग्लोबल जज" (वैश्विक न्यायाधीश) की तरह व्यवहार करता है। वह पूरे प्रमाण को एक साथ पढ़ लेता है। क्योंकि प्रमाण पेशेवर दिखता है और अच्छी तरह से प्रवाहित होता है, AI धोखा खा जाता है। वह या तो:

  1. हैलुसिनेशन (Hallucination): वह एक नकली प्रमाण को असली मान लेता है क्योंकि वह सुनने में बहुत विश्वसनीय लगता है।
  2. अत्यधिक संदेह (Over-skepticism): वह एक असली प्रमाण को खारिज कर देता है क्योंकि उसमें एक बहुत छोटा, अनकहा विवरण गायब है जिसे एक मानव विशेषज्ञ समझ सकता था।

पेपर इसे "कॉन्टेक्स्ट पॉइजनिंग" (Context Poisoning) कहता है। टेक्स्ट की चिकनी सतह AI की नीचे की दरारों को देखने की क्षमता को "ज़हरीला" बना देती है।

समाधान: "कंस्ट्रक्शन इंस्पेक्टर" (निर्माण निरीक्षक)

पूरे निबंध को एक साथ पढ़ने के बजाय, लेखकों ने एक नया AI एजेंट बनाया है जो एक कंस्ट्रक्शन इंस्पेक्टर या एक फोरेंसिक अकाउंटेंट की तरह काम करता है।

"क्या यह सही लग रहा है?" पूछने के बजाय, यह एजेंट पूछता है, "क्या आप मुझे दिखा सकते हैं कि आपने इस विशिष्ट ईंट को ठीक कैसे बनाया?"

यह एजेंट गणितीय प्रमाण को छोटे-छोटे, व्यक्तिगत चरणों में तोड़ देता है। हर एक चरण के लिए, यह AI को मजबूर करता है कि वह अगले चरण पर बढ़ने से पहले एक विस्तृत "कंस्ट्रक्शन लॉग" (निर्माण लॉग) लिखे।

यह कैसे काम करता है: "थ्री-बॉक्स रूल" (तीन डिब्बों का नियम)

एक एकल चरण की जाँच करने के लिए, AI को तीन "बक्सों" की जानकारी के साथ एक विशिष्ट फॉर्म भरना होगा। इसे एक जासूस द्वारा केस बनाने की तरह समझें:

  1. लोकल कॉन्टेक्स्ट बॉक्स (जो हम यहाँ जानते हैं): इसमें वे तथ्य, परिभाषाएँ और धारणाएँ होती हैं जो प्रमाण के भीतर लिखी गई हैं।
  2. एक्सटर्नल नॉलेज बॉक्स (जिसकी हमें बाहर से आवश्यकता है): यह उन बड़े, प्रसिद्ध गणितीय सिद्धांतों (theorems) के लिए है जिन्हें लेखक अन्य पुस्तकों से उधार ले रहा है। AI को यह साबित करना होगा कि उसने वास्तव में इन सिद्धांतों को खोजा है और वे यहाँ लागू होते हैं।
  3. बैकग्राउंड थ्योरी बॉक्स (बुनियादी नियम): ये वे बहुत छोटे, स्पष्ट गणितीय नियम हैं (जैसे "यदि A=B और B=C, तो A=C") जिन्हें इंसान आमतौर पर छोड़ देते हैं क्योंकि वे इतने स्पष्ट होते हैं।

जादुई ट्रिक:
यदि AI किसी चरण को छोड़ने या तर्क में छलांग लगाने की कोशिश करता है, तो वह फंस जाता है। वह तीन बक्सों को भरने में सक्षम नहीं होता। क्योंकि उसे बक्सों को भरने के लिए विवरण लिखना ही पड़ता है, इसलिए वह तर्क में छिपे छेदों को खोजने के लिए मजबूर हो जाता है। यदि वह यह नहीं समझा पाता कि एक चरण कैसे काम करता है, तो उस चरण को "दोषपूर्ण" (Flawed) घोषित कर दिया जाता है।

परिणाम: चालाकियों को पकड़ना

शोधकर्ताओं ने इस नई पद्धति का परीक्षण 21 बहुत कठिन गणितीय प्रमाणों (कुछ वास्तविक, कुछ नकली) पर किया।

  • पुराना तरीका (ग्लोबल जज): मानक AI नकली प्रमाणों के झांसे में आ गया। उसने सोचा कि "स्मूथ टॉकर" (मीठी बातें करने वाले) असली थे। वह असली प्रमाणों से भी भ्रमित हो गया और उन्हें खारिज कर दिया क्योंकि उनमें सूक्ष्म, अनकहे विवरण गायब थे।
  • नया तरीका (कंस्ट्रक्शन इंस्पेक्टर):
    • नकली को पकड़ना: इसने 100% नकली प्रमाणों को पकड़ लिया। इसने देख लिया कि "स्मूथ टॉकर" वास्तव में झूठ बोल रहे थे क्योंकि वे अपने निर्माण लॉग को पूरा नहीं कर सके।
    • असली प्रमाणों को संभालना: इसने अधिकांश वास्तविक प्रमाणों को सही ढंग से सत्यापित किया। हालाँकि, इसने कभी-कभी एक वास्तविक प्रमाण को इसलिए खारिज कर दिया क्योंकि लेखक ने एक "सीक्रेट हैंडशेक" (एक विशिष्ट परंपरा जिसे केवल उस सूक्ष्म क्षेत्र के विशेषज्ञ ही जानते हैं) का उपयोग किया था। AI उस सीक्रेट हैंडशेक को नहीं जानता था, इसलिए वह बहुत सख्त था।

"पेडेंटिक" (पंडिततापूर्ण) सबक

जब AI ने एक वास्तविक प्रमाण को खारिज किया, तो पेपर एक दिलचस्प बात बताता है। AI ने प्रमाण को इसलिए खारिज नहीं किया क्योंकि गणित गलत था। बल्कि इसलिए किया क्योंकि AI "पेडेंटिक" (बहुत अधिक सख्त/पंडित) हो रहा था।

कल्प_िए कि एक मानव गणितज्ञ एक प्रमाण पढ़ रहा है। वे सोच सकते हैं, "ओह, ज़ाहिर है कि यह सबग्रुप लीनियर है," क्योंकि उस क्षेत्र में सभी इसी तरह बात करते हैं। AI, उस गुप्त परंपरा को न जानते हुए, कहता है, "रुको, आपने यह सिद्ध नहीं किया! यह गलत है!"

पेपर का तर्क है कि यह वास्तव में एक अच्छी बात है। यह दिखाता है कि AI अपना काम कर रहा है: यह उन छिपे हुए अनुमानों को उजागर कर रहा है जिन्हें विशेषज्ञ भी स्वाभाविक मान लेते हैं। यह इंसान को अधिक सटीक होने के लिए मजबूर करता है।

सारांश

यह पेपर गणित की जाँच करने का एक नया तरीका पेश करता है। पूरे प्रमाण को सरसरी नज़र से देखने और शानदार भाषा से धोखा खाने के बजाय, AI एक सख्त निरीक्षक की तरह कार्य करता है, जो हर एक ईंट की एक-एक करके जाँच करता है।

  • पुराना AI: "मेरे हिसाब से तो ठीक है!" (स्मूथ टॉकर के झांसे में आता है)।
  • नया AI: "मुझे इस ईंट का रसीद दिखाओ। तुमने यह सिद्धांत कहाँ से लिया? यह नियम यहाँ क्यों लागू होता है?" (झूठ को पकड़ता है और छिपे हुए अनुमानों को उजागर करता है)।

AI को विवरण लिखने के लिए मजबूर करके, उसके लिए भ्रमित होना या गलत जानकारी देना (hallucinate) बहुत कठिन हो जाता है, जिससे यह दुनिया की सबसे कठिन गणितीय समस्याओं की जाँच करने के लिए एक बहुत बेहतर उपकरण बन जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →