Evaluating the Architectural Reasoning Capabilities of LLM Provers via the Obfuscated Natural Number Game
यह शोध पत्र "आर्किटेक्चरल रीजनिंग" (वास्तुकला संबंधी तर्क)—अर्थात बिना किसी अर्थपूर्ण संकेतों के केवल स्थानीय अभिगृहितों का उपयोग करके प्रमाणों को संश्लेषित करने की क्षमता—का मूल्यांकन करने के लिए 'ऑबफस्केटेड नेचुरल नंबर गेम' को एक बेंचमार्क के रूप में प्रस्तुत करता है और यह प्रदर्शित करता है कि जहाँ सामान्य लार्ज लैंग्वेज मॉडल्स अस्पष्टता (obfuscation) के तहत प्रदर्शन में गिरावट का सामना करते हैं, वहीं विशिष्ट रीजनिंग मॉडल्स अपनी सटीकता बनाए रखते हैं, जिससे वास्तविक तार्किक तर्क और पैटर्न मिलान के बीच अंतर स्पष्ट होता है।
मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक छात्र को गणित की पहेली हल करना सिखा रहे हैं। आमतौर पर, पहेली में "जोड़" (Addition), "गुणा" (Multiplication), या "सक्सेसर" (Successor) जैसे सहायक लेबल होते हैं। एक होशियार छात्र वास्तव में खेल के नियमों को नहीं समझ सकता है; वह केवल "जोड़" शब्द को पहचान सकता है और उस ट्रिक को याद कर सकता है जिसे उसने पहले देखा है।
यह शोध पत्र एक कठिन प्रश्न पूछता है: क्या ये AI मॉडल वास्तव में गणित कर रहे हैं, या वे केवल शब्दों को पहचानने में अच्छे हैं?
यह जानने के लिए, शोधकर्ताओं ने नेचुरल नंबर गेम (Natural Number Game) नामक एक प्रसिद्ध गणितीय खेल का एक "आंखों पर पट्टी बांधा हुआ" (blindfolded) संस्करण बनाया। उन्होंने इसे कैसे किया और उन्हें क्या मिला, इसका सरल विवरण यहाँ दिया गया है:
प्रयोग: "एलियन" गेम
शोधकर्ताओं ने एक मानक गणितीय खेल लिया जहाँ हर नियम और संख्या का एक स्पष्ट नाम होता है (जैसे add या zero)। फिर, उन्होंने इस पर एक "स्कैम्बलर" (scrambler) चलाया। उन्होंने हर अर्थपूर्ण नाम को यादृच्छिक, निरर्थक स्ट्रिंग्स जैसे x9z, q22, और b7a से बदल दिया।
- मूल खेल: आप
addदेखते हैं और जानते हैं कि इसका अर्थ जोड़ है। - स्कैम्बल किया हुआ खेल (Obfuscated NNG): आप
x9zदेखते हैं और आपको पता नहीं होता कि इसका क्या मतलब है। आप अनुमान नहीं लगा सकते; आपको यह देखना होगा कि टुकड़े आपस में कैसे जुड़ते हैं (तर्क/लॉजिक) ताकि आप समझ सकें किx9zक्या करता है।
यह उस चीज़ का परीक्षण करता है जिसे लेखक "आर्किटेक्चरल रीजनिंग" (Architectural Reasoning) कहते हैं। यह केवल संरचनात्मक ब्लूप्रिंट (तर्क) का उपयोग करके समाधान बनाने की क्षमता है, दरवाजों पर लगे सहायक संकेतों (नामों) को अनदेखा करते हुए।
परिणाम: "लेटेंसी टैक्स" (Latency Tax)
शोधकर्ताओं ने मूल खेल और स्कैम्बल किए गए खेल दोनों पर कई शीर्ष स्तर के AI मॉडलों का परीक्षण किया। उन्होंने दो मुख्य बातें पाईं:
1. "यूनिवर्सल लेटेंसी टैक्स" (हर कोई धीमा हो जाता है)
जब नाम स्कैबल कर दिए गए, तो हर एक AI मॉडल को समस्याओं को हल करने में अधिक समय लगा।
- उपमा: कल्पना कीजिए कि आप एक परिचित कॉफी शॉप की ओर जा रहे हैं। आप संकेतों, सड़कों के नाम और लैंडमार्क को जानते हैं। अब, कल्पना कीजिए कि किसी ने सभी संकेतों पर पेंट कर दिया और सड़कों का नाम यादृच्छिक अक्षरों से बदल दिया। आप अभी भी गाड़ी चलाना जानते हैं, लेकिन आपको हर मोड़ पर रुकना पड़ता है, मानचित्र देखना पड़ता है और अधिक गहराई से सोचना पड़ता है। आप अंततः पहुँच जाते हैं, लेकिन इसमें अधिक समय लगता है।
- निष्कर्ष: AI मॉडलों को हर समस्या के लिए इस "मानसिक मानचित्र पुनर्निर्माण" (mental map reconstruction) को करना पड़ा। वे केवल स्मृति (memory) पर निर्भर नहीं रह सके; उन्हें तर्क के कच्चे स्वरूप (raw logic) को प्रोसेस करना पड़ा, जिसमें समय लगा।
2. "रीजनिंग बनाम रोट" (Reasoning vs. Rote) विभाजन
जबकि सभी धीमे हो गए, मॉडलों की सटीकता (accuracy) दो अलग-अलग समूहों में विभाजित हो गई:
- "जनरल" मॉडल (जैसे, GPT-4o, Claude): ये मॉडल उन छात्रों की तरह हैं जो फ्लैशकार्ड रटने में माहिर हैं। जब नाम स्कैबल कर दिए गए, तो वे भ्रमित हो गए। उनकी सफलता दर काफी कम हो गई।
- इसका अर्थ है: वे पहेली को हल करने के लिए "संकेतों" (नामों) पर निर्भर थे। जब संकेत गायब हो गए, तो वे रास्ता नहीं ढूंढ पाए।
- "रीजनिंग" मॉडल (जैसे, DeepSeek-R1, GPT-5, DeepSeek-Prover-V2): ये मॉडल उन छात्रों की तरह हैं जो वास्तव में खेल के नियमों को समझते हैं। भले ही नाम स्कैबल कर दिए गए हों, उनकी सफलता दर बिल्कुल वैसी ही रही।
- इसका अर्थ है: उन्हें लेबल की आवश्यकता नहीं थी। उन्होंने तार्किक संरचना (आर्किटेक्चर) को देखा और समाधान को पहले की तरह ही कुशलता से निकाल लिया।
निष्कर्ष
शोध पत्र यह निष्कर्ष निकालता है कि ऐसे AI के बीच वास्तविक अंतर है जो केवल पैटर्न मिलाते हैं (जैसे "add" शब्द को पहचानना) और ऐसे AI के बीच जो वास्तव में तर्क संरचनाओं के माध्यम से सोच सकते हैं।
- जनरल मॉडल उन पर्यटकों की तरह हैं जिन्हें नामों के साथ गाइडबुक की आवश्यकता होती है। यदि आप गाइडबुक छीन लेते हैं, तो वे खो जाते हैं।
- रीजनिंग मॉडल उन आर्किटेक्ट्स की तरह हैं जो ब्लूप्रिंट पढ़ सकते हैं। भले ही इमारत पर कोई साइन न हो, वे फिर भी समझ सकते हैं कि दीवारें और बीम एक दूसरे में कैसे फिट बैठते हैं।
यह अध्ययन साबित करता है कि जबकि सभी AI मॉडल बिना लेबल के सोचने के लिए मजबूर होने पर "धीमे" हो जाते हैं, केवल वास्तविक "रीजनिंग" मॉडल ही इस "एलियन" वातावरण में अपनी सटीकता को उच्च बनाए रख सकते हैं। यह सुझाव देता है कि भविष्य में गणित की नई खोज (जहाँ अभी तक कोई नाम या लेबल मौजूद नहीं है) के लिए, हमें केवल पैटर्न मैचिंग वाले नहीं, बल्कि रीजनिंग-केंद्रित मॉडलों की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।