Counting as a minimal probe of language model reliability
यह शोध पत्र प्रदर्शित करता है कि मानक बेंचमार्क पर मजबूत प्रदर्शन के बावजूद, बड़े भाषा मॉडल विश्वसनीय नियम-पालन के लिए सामान्य तार्किक सक्षमता की कमी रखते हैं, जैसा कि उंगली-गिनती की नकल करने वाले आंतरिक अवस्थाओं के एक सीमित सेट से आगे गिनने में उनकी विफलता से स्पष्ट होता है, न कि वास्तविक प्रक्रियात्मक निष्पादन से।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ एक शोध पत्र "Counting as a Minimal Probe of Language Model Reliability" का सरल अवधारणाओं और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।
मुख्य विचार: "उंगलियों की गिनती" का परीक्षण
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान रोबोट है जो कविता लिख सकता है, जटिल कोड को ठीक कर सकता है और कठिन विज्ञान के सवालों के जवाब दे सकता है। आप उससे पूछते हैं, "इस टोकरी में कितने सेब हैं?" और वह सही उत्तर देता है। आप फिर से एक बड़ी टोकरी के साथ पूछते हैं, और वह अभी भी सही होता है।
लेकिन क्या होगा अगर आप उससे 10,000 सेब गिनने के लिए कहें? या 1,00,000?
यह शोध पत्र एक बहुत ही सरल प्रश्न पूछता है: क्या ये AI मॉडल वास्तव में गिनती करना "जानते" हैं, या वे केवल उन पैटर्न के आधार पर अनुमान लगा रहे हैं जो उन्होंने पहले देखे हैं?
यह पता लगाने के लिए, शोधकर्ताओं ने स्टेबल काउंटिंग कैपेसिटी (SCC) नामक एक परीक्षण बनाया। उन्होंने मॉडल से सभी "स्मार्ट" चीजें (जैसे गणित, इतिहास या कोडिंग) हटा दीं और केवल उन्हें एक लंबी सूची में समान वस्तुओं (जैसे अक्षर "a") को गिनने के लिए कहा।
मुख्य खोज: "उंगलियों" की सीमा
शोधकर्ताओं ने पाया कि जितने भी AI मॉडल उन्होंने टेस्ट किए, वे सभी लंबी सूचियों को गिनने में विफल रहे, भले ही उनका विज्ञापन यह करते हुए किया जाता है कि वे भारी मात्रा में टेक्स्ट को संभालने में सक्षम हैं।
यहाँ वह बताया गया है कि AI के अंदर क्या हो रहा है (एक उपमा के माध्यम से):
- "उंगलियों" की उपमा: कल्पना कीजिए कि AI अपनी उंगलियां उठाकर गिनने की कोशिश कर रहा है। उसके पास उंगलियों की एक सीमित संख्या है (आंतरिक अवस्थाएं/internal states)। जब तक वस्तुओं की संख्या उसकी उंगलियों से कम है, वह सटीक रूप से गिनता है।
- पतन (The Collapse): जैसे ही सूची उसकी "उंगलियों" से लंबी हो जाती है, मॉडल केवल छोटी गलती नहीं करता (जैसे 100 के बजाय 101 कहना)। इसके बजाय, वह पूरी तरह से हार मान लेता है। वह गिनना छोड़ देता है और यादृच्छिक (random), गोल संख्याओं जैसे 500, 1,000, या 2,000 का अनुमान लगाने लगता है। ऐसा लगता है जैसे मॉडल की उंगलियां खत्म हो गईं, उसने गिनती की छड़ी छोड़ दी, और नंबर बोर्ड पर तीर चलाने लगा।
सरल भाषा में मुख्य निष्कर्ष
1. "मैजिक" कॉन्टेक्स्ट विंडो एक झूठ है
AI कंपनियां कहती हैं कि उनके मॉडल "लंबे कॉन्टेक्स्ट" (विशाल दस्तावेज़) पढ़ सकते हैं। यह शोध पत्र दिखाता है कि हालांकि मॉडल एक लंबा दस्तावेज़ पढ़ सकता है, लेकिन वह उसके भीतर सरल नियमों को ट्रैक नहीं कर सकता।
- उपमा: यह उस छात्र की तरह है जो 500 पन्नों की किताब पढ़ सकता है, लेकिन जब उससे पूछा जाए कि "कितनी बार 'the' शब्द आया?", तो उसे कुछ पता नहीं होता। वे टेक्स्ट को प्रोसेस कर सकते हैं, लेकिन वे एक सरल वेरिएबल (variable) को अपने दिमाग में बनाए नहीं रख सकते।
2. अधिक सोचने का समय मदद नहीं करता
शोधकर्ताओं ने मॉडलों को अधिक सोचने का समय देने (test-time compute) या उन्हें "चरण-दर-चरण सोचने" (Chain of Thought) के लिए कहने की कोशिश की।
- परिणाम: इससे कोई लाभ नहीं हुआ। यदि मॉडल की आंतरिक "उंगलियां" खत्म हो गई थीं, तो अधिक गहराई से सोचने से केवल अधिक आत्मविश्वास से भरे दिखने वाले बकवास जवाब ही उत्पन्न हुए। वह उस गिनती को पुनर्गठित नहीं कर सका जिसे वह खो चुका था।
3. "उंगलियां" टेक्स्ट के स्वरूप के प्रति विशिष्ट हैं
शोधकर्ताओं ने गिनी जाने वाली वस्तुओं को बदल दिया (जैसे "a" अक्षर से "b" अक्षर या अलग प्रतीकों में)।
- परिणाम: मॉडल की गिनती की सीमा बदल गई। यह साबित करता है कि मॉडल किसी सार्वभौमिक "गणित मस्तिष्क" का उपयोग नहीं कर रहा है। इसके बजाय, वह विशिष्ट प्रतीकों के लिए विशिष्ट, सीखे गए रास्तों (pathways) का उपयोग कर रहा है। यदि आप प्रतीक बदलते हैं, तो "उंगलियां" भ्रमित हो जाती हैं।
4. "अचानक गिरावट" (The Sudden Drop)
विफलता क्रमिक (gradual) नहीं है। मॉडल एक निश्चित बिंदु तक (मान लीजिए 72 आइटम) पूरी तरह से गिनता है, और फिर तुरंत क्रैश हो जाता है।
- उपमा: यह कार के ईंधन खत्म होने जैसा नहीं है जिससे वह धीरे हो जाती है। यह एक बल्ब की तरह है जो बिल्कुल उस सेकंड तक पूरी तरह काम करता है जब तक कि उसका फिलामेंट टूट नहीं जाता, और फिर वह पूरी तरह से काला (बंद) हो जाता है।
5. वर्तमान परीक्षण इस बात को क्यों मिस कर रहे हैं
मानक परीक्षण (जैसे गणित की परीक्षा या कोडिंग चुनौतियां) बहुत जटिल हैं।
- उपमा: यदि आप जानना चाहते हैं कि कार का इंजन कितना विश्वसनीय है, तो आप केवल रेस ट्रैक पर गाड़ी नहीं चलाते (जहाँ एरोडायनामिक्स और गति एक टूटे हुए पिस्टन को छिपा सकती है)। आपको एक सरल, उबाऊ परीक्षण चलाना होगा, जैसे लिफ्ट पर पहियों को घुमाना। यह शोध पत्र तर्क देता है कि वर्तमान AI बेंचमार्क "रेस ट्रैक" हैं, जो इस तथ्य को छिपा रहे हैं कि "इंजन" (सरल नियमों का पालन करने की क्षमता) टूटा हुआ है।
यह भविष्य के लिए क्या मायने रखता है (शोध पत्र के अनुसार)
शोध पत्र निष्कर्ष निकालता है कि वर्तमान AI मॉडल नाजुक (brittle) हैं। वे कुछ समय के लिए नियमों का पालन करने का ढोंग कर सकते हैं, लेकिन उनके पास लंबे समय तक वेरिएबल्स को ट्रैक करने के लिए एक विश्वसनीय, आंतरिक तंत्र नहीं है।
- समस्या: यदि आप AI को 50 चरणों वाले एक जटिल प्रोजेक्ट की योजना बनाने के लिए कहते हैं, तो यह पहले 10 चरणों को सही ढंग से कर सकता है, लेकिन चरण 50 तक, इसने संभवतः बाधाओं (constraints) की गिनती "खो" दी होगी और अब यह केवल वही बता रहा होगा जो सुनने में अच्छा लगता है।
- समाधान: लेखक सुझाव देते हैं कि इसे ठीक करने के लिए, हम केवल मॉडलों को बड़ा नहीं बना सकते या उन्हें अधिक सोचने का समय नहीं दे सकते। हमें उनके आर्किटेक्चर को बदलने की आवश्यकता है ताकि इसमें स्पष्ट मेमोरी (explicit memory) या स्थिर वेरिएबल्स (persistent variables) (जैसे एक वास्तविक नोटबुक या काउंटर) शामिल हों जो उनकी नाजुक आंतरिक "उंगलियों" पर निर्भर न हों।
सारांश
यह शोध पत्र प्रकट करता है कि जटिल कार्यों में प्रभावशाली प्रदर्शन के बावजूद, लार्ज लैंग्वेज मॉडल्स मौलिक रूप से साधारण, सटीक गिनती करने में खराब हैं। वे जानकारी को ट्रैक करने के लिए सीमित संख्या में आंतरिक "अवस्थाओं" (जैसे उंगलियों) पर निर्भर करते हैं। एक बार जब वह सीमा समाप्त हो जाती है, तो वे नियमों का पालन करना बंद कर देते हैं और अनुमान लगाने लगते हैं। यह सुझाव देता है कि उनकी वर्तमान "बुद्धिमत्ता" एक नाजुक भ्रम है जो लंबे समय तक सरल नियमों का पालन करने के लिए पूछे जाने पर टूट जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।