Diagnosing CFG Interpretation in LLMs
यह शोधपत्र नवीन संदर्भ-मुक्त व्याकरण (context-free grammars) के इन-कॉन्टेक्स्ट व्याख्याकार के रूप में LLMs का मूल्यांकन करने के लिए RoboGrid फ्रेमवर्क प्रस्तुत करता है, जो यह प्रकट करता है कि जबकि मॉडल अक्सर सतही वाक्य संरचना (surface syntax) बनाए रखते हैं, वे शुद्ध प्रतीकात्मक आगमन (pure symbolic induction) के बजाय कीवर्ड-आधारित अर्थ संबंधी बूटस्ट्रैपिंग (keyword-based semantic bootstrapping) पर निर्भरता के कारण संरचनात्मक जटिलता के तहत पदानुक्रमित क्षरण (hierarchical degradation) और अर्थ संबंधी विफलता का शिकार होते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने एक शानदार, दुनिया घूमने वाले शेफ (एक लार्ज लैंग्वेज मॉडल या LLM) को खाना बनाने के लिए काम पर रखा है। आमतौर पर, यह शेफ अद्भुत होता है क्योंकि उसने पहले लाखों बार खाना बनाया है। उसे पता है कि सिर्फ नाम सुनकर "स्पैगेटी कारबोनारा" या "बीफ स्ट्यू" कैसे बनाया जाता है।
लेकिन आज, आप उसे कोई जाना-पहचाना रेसिपी नहीं देते। इसके बजाय, आप उसे एक बिल्कुल नई, एलियन कुकबुक थमा देते हैं जो एक ऐसी भाषा में लिखी गई है जिसे उसने पहले कभी नहीं देखा—जिसमें बनावटी शब्द और अजीब नियम हैं। आप उससे केवल इन नए निर्देशों के आधार पर एक व्यंजन बनाने के लिए कहते हैं।
यह शोध पत्र, जिसका शीर्षक "Diagnosing CFG Interpretation in LLMs" है, उस शेफ के लिए एक 'स्ट्रेस टेस्ट' की तरह है। शोधकर्ता यह देखना चाहते थे: क्या यह AI वास्तव में नए नियमों को तुरंत सीख सकता है और उनका पालन कर सकता है, या यह केवल अपनी पिछली यादों के आधार पर अनुमान लगा रहा है?
यहाँ उनके प्रयोग और निष्कर्षों का विवरण दिया गया है, जिसे सरल उपमाओं (analogies) का उपयोग करके समझाया गया है।
1. टेस्ट किचन: ROBOGRID
शोधकर्ताओं ने ROBOGRID नामक एक आभासी दुनिया बनाई। इसे एक रोबोट के रूप में सोचें जो एक ग्रिड में घूम रहा है, बक्से उठा रहा है और इधर-उधर जा रहा है।
- नियम: उन्होंने AI को एक "व्याकरण" (नियमों का एक सेट) दिया कि रोबोट के लिए निर्देश कैसे लिखे जाएं।
- ट्विस्ट: उन्होंने नियम पुस्तिका के दो संस्करण बनाए:
- "नेचुरल" (प्राकृतिक) संस्करण: इसमें
loop,if, औरmoveजैसे शब्दों का उपयोग किया गया है। AI ने इन शब्दों को अपने ट्रेनिंग डेटा में अरबों बार देखा है। - "एलियन" (परग्रही) संस्करण: इसमें उन सभी शब्दों को बदलकर
v_xkqmऔरv_gsqeजैसे निरर्थक शब्दों में बदल दिया गया। AI अपनी याददाश्त पर भरोसा नहीं कर सकता; उसे सख्ती से दिए गए नए नियमों का पालन करना ही होगा।
- "नेचुरल" (प्राकृतिक) संस्करण: इसमें
2. विफलता के तीन स्तर
शोधकर्ताओं ने केवल यह नहीं देखा कि रोबोट चला या नहीं; उन्होंने AI के प्रदर्शन को तीन अलग-अलग स्तरों पर जांचा, जो एक वीडियो गेम की बढ़ती कठिनाई की तरह है:
- स्तर 1: सिंटैक्स (व्याकरण पुलिस)
- प्रश्न: क्या AI ने नए नियमों के अनुसार वाक्य सही ढंग से लिखा? (जैसे, क्या उसने ब्रैकेट सही जगह पर लगाए?)
- परिणाम: AI आमतौर पर इसमें अच्छा था। वह वाक्य के आकार की नकल कर सकता था।
- स्तर 2: व्यवहार (क्रिया)
- प्रश्न: क्या रोबोट ने वास्तव में वही किया जो कहा गया था? (जैसे, क्या उसने बक्सा उठाया?)
- परिणाम: कभी-कभी AI एक बिल्कुल सही दिखने वाला वाक्य लिख देता था, लेकिन रोबोट ने गलत काम किया। भले ही "व्याकरण" सही था, लेकिन "तर्क" (logic) टूट गया था।
- स्तर 3: सिमेंटिक्स (गहरा अर्थ)
- प्रश्न: क्या AI जटिल नेस्टेड (एक के अंदर एक) निर्देशों के सटीक ढांचे और इरादे को समझ पाया?
- परिणाम: यहीं पर AI पूरी तरह से विफल हो गया। जब निर्देश गहरे और जटिल हो गए (जैसे, "एक लूप के अंदर एक लूप के अंदर एक लूप"), तो AI का नियंत्रण पूरी तरह से खत्म हो गया।
3. बड़ी खोज: "डीप रिकर्सन" की दीवार
सबसे महत्वपूर्ण खोज जटिलता के बारे में है।
- उथला स्तर (Shallow Depth): यदि निर्देश सरल थे (जैसे "आगे बढ़ो, फिर रुक जाओ"), तो AI ठीक था।
- गहरा स्तर (Deep Depth): जैसे ही निर्देशों में गहरा नेस्टिंग शामिल हुआ (जैसे "इस क्रिया को 10 बार दोहराएं, और उसके अंदर, उस दूसरी चीज़ को 5 बार करें..."), AI का प्रदर्शन ध्वस्त हो गया।
उपमा: एक फोन नंबर याद करने की कल्पना करें।
- यदि यह 3 अंकों का है, तो आप इसे आसानी से याद रख सकते हैं।
- यदि यह 10 अंकों का है, तो आप इसे सही कर सकते हैं।
- यदि यह जटिल पैटर्न वाला 20-अंकों का नंबर है, तो जब तक आप अंत तक पहुँचते हैं, आपका दिमाग (या AI का "कॉन्टेक्स्ट विंडो") शुरुआत को भूल जाता है। AI प्रोग्राम की "अवस्था" (state) को ट्रैक करना छोड़ देता है।
4. "चीट कोड" की समस्या
शोधकर्ताओं ने पाया कि जब उन्होंने "नेचुरल" शब्दों (जैसे loop) का उपयोग किया, तो AI बेहतर प्रदर्शन करता था।
- इसका अर्थ है: AI वास्तव में नए नियम सीख नहीं रहा था। वह चीटिंग कर रहा था। उसने "loop" शब्द को पहचाना और सोचा, "ओह, मुझे पता है कि लूप क्या करता है!" वह अपने पुराने ज्ञान का उपयोग करके उत्तर का अनुमान लगा रहा था।
- "एलियन" टेस्ट: जब उन्होंने निरर्थक शब्दों का उपयोग किया, तो AI चीटिंग नहीं कर सका। उसे तर्क का गणित करना पड़ा। और परिचित शब्दों के बिना, AI संघर्ष करता रहा, जिससे यह साबित हुआ कि वह शुद्ध तर्क के बजाय सिमेंटिक बूटस्ट्रैपिंग (परिचित अवधारणाओं को बैसाखी के रूप रूप में उपयोग करना) पर बहुत अधिक निर्भर करता है।
5. चेन ऑफ थॉट (CoT): "सोचकर बोलना" वाली बैसाखी
शोधकर्ताओं ने AI को "चरण-दर-चरण सोचने" (Chain of Thought) के लिए कहने का प्रयास किया।
- अच्छी खबर: इससे बहुत मदद मिली! इसने AI को धीमा होने और नियमों को बेहतर तरीके से ट्रैक करने के लिए मजबूर किया।
- बुरी खबर: "सोचकर बताने" के बावजूद, AI तब भी विफल हो गया जब निर्देश बहुत गहरे हो गए। यह एक ऐसे छात्र की तरह है जो अपना काम दिखाने (steps दिखाने) का तरीका जानता है, लेकिन फिर भी समस्या बहुत लंबी होने पर कागज खत्म होने की वजह से हार मान लेता है।
मुख्य निष्कर्ष
यह शोध पत्र हमें बताता है कि हालांकि AI मॉडल धाराप्रवाह बोलने और सरल नियमों का पालन करने में माहिर हैं, लेकिन वे जटिल, बिल्कुल नए सिस्टम के लिए विश्वसनीय "लॉजिक इंजन" नहीं हैं।
- वे नकल करने वाले (mimics) हैं, समझने वाले (understanders) नहीं।
- वे नियम के आकार का पालन कर सकते हैं, लेकिन जब चीजें जटिल होती हैं, तो वे अक्सर अर्थ खो देते हैं।
- वे क्या करना है इसका अनुमान लगाने के लिए परिचित शब्दों पर बहुत अधिक निर्भर करते हैं।
यह क्यों मायने रखता है?
जैसे-जैसे हम AI का उपयोग वास्तविक दुनिया की चीजों (जैसे सेल्फ-ड्राइविंग कार, मेडिकल रोबोट, या वित्तीय प्रणालियों) को नियंत्रित करने के लिए करना शुरू कर रहे हैं, हम केवल इस उम्मीद पर नहीं रह सकते कि वह "वाइब" (vibe) समझ लेगा। यदि AI ने नेस्टिंग के कारण जटिल, नए निर्देश को गलत समझ लिया, तो परिणाम विनाशकारी हो सकते हैं। हमें ऐसे AI की आवश्यकता है जो वास्तव में नए नियमों को आत्मसात कर सके, न कि केवल पुरानी आदतों के आधार पर अनुमान लगा सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।