← नवीनतम पेपर
💻 computer science

Diagnosing CFG Interpretation in LLMs

यह शोधपत्र नवीन संदर्भ-मुक्त व्याकरण (context-free grammars) के इन-कॉन्टेक्स्ट व्याख्याकार के रूप में LLMs का मूल्यांकन करने के लिए RoboGrid फ्रेमवर्क प्रस्तुत करता है, जो यह प्रकट करता है कि जबकि मॉडल अक्सर सतही वाक्य संरचना (surface syntax) बनाए रखते हैं, वे शुद्ध प्रतीकात्मक आगमन (pure symbolic induction) के बजाय कीवर्ड-आधारित अर्थ संबंधी बूटस्ट्रैपिंग (keyword-based semantic bootstrapping) पर निर्भरता के कारण संरचनात्मक जटिलता के तहत पदानुक्रमित क्षरण (hierarchical degradation) और अर्थ संबंधी विफलता का शिकार होते हैं।

मूल लेखक: Hanqi Li, Lu Chen, Kai Yu

प्रकाशित 2026-04-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hanqi Li, Lu Chen, Kai Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक शानदार, दुनिया घूमने वाले शेफ (एक लार्ज लैंग्वेज मॉडल या LLM) को खाना बनाने के लिए काम पर रखा है। आमतौर पर, यह शेफ अद्भुत होता है क्योंकि उसने पहले लाखों बार खाना बनाया है। उसे पता है कि सिर्फ नाम सुनकर "स्पैगेटी कारबोनारा" या "बीफ स्ट्यू" कैसे बनाया जाता है।

लेकिन आज, आप उसे कोई जाना-पहचाना रेसिपी नहीं देते। इसके बजाय, आप उसे एक बिल्कुल नई, एलियन कुकबुक थमा देते हैं जो एक ऐसी भाषा में लिखी गई है जिसे उसने पहले कभी नहीं देखा—जिसमें बनावटी शब्द और अजीब नियम हैं। आप उससे केवल इन नए निर्देशों के आधार पर एक व्यंजन बनाने के लिए कहते हैं।

यह शोध पत्र, जिसका शीर्षक "Diagnosing CFG Interpretation in LLMs" है, उस शेफ के लिए एक 'स्ट्रेस टेस्ट' की तरह है। शोधकर्ता यह देखना चाहते थे: क्या यह AI वास्तव में नए नियमों को तुरंत सीख सकता है और उनका पालन कर सकता है, या यह केवल अपनी पिछली यादों के आधार पर अनुमान लगा रहा है?

यहाँ उनके प्रयोग और निष्कर्षों का विवरण दिया गया है, जिसे सरल उपमाओं (analogies) का उपयोग करके समझाया गया है।

1. टेस्ट किचन: ROBOGRID

शोधकर्ताओं ने ROBOGRID नामक एक आभासी दुनिया बनाई। इसे एक रोबोट के रूप में सोचें जो एक ग्रिड में घूम रहा है, बक्से उठा रहा है और इधर-उधर जा रहा है।

  • नियम: उन्होंने AI को एक "व्याकरण" (नियमों का एक सेट) दिया कि रोबोट के लिए निर्देश कैसे लिखे जाएं।
  • ट्विस्ट: उन्होंने नियम पुस्तिका के दो संस्करण बनाए:
    1. "नेचुरल" (प्राकृतिक) संस्करण: इसमें loop, if, और move जैसे शब्दों का उपयोग किया गया है। AI ने इन शब्दों को अपने ट्रेनिंग डेटा में अरबों बार देखा है।
    2. "एलियन" (परग्रही) संस्करण: इसमें उन सभी शब्दों को बदलकर v_xkqm और v_gsqe जैसे निरर्थक शब्दों में बदल दिया गया। AI अपनी याददाश्त पर भरोसा नहीं कर सकता; उसे सख्ती से दिए गए नए नियमों का पालन करना ही होगा।

2. विफलता के तीन स्तर

शोधकर्ताओं ने केवल यह नहीं देखा कि रोबोट चला या नहीं; उन्होंने AI के प्रदर्शन को तीन अलग-अलग स्तरों पर जांचा, जो एक वीडियो गेम की बढ़ती कठिनाई की तरह है:

  • स्तर 1: सिंटैक्स (व्याकरण पुलिस)
    • प्रश्न: क्या AI ने नए नियमों के अनुसार वाक्य सही ढंग से लिखा? (जैसे, क्या उसने ब्रैकेट सही जगह पर लगाए?)
    • परिणाम: AI आमतौर पर इसमें अच्छा था। वह वाक्य के आकार की नकल कर सकता था।
  • स्तर 2: व्यवहार (क्रिया)
    • प्रश्न: क्या रोबोट ने वास्तव में वही किया जो कहा गया था? (जैसे, क्या उसने बक्सा उठाया?)
    • परिणाम: कभी-कभी AI एक बिल्कुल सही दिखने वाला वाक्य लिख देता था, लेकिन रोबोट ने गलत काम किया। भले ही "व्याकरण" सही था, लेकिन "तर्क" (logic) टूट गया था।
  • स्तर 3: सिमेंटिक्स (गहरा अर्थ)
    • प्रश्न: क्या AI जटिल नेस्टेड (एक के अंदर एक) निर्देशों के सटीक ढांचे और इरादे को समझ पाया?
    • परिणाम: यहीं पर AI पूरी तरह से विफल हो गया। जब निर्देश गहरे और जटिल हो गए (जैसे, "एक लूप के अंदर एक लूप के अंदर एक लूप"), तो AI का नियंत्रण पूरी तरह से खत्म हो गया।

3. बड़ी खोज: "डीप रिकर्सन" की दीवार

सबसे महत्वपूर्ण खोज जटिलता के बारे में है।

  • उथला स्तर (Shallow Depth): यदि निर्देश सरल थे (जैसे "आगे बढ़ो, फिर रुक जाओ"), तो AI ठीक था।
  • गहरा स्तर (Deep Depth): जैसे ही निर्देशों में गहरा नेस्टिंग शामिल हुआ (जैसे "इस क्रिया को 10 बार दोहराएं, और उसके अंदर, उस दूसरी चीज़ को 5 बार करें..."), AI का प्रदर्शन ध्वस्त हो गया।

उपमा: एक फोन नंबर याद करने की कल्पना करें।

  • यदि यह 3 अंकों का है, तो आप इसे आसानी से याद रख सकते हैं।
  • यदि यह 10 अंकों का है, तो आप इसे सही कर सकते हैं।
  • यदि यह जटिल पैटर्न वाला 20-अंकों का नंबर है, तो जब तक आप अंत तक पहुँचते हैं, आपका दिमाग (या AI का "कॉन्टेक्स्ट विंडो") शुरुआत को भूल जाता है। AI प्रोग्राम की "अवस्था" (state) को ट्रैक करना छोड़ देता है।

4. "चीट कोड" की समस्या

शोधकर्ताओं ने पाया कि जब उन्होंने "नेचुरल" शब्दों (जैसे loop) का उपयोग किया, तो AI बेहतर प्रदर्शन करता था।

  • इसका अर्थ है: AI वास्तव में नए नियम सीख नहीं रहा था। वह चीटिंग कर रहा था। उसने "loop" शब्द को पहचाना और सोचा, "ओह, मुझे पता है कि लूप क्या करता है!" वह अपने पुराने ज्ञान का उपयोग करके उत्तर का अनुमान लगा रहा था।
  • "एलियन" टेस्ट: जब उन्होंने निरर्थक शब्दों का उपयोग किया, तो AI चीटिंग नहीं कर सका। उसे तर्क का गणित करना पड़ा। और परिचित शब्दों के बिना, AI संघर्ष करता रहा, जिससे यह साबित हुआ कि वह शुद्ध तर्क के बजाय सिमेंटिक बूटस्ट्रैपिंग (परिचित अवधारणाओं को बैसाखी के रूप रूप में उपयोग करना) पर बहुत अधिक निर्भर करता है।

5. चेन ऑफ थॉट (CoT): "सोचकर बोलना" वाली बैसाखी

शोधकर्ताओं ने AI को "चरण-दर-चरण सोचने" (Chain of Thought) के लिए कहने का प्रयास किया।

  • अच्छी खबर: इससे बहुत मदद मिली! इसने AI को धीमा होने और नियमों को बेहतर तरीके से ट्रैक करने के लिए मजबूर किया।
  • बुरी खबर: "सोचकर बताने" के बावजूद, AI तब भी विफल हो गया जब निर्देश बहुत गहरे हो गए। यह एक ऐसे छात्र की तरह है जो अपना काम दिखाने (steps दिखाने) का तरीका जानता है, लेकिन फिर भी समस्या बहुत लंबी होने पर कागज खत्म होने की वजह से हार मान लेता है।

मुख्य निष्कर्ष

यह शोध पत्र हमें बताता है कि हालांकि AI मॉडल धाराप्रवाह बोलने और सरल नियमों का पालन करने में माहिर हैं, लेकिन वे जटिल, बिल्कुल नए सिस्टम के लिए विश्वसनीय "लॉजिक इंजन" नहीं हैं।

  • वे नकल करने वाले (mimics) हैं, समझने वाले (understanders) नहीं।
  • वे नियम के आकार का पालन कर सकते हैं, लेकिन जब चीजें जटिल होती हैं, तो वे अक्सर अर्थ खो देते हैं।
  • वे क्या करना है इसका अनुमान लगाने के लिए परिचित शब्दों पर बहुत अधिक निर्भर करते हैं।

यह क्यों मायने रखता है?
जैसे-जैसे हम AI का उपयोग वास्तविक दुनिया की चीजों (जैसे सेल्फ-ड्राइविंग कार, मेडिकल रोबोट, या वित्तीय प्रणालियों) को नियंत्रित करने के लिए करना शुरू कर रहे हैं, हम केवल इस उम्मीद पर नहीं रह सकते कि वह "वाइब" (vibe) समझ लेगा। यदि AI ने नेस्टिंग के कारण जटिल, नए निर्देश को गलत समझ लिया, तो परिणाम विनाशकारी हो सकते हैं। हमें ऐसे AI की आवश्यकता है जो वास्तव में नए नियमों को आत्मसात कर सके, न कि केवल पुरानी आदतों के आधार पर अनुमान लगा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →