← नवीनतम पेपर
💬 NLP

Understanding LLM Failures: A Multi-Tape Turing Machine Analysis of Systematic Errors in Language Model Reasoning

यह शोध पत्र बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) में व्यवस्थित तर्क संबंधी विफलताओं का कठोरता से विश्लेषण करने और उन्हें स्थानीयकृत करने के लिए एक औपचारिक मल्टी-टेप ट्यूरिंग मशीन फ्रेमवर्क प्रस्तावित करता है, जो यह समझने के लिए ज्यामितीय रूपकों (जियोमेट्रिक मेटाफर्स) के स्थान पर एक सिद्धांत-आधारित विकल्प प्रदान करता है कि टोकनाइज़ेशन और आंतरिक प्रतिनिधित्व त्रुटियों में कैसे योगदान देते हैं और चेन-ऑफ-थॉट प्रॉम्प्टिंग जैसी तकनीकें कैसे कार्य करती हैं।

मूल लेखक: Magnus Boman

प्रकाशित 2026-02-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Magnus Boman

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट है जो कहानियाँ लिख सकता है, सवालों के जवाब दे सकता है और पहेलियाँ सुलझा सकता है। आप सोच सकते हैं कि यह इंसानों की तरह "सोचता" है, लेकिन यह पेपर तर्क देता है कि यह वास्तव में एक बहुत ही विशिष्ट, कठोर मशीन की तरह काम करता है जिसमें कुछ अलग-अलग वर्कस्टेशन (कार्यस्थल) होते हैं।

लेखक, मैग्नस बोमन (Magnus Boman), एक मल्टी-टेप ट्यूरिंग मशीन (Multi-Tape Turing Machine) से तुलना करके लार्ज लैंग्वेज मॉडल्स (LLMs) को देखने का एक नया तरीका प्रस्तावित करते हैं। यदि यह आपको विज्ञान-काल्पनिक शब्दजाल जैसा लग रहा है, तो इसका सरल अनुवाद यहाँ है:

उपमा: फैक्ट्री असेंबली लाइन

AI को एक जादुई मस्तिष्क के रूप में नहीं, बल्कि एक फैक्ट्री असेंबली लाइन के रूप में सोचें जिसमें सात अलग-अलग कन्वेयर बेल्ट (टेप) अगल-बगल चल रहे हैं। प्रत्येक बेल्ट का एक विशिष्ट कार्य है, और "श्रमिक" (मशीन का तर्क) एक बेल्ट से दूसरे बेल्ट पर जाता है, सूचना को आगे बढ़ाता है।

यहाँ प्रत्येक बेल्ट क्या करता है:

  1. बेल्ट 1 (कच्चा इनपुट): वह कच्चा टेक्स्ट जो आप टाइप करते हैं (जैसे "Strawberry")।
  2. बेल्ट 2 (टोकनाइज़र): यह बेल्ट आपके टेक्स्ट को टुकड़ों में काट देता है जिन्हें "टोकन" कहा जाता है। यह एक कसाई की तरह है जो पूरे चिकन को टुकड़ों में काटता है। कभी-कभी, पूरा शब्द "Strawberry" एक ही टुकड़ा होता है। कभी-कभी, इसे "Str", "aw", और "berry" में काट दिया जाता है।
  3. बेल्ट 3 (डिक्शनरी): शब्दों को काटने और बाद में उन्हें वापस जोड़ने के नियम।
  4. बेल्ट 4 (दिमाग/वेट्स): मॉडल का वास्तविक "ज्ञान"—वह गणित और पैरामीटर्स जो इसने प्रशिक्षण के दौरान सीखे हैं।
  5. बेल्ट 5 (स्क्रैचपैड): एक अस्थायी कार्यक्षेत्र जहाँ मशीन अपना गणित और गणना करती है।
  6. बेल्ट 6 (प्रोबेबिलिटी बोर्ड): एक स्कोरबोर्ड जो दिखाता है कि अगला शब्द "cat", "dog", या "fled" होने की कितनी संभावना है।
  7. बेल्ट 7 (आउटपुट): अंतिम टेक्स्ट जो आपके पढ़ने के लिए लिखा गया है।

रोबोट क्यों विफल होता है?

यह पेपर इस फैक्ट्री मॉडल का उपयोग यह समझाने के लिए करता है कि रोबोट सरल कार्यों पर मूर्खतापूर्ण गलतियाँ क्यों करता है।

1. "स्ट्रॉबेरी" की समस्या (काटने की समस्या)

कार्य: "Strawberry" शब्द में अक्षर "r" कितनी बार आता है, इसकी गिनती करें।
इंसानी तरीका: हम अक्षरों को S-t-r-a-w-b-e-r-r-y के रूप में देखते हैं। हम गिनते हैं: 1, 2, 3। आसान है।
रोबोट का तरीका:

  • यदि रोबोट "Strawberry" को बेल्ट 2 पर एक एकल टुकड़े (टोकन) के रूप में देखता है, तो वह वास्तव में उसके अंदर के व्यक्तिगत अक्षरों को कभी नहीं देख पाता। यह एक सीलबंद बॉक्स को "Strawberry" लेबल के साथ हाथ में लेने और बिना बॉक्स खोले उसके अंदर लाल अक्षरों को गिनने के लिए कहे जाने जैसा है।
  • रोबोट को अपने प्रशिक्षण डेटा में जो उसने देखा है उसके आधार पर अनुमान लगाना होता है, न कि वास्तव में गणना करके। यह एक "पैटर्न मैच" है, न कि गणना।
  • समाधान: पेपर सुझाव देता है कि हमें फैक्ट्री लाइन में एक विशिष्ट "गिनती करने वाला श्रमिक" (बेल्ट 5) जोड़ने की आवश्यकता है जो बॉक्स को खोल सके, अक्षरों को देख सके और एक-एक करके गिन सके। इस विशिष्ट उपकरण के बिना, रोबोट विवरणों के प्रति अंधा है।

2. "नेस्टेड सेंटेंस" की समस्या (मेमोरी की समस्या)

कार्य: इस वाक्य को पूरा करें: "The cat that the dog that the mouse feared chased..."
इंसानी तरीका: हम परतों को समझते हैं। चूहा कुत्ते से डरा था। कुत्ता बिल्ली के पीछे पड़ा था। बिल्ली को एक क्रिया (जैसे "fled") की आवश्यकता है।
रोबोट का तरीका:

  • रोबोट वाक्य को देखता है और शब्दों का एक ढेर देखता है। उसे यह ट्रैक रखने में कठिनाई होती है कि कौन सा "that" किस जानवर से संबंधित है क्योंकि उसके पास अर्थ की परतों को थामने के लिए एक वास्तविक "स्टैक" (जैसे प्लेटों का ढेर) नहीं है।
  • वह इस आधार पर अगले शब्द का अनुमान लगाने की कोशिश करता है कि "chased" के बाद आमतौर पर क्या आता है, और अक्सर यह समझने में विफल रहता है कि वाक्य की संरचना गहरे निर्भरता वाले स्तरों की है।
  • सीमा: रोबोट उथले पैटर्न में अच्छा है लेकिन गहरे, रिकर्सिव (पुनरावर्ती) स्ट्रक्चर में खो जाता है, जैसे कोई व्यक्ति कविता सुनाते समय फोन नंबर याद रखने की कोशिश कर रहा हो।

"चेन-ऑफ-थॉट" (CoT) का जादू

आपने शायद "चेन-ऑफ-थॉट" प्रॉम्प्टिंग के बारे में सुना होगा, जहाँ आप AI को कहते हैं, "आइए चरण-दर-चरण सोचें।"

  • पेपर का स्पष्टीकरण: हमारी फैक्ट्री उपमा में, CoT रोबोट को अंतिम उत्तर देने से पहले अपने विचारों को लिखने के लिए एक दूसरा कागज (बेल्ट 7) देने जैसा है।
  • पूरी जटिल समस्या को अपनी छोटी आंतरिक मेमोरी (बेल्ट 5) में रखने के बजाय, यह चरणों को लिख देता है: "चरण 1: चूहा कुत्ते से डरा था। चरण 2: कुत्ता बिल्ली के पीछे पड़ा..."
  • इसे लिखकर, यह अगले चरण को हल करने के लिए अपने स्वयं के नोट्स को "पढ़" सकता है। यह बहुत मदद करता है, लेकिन यह जादू नहीं है। यदि कार्य में उस शब्द के भीतर के अक्षरों को गिनना शामिल है जिसे टुकड़ों में काटा गया था, तो "मुझे सोचने दो" लिखने से तब तक मदद नहीं मिलेगी जब तक कि रोब सहित रोबोट के पास गिनने के लिए एक वास्तविक उपकरण न हो।

मुख्य निष्कर्ष

यह पेपर एक वेक-अप कॉल है। यह हमें बताता है कि LLMs उस तरह से "सोच" नहीं रहे हैं जैसे हम करते हैं। वे एक कठोर असेंबली लाइन पर चलने वाले सांख्यिकीय पैटर्न मैचर्स (statistical pattern matchers) हैं।

  • वे बेहतरीन हैं अरबों उदाहरणों के आधार पर यह अनुमान लगाने में कि अगला शब्द क्या होगा।
  • वे खराब हैं उन कार्यों में जिनमें सटीक, चरण-दर-चरण तर्क (जैसे अक्षरों की गिनती) या गहरी संरचनात्मक समझ की आवश्यकता होती है, जब तक कि हम उन्हें विशिष्ट उपकरण (जैसे चरणों को लिखना या गिनती करने वाले सबरूटीन का उपयोग करना) का उपयोग करने के लिए मजबूर न करें।

लेखक का तर्क है कि केवल बड़े मॉडल बनाने (स्केलिंग अप) के बजाय, हमें उन्हें ठीक करने के लिए इन "फैक्ट्री लाइन" की सीमाओं को समझने की आवश्यकता है। हमें मशीन के भीतर बेहतर उपकरण बनाने की आवश्यकता है ताकि वह वास्तव में गणित कर सके, न कि केवल उत्तर का अनुमान लगा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →