← नवीनतम पेपर
💬 NLP

Word Recovery in Large Language Models Enables Character-Level Tokenization Robustness

यह शोध पत्र यह प्रकट करता है कि बड़े भाषा मॉडल (large language models) एक "शब्द पुनर्प्राप्ति" (word recovery) तंत्र के माध्यम से कैरेक्टर-स्तरीय टोकनाइज़ेशन (character-level tokenization) के प्रति मजबूती बनाए रखते हैं, जहाँ हिडन स्टेट्स (hidden states) एक ही टोकन से संबंधित कैरेक्टर्स के बीच महत्वपूर्ण इन-ग्रुप अटेंशन (in-group attention) के माध्यम से मानक शब्द पहचान (canonical word identities) को पुनर्गठित करते हैं।

मूल लेखक: Zhipeng Yang, Shu Yang, Lijie Hu, Di Wang

प्रकाशित 2026-03-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhipeng Yang, Shu Yang, Lijie Hu, Di Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही समझदार रोबोट शेफ (एक लार्ज लैंग्वेज मॉडल, या LLM) है, जिसे पहले से कटे हुए विशिष्ट सामग्रियों के सेट का उपयोग करके खाना पकाने के लिए प्रशिक्षित किया गया था। उदाहरण के लिए, शेफ उम्मीद करता है कि "प्याज" (onion) एक एकल, साबुत इकाई के रूप में आए।

अब, कल्पना कीजिए कि आप एक बैग में कच्चे, अलग-अलग प्याज के टुकड़े (slices) देकर शेफ का परीक्षण करने का निर्णय लेते हैं, न कि पूरा प्याज। आप उम्मीद कर सकते हैं कि शेफ भ्रमित हो जाएगा, चाकू गिरा देगा, या एक घटिया भोजन परोस देगा क्योंकि सामग्रियां गलत प्रारूप में हैं।

आश्चर्यजनक रूप से, यह शोध पत्र खोजता है कि रोबोट शेफ न केवल इससे निपट लेता है; बल्कि वह वास्तव में बहुत अच्छा काम करता है। वह उन बिखरे हुए टुकड़ों को ले सकता है, उन्हें अपने दिमाग में वापस जोड़कर "प्याज" बना सकता है, और फिर व्यंजन को पूरी तरह से पका सकता है।

शोधकर्ता जानना चाहते थे कि: शेफ यह कैसे करता है? क्या वह केवल टुकड़ों के आधार पर अनुमान लगाता है, या वह गुप्त रूप से पहले पूरा प्याज फिर से बनाता है?

यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. जादू का खेल: "शब्द रिकवरी" (Word Recovery)

शोधकर्ताओं ने पाया कि रोबोट वास्तव में कच्चे टुकड़ों के साथ खाना पकाने की कोशिश नहीं करता है। इसके बजाय, वह "वर्ड रिकवरी" नामक एक जादू का खेल करता है।

  • उपमा: इनपुट को कागज की एक पट्टी पर लिखे वाक्य के रूप में सोचें जहाँ हर अक्षर एक स्पेस के साथ अलग किया गया है: W h a t _ i s _ n a t u r a l _ g a s ?
  • अंदर क्या होता है: जैसे ही जानकारी रोबोट के "दिमाग" (इसके परतों) के माध्यम से यात्रा करती है, यह सूचनाओं को एक लाइन में पास करने वाले श्रमिकों की एक टीम की तरह कार्य करती है। शुरुआती चरणों में, जो श्रमिक n, a, t, u, r, a, l अक्षरों को संभालते हैं, वे आपस में बात करना शुरू कर देते हैं। वे फुसफुसाते हैं, "हे, हम एक साथ हैं!"
  • परिणाम: जब तक संदेश मस्तिष्क के मध्य तक पहुँचता है, रोबोट ने मानसिक रूप से उन अक्षरों को वापस जोड़ दिया होता है। उसने अपनी स्मृति के भीतर "natural" शब्द को पुनर्गठित कर लिया है, भले ही उसने शुरुआत में "natural" शब्द को एक एकल टुकड़े के रूप में कभी नहीं देखा था। इसके बाद वह आपके प्रश्न का उत्तर देने के लिए इस पुनर्गठित शब्द का उपयोग करता है।

2. प्रमाण: "सर्जरी टेस्ट"

यह साबित करने के लिए कि यह "पुनर्निर्माण" वास्तव में आवश्यक है और केवल एक दुष्प्रभाव नहीं है, शोधकर्ताओं ने रोबोट के दिमाग पर एक "सर्जरी" की।

  • उपमा: कल्पना कीजिए कि रोबोट का दिमाग सूचनाओं का एक पुस्तकालय है। शोधकर्ताओं ने उस विशिष्ट शेल्फ को खोज निकाला जहाँ पुनर्गठित शब्द "natural" संग्रहीत था। फिर उन्होंने एक जोड़ी कैंची ली और उस विशिष्ट शेल्फ को काट दिया, प्रभावी रूप से रोबोट की स्मृति से "natural" शब्द को हटा दिया जबकि वह सोचने की कोशिश कर रहा था
  • परिणाम: जब उन्होंने ऐसा किया, तो रोबोट तुरंत प्रश्न का उत्तर देना भूल गया। वह लड़खड़ा गया और विफल रहा।
  • निष्कर्ष: इसने सिद्ध किया कि रोबोट को कार्य करने के लिए शब्दों को पुनर्गठित करने की जरूरत है। यह केवल एक भाग्यशाली अनुमान नहीं है; "वर्ड रिकवरी" वह इंजन है जो रोबोट को काम करने में सक्षम बनाता है।

3. गोंद: "इन-ग्रुप अटेंशन" (In-Group Attention)

शोधकर्ता यह भी जानना चाहते थे कि अक्षर एक साथ कैसे जुड़ते हैं। उन्होंने रोबोट के "अटेंशन" तंत्र (यह तय करने का तरीका कि इनपुट के किन हिस्सों पर ध्यान केंद्रित करना है) को देखा।

  • उपमा: एक कक्षा की कल्पना करें जहाँ छात्र समूहों में बैठे हैं। "natural" शब्द के अक्षरों का प्रतिनिधित्व करने वाले छात्र एक ही क्लस्टर में बैठे हैं।
  • खोज: शोधकर्ताओं ने पाया कि प्रसंस्करण के शुरुआती चरणों में, ये "अक्षर-छात्र" लगातार एक-दूसरे को हाथ उठाकर बुला रहे हैं और आपस में बात कर रहे हैं (इसे "इन-ग्रुप अटेंशन" कहा जाता है। वे अपनी समूह पहचान बनाने पर ध्यान केंद्रित करने के लिए कमरे के अन्य छात्रों को अनदेखा कर रहे हैं।
  • प्रयोग: जब शोधकर्ताओं ने शिक्षक को "चुप रहने" के लिए कहा और "natural" समूह के छात्रों को एक-दूसरे से बात करने से रोका, तो वह समूह बिखर गया। रोबोट शब्द नहीं बना सका, और उसका प्रदर्शन गिर गया।

मुख्य निष्कर्ष

यह शोध पत्र इस रहस्य को सुलझाता है कि AI कैसे काम करता है। हमें लगा था कि यदि आप किसी शब्द को छोटे टुकड़ों (अक्षरों) में तोड़ देंगे, तो AI भ्रमित हो जाएगा क्योंकि इसे पूरे शब्दों पर प्रशिक्षित किया गया था।

लेकिन AI उससे कहीं अधिक स्मार्ट है। इसके पास एक आंतरिक "गोंद" तंत्र है। जब यह टूटे हुए टुकड़ों को देखता है, तो यह जल्दी से उन्हें इकट्ठा करता है, उन्हें शब्दों में वापस जोड़ता है, और फिर उन शब्दों का उपयोग करके दुनिया को समझता है। यह एक पहेली सुलझाने वाले की तरह है जो बिखरे हुए पहेली के टुकड़ों के ढेर से तुरंत तस्वीर देख सकता है और पहेली को हल कर सकता है, भले ही तस्वीर उसे कभी भी एक पूर्ण रूप में न दी गई हो।

संक्षेप में: AI केवल अक्षरों को नहीं पढ़ता; वह उन्हें समझने के लिए अपने मन में गुप्त रूप से शब्दों का पुनर्निर्माण करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →