← नवीनतम पेपर
💬 NLP

TIDE: Every Layer Knows the Token Beneath the Context

यह शोध पत्र TIDE का प्रस्ताव करता है, जो एक नवीन ट्रांसफार्मर आर्किटेक्चर है जो मानक सिंगल-इंजेक्शन टोकन एम्बेडिंग को एक "एम्बेडिंगमेमोरी" (EmbeddingMemory) प्रणाली से बदल देता है जो प्रत्येक परत में संदर्भ-मुक्त अर्थ संबंधी वेक्टर्स को इंजेक्ट करता है, जिससे दुर्लभ टोकन के कम प्रशिक्षण और समान टोकन के संदर्भात्मक पतन (contextual collapse) की समस्या को हल करते हुए भाषा मॉडलिंग प्रदर्शन में सुधार किया जा सके।

मूल लेखक: Ajay Jaiswal, Lauren Hannah, Han-Byul Kim, Duc Hoang, Mehrdad Farajtabar, Minsik Cho

प्रकाशित 2026-05-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ajay Jaiswal, Lauren Hannah, Han-Byul Kim, Duc Hoang, Mehrdad Farajtabar, Minsik Cho

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "TIDE: Every Layer Knows the Token" पेपर का सरल भाषा और उपमाओं (analogies) का उपयोग करते हुए स्पष्टीकरण दिया गया है।

बड़ी समस्या: "एक बार और खत्म" वाली गलती (The "One-and-Done" Mistake)

कल्पना कीजिए कि आप एक विशाल पुस्तकालय (एक Large Language Model) को दुनिया को समझने के लिए सिखा रहे हैं। हर आधुनिक AI पुस्तकालय में एक सख्त नियम है: जब कोई शब्द इमारत में प्रवेश करता है, तो आप उसे एक बार डिक्शनरी (शब्दकोश) में देखते हैं, उसका अर्थ निकालते हैं, और फिर डिक्शनरी को फेंक देते हैं।

उस क्षण से, वह शब्द AI के 20 या 30 अलग-अलग "कमरों" (layers) से होकर गुजरता है, लेकिन AI दोबारा कभी डिक्शनरी नहीं देखता। वह केवल वाक्य के संदर्भ (context) पर भरोसा करता है कि शब्द का क्या अर्थ होगा।

इस पेपर के लेखक कहते हैं कि यह नियम दो बड़ी मुश्किलें पैदा करता है:

1. "दुर्लभ शब्दों" की भुखमरी (The "Rare Word" Starvation)

भाषा को एक कॉन्सर्ट की तरह समझें। सबसे लोकप्रिय गाने (आम शब्द जैसे "the," "is," "and") लाखों बार बजाए जाते हैं। लेकिन अस्पष्ट, विशिष्ट (niche) गाने (दुर्लभ शब्द जैसे विशिष्ट चिकित्सा शब्द या दुर्लभ नाम) केवल कुछ ही बार बजाए जाते हैं।

  • समस्या: क्योंकि AI केवल एक बार शब्द को देखता है, लोकप्रिय शब्दों को बहुत अधिक "प्रशिक्षण ध्यान" (gradients) मिलता है। वे पूरी तरह से सीख जाते हैं। लेकिन दुर्लभ शब्द? उन्हें बहुत कम ध्यान मिलता है। वे सीखने के लिए "भूखे" रह जाते हैं।
  • परिणाम: AI आम शब्दों में बहुत अच्छा हो जाता है लेकिन दुर्लभ शब्दों में बहुत खराब, अक्सर उन्हें शोर (noise) मान लेता है या अन्य शब्दों के साथ भ्रमित कर देता है।

2. "संदर्भ का पतन" (The "Contextual Collapse" - जुड़वाँ जाल)

कल्पना कीजिए कि दो जुड़वाँ हैं, "Their" और "There"। वे सुनने में एक जैसे लगते हैं और अक्सर बिल्कुल एक ही तरह के वाक्यों में दिखाई देते हैं (जैसे, "Put it over there" बनाम "Put it over their house")।

  • समस्या: चूंकि AI ने पहले कमरे के बाद डिक्शनरी फेंक दी थी, इसलिए उसे उन्हें अलग करने के लिए पूरी तरह से वाक्य के संदर्भ पर निर्भर रहना पड़ता है। यदि वाक्य समान है, तो AI भ्रमित हो जाता है। उसे लगता है कि "Their" और "There" बिल्कुल एक ही चीज़ हैं क्योंकि उनका "हिडन स्टेट" (उनका आंतरिक प्रतिनिधित्व) एक अविभाज्य ढेर (blob) में मिल जाता है।
  • परिणाम: AI उन शब्दों के बीच अंतर करने की क्षमता खो देता है जो दिखने या सुनने में समान हैं लेकिन जिनका अर्थ अलग है, खासकर यदि वे समान स्थितियों में दिखाई देते हैं।

समाधान: TIDE (Token Identity Delivered Everywhere)

लेखक TIDE नामक एक नया आर्किटेक्चर प्रस्तावित करते हैं। डिक्शनरी को फेंकने के बजाय, TIDE एक स्थायी, समर्पित मेमोरी बैंक रखता है जो शब्द की पूरी यात्रा के दौरान उसके साथ रहता है।

उपमा (Analogy): "ID कार्ड" बनाम "संदर्भ संकेत" (The "ID Card" vs. The "Context Clue")

  • पुराना तरीका (Standard AI): आप एक इमारत में प्रवेश करते हैं। गार्ड दरवाजे पर आपकी ID चेक करता है, एक कागज पर स्टैम्प लगाता है, और फिर आप 20 कमरों से गुजरते हैं। हर कमरे में, लोग आपके होने के आधार पर अंदाज़ा लगाने की कोशिश करते हैं कि आप कौन हैं। यदि आप अपने जुड़वाँ के साथ ही एक समूह में खड़े हैं, तो वे आपको पहचान नहीं पाते।
  • नया तरीका (TIDE): आप अंदर आते हैं, और गार्ड आपकी ID चेक करता है। लेकिन इस बार, वे आपको एक विशेष ID कार्ड देते हैं जिसे आप हर एक कमरे में अपने साथ ले जाते हैं। हर कमरे में, लोग आपके ID कार्ड को देखकर जान सकते हैं कि आप वास्तव में कौन हैं, चाहे आप किसी के भी साथ खड़े हों।

TIDE कैसे काम करता है (Mechanics)

  1. मेमोरी बैंक (EmbeddingMemory): TIDE KK स्वतंत्र "मेमोरी ब्लॉक्स" बनाता है। इन्हें KK अलग-अलग डिक्शनरी के रूप में सोचें। प्रत्येक एक शब्द के इंडेक्स को एक विशिष्ट अर्थ वेक्टर (meaning vector) से जोड़ता है।
  2. राउटर (The Router): जैसे ही शब्द AI के प्रत्येक लेयर से गुजरता है, एक स्मार्ट "राउटर" शब्द को देखता है और निर्णय लेता है: "ठीक है, इस विशिष्ट लेयर के लिए, मुझे डिक्शनरी A, डिक्शनरी B और डिक्शनरी C का कितना हिस्सा उपयोग करना चाहिए?"
  3. "नल बैंक" (The "Null Bank"): एक विशेष "ऑफ स्विच" (Null Bank) भी है। यदि AI तय करता है कि किसी विशिष्ट कमरे में शब्द को अतिरिक्त मदद की आवश्यकता नहीं है, तो यह सिग्नल को एक खाली बैंक की ओर भेज सकता है, जिससे उस क्षण के लिए मेमोरी इंजेक्शन बंद हो जाता है। यह सुनिश्चित करता है कि नया सिस्टम AI के पुराने, काम करने वाले हिस्सों को खराब न करे।

यह एक बड़ी बात क्यों है?

पेपर का दावा है कि TIDE ऊपर बताई गई दोनों समस्याओं को ठीक करता है:

  1. भुखमरी का समाधान: क्योंकि TIDE के पास KK अलग-अलग मेमोरी ब्लॉक्स हैं, हर बार जब एक दुर्लभ शब्द आता है, तो उसे सभी KK डिक्शनरीों में एक साथ अपडेट किया जाता है। यह दुर्लभ शब्दों को पहले की तुलना में KK गुना अधिक लर्निंग सिग्नल देता है। आखिरकार उन्हें ठीक से सीखने के लिए आवश्यक ध्यान मिलता है।
  2. पतन का समाधान: भले ही "Their" और "There" बिल्कुल एक ही वाक्य में हों, मेमोरी बैंक जानता है कि वे अलग हैं क्योंकि यह उनके विशिष्ट ID को देखता है। यह एक "टोकन आइडेंटिटी" सिग्नल इंजेक्ट करता है जो संदर्भ से स्वतंत्र होता है। यह दोनों शब्दों को एक भ्रमित करने वाले ढेर में मिलने से रोकता है।

परिणाम

लेखकों ने 350 मिलियन से लेकर 1 बिलियन पैरामीटर्स तक के मॉडल्स पर इसका परीक्षण किया।

  • दुर्लभ शब्द: TIDE ने दुर्लभ शब्दों (जो "भूखे" थे) के प्रदर्शन में महत्वपूर्ण सुधार किया।
  • सामान्य शब्द: इसने सामान्य शब्दों की भी मदद की, हालांकि सुधार थोड़ा कम था।
  • कार्य (Tasks): AI विभिन्न कार्यों जैसे प्रश्न पूछने (ARC, HellaSwag) और टेक्स्ट लिखने (Wikitext, PubMed) में बेहतर हुआ।
  • दक्षता (Efficiency): मेमोरी बैंक स्थिर (static) है (यह इन्फरेंस के दौरान नहीं बदलता है) और इसे महंगे कंप्यूटर मेमोरी (VRAM) के बजाय हार्ड ड्राइव (SSD) पर स्टोर किया जा सकता है, जिससे इसे चलाना सस्ता है।

सारांश

TIDE ऐसा है जैसे हर शब्द को एक स्थायी ID कार्ड देना जो उसके साथ AI के मस्तिष्क के हर लेयर में यात्रा करता है। यह सुनिश्चित करता है कि दुर्लभ शब्दों को सीखने के लिए पर्याप्त अभ्यास मिले, और समान दिखने वाले शब्द कभी भ्रमित न हों, जिससे AI बिना बहुत बड़ा हुए अधिक स्मार्ट और सटीक बनता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →