← नवीनतम पेपर
💻 computer science

SinkTrack: Attention Sink based Context Anchoring for Large Language Models

SinkTrack एक प्रशिक्षण-मुक्त (training-free), प्लग-एंड-प्ले विधि है जो जनरेशन प्रक्रिया के दौरान मॉडल के फोकस को प्रारंभिक इनपुट संदर्भ पर स्थिर करने के लिए अंतर्निहित "अटेंशन सिंक" (attention sink) घटना का लाभ उठाकर लार्ज लैंग्वेज मॉडल्स में मतिभ्रम (hallucination) और संदर्भ विस्मृति (context forgetting) को कम करती है।

मूल लेखक: Xu Liu, Guikun Chen, Wenguan Wang

प्रकाशित 2026-04-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xu Liu, Guikun Chen, Wenguan Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक दोस्त को एक लंबी, जटिल कहानी सुनाने की कोशिश कर रहे हैं। आप शुरुआत करते हैं, "एक समय की बात है, एक ऐसे गाँव में जहाँ 68 सेब और 74 संतरे थे..." लेकिन जैसे-जैसे आप बोलते जाते हैं, आपका दोस्त विचलित होने लगता है। जब तक आप कहानी के अंत तक पहुँचते हैं, वह सेब और संतरों के बारे में पूरी तरह भूल चुका होता है। इसके बजाय, वह ऐसी बातें बनाने लगता है जो कभी हुई ही नहीं थीं, जैसे कि वह "उड़ने वाले हाथियों" के बारे में कहने लगे क्योंकि वह अपने ही विचारों में खोया हुआ है।

यह बिल्कुल वही है जो लार्ज लैंग्वेज मॉडल्स (LLMs) के अंदर होता है, जैसे कि चैटबॉट्स को चलाने वाले मॉडल। वे दो मुख्य समस्याओं से जूझते हैं:

  1. हैलुसिनेशन (Hallucination): वे ऐसे तथ्य बना लेते हैं जो सच नहीं होते।
  2. कॉन्टेक्स्ट भूलना (Context Forgetting): वे उस निर्देश या तथ्य को ट्रैक करना खो देते हैं जो आपने बातचीत की शुरुआत में दिए थे।

यह पेपर एक चतुर समाधान पेश करता है जिसे SINKTRACK कहा जाता है। यह कैसे काम करता है, इसे सरल उपमाओं के माध्यम से यहाँ समझाया गया है।

समस्या: "भटका हुआ ध्यान" (The "Drifting Gaze")

जब एक LLM एक लंबे टेक्स्ट को पढ़ता है, तो वह एक-एक करके शब्दों पर ध्यान देता है। हालाँकि, इसमें एक बुरी आदत होती है जिसे "अटेंशन ड्रिफ्ट" (Attention Drift) कहते हैं।

  • उपमा: कल्पना कीजिए कि आप एक किताब पढ़ रहे हैं, लेकिन आपकी आँखें पन्ने के नए शब्दों की ओर खिसकती जा रही हैं, जिससे आप शुरुआत को अनदेखा कर रहे हैं। जैसे-जैसे कहानी लंबी होती जाती है, आप पहले वाक्य को पूरी तरह भूल जाते हैं। मॉडल आपके मूल निर्देशों या आपके द्वारा अपलोड की गई इमेज को भूल जाता है।

गुप्त हथियार: "चुंबकीय लंगर" (The "Magnetic Anchor")

आश्चर्यजनक रूप से, शोधकर्ताओं ने देखा कि ये मॉडल कैसे काम करते हैं, इसके बारे में कुछ अजीब बात है। भले ही वे कहानी का बीच का हिस्सा भूल जाते हैं, वे टेक्स्ट के सबसे पहले सिंबल (जिसे <BOS> टोकन कहा जाता है, जो "यहाँ से शुरू करें" के साइन जैसा है) को देखना कभी नहीं छोड़ते।

  • उपमा: <BOS> टोकन को एक नाव के शुरू में डाले गए भारी लंगर (anchor) के रूप में सोचें। भले ही नाव (बातचीत) बहुत दूर बह जाए, लंगर नीचे स्थिर रहता है। मॉडल का ध्यान स्वाभाविक रूप से इस लंगर की ओर "खिंचा" जाता है, जो इसे स्थिर रखता है।

समाधान: SINKTRACK (द "सुपर-एंकर")

समस्या यह है कि यह लंगर आमतौर पर खाली होता है। यह सिर्फ एक "यहाँ से शुरू करें" का साइन है जिसमें कोई जानकारी नहीं है। SINKTRACK इस खेल को बदलकर इस खाली लंगर को एक सुपर-एंकर (Super-Anchor) में बदल देता है।

यहाँ चरण-दर-चरण प्रक्रिया दी गई है:

  1. "हार्ड" गलती: सबसे पहले, शोधकर्ताओं ने लंगर को महत्वपूर्ण जानकारी (जैसे इमेज या गणित की समस्या) से सीधे बदलने की कोशिश की।

    • परिणाम: नाव पलट गई। मॉडल क्रैश हो गया क्योंकि वह अचानक आए बदलाव को संभाल नहीं पाया। यह वैसा ही था जैसे कार 100 की रफ्तार से चलते समय उसका इंजन बदलने की कोशिश करना।
  2. "सॉफ्ट" गलती: इसके बाद, उन्होंने जानकारी को धीरे से मिक्स करने की कोशिश की।

    • परिणाम: यह थोड़ा काम कर गया, लेकिन यह एक पूरी लाइब्रेरी को केवल एक धुंधले सारांश को पढ़कर याद रखने की कोशिश करने जैसा था। यह पर्याप्त सटीक नहीं था, और उन्हें यह तय करने के लिए मैन्युअल रूप से ट्यून करना पड़ता था कि कितनी जानकारी जोड़नी है (जैसे कि एक डायल घुमाना), जो कि कष्टदायक है और अक्सर गलत भी होता है।
  3. "SINKTRACK" फिक्स (विजेता): उन्होंने एक डुअल-ट्रैक सिस्टम (dual-track system) बनाया।

    • ट्रैक 1 (स्मार्ट क्वेरी): उन्होंने "यहाँ से शुरू करें" वाले लंगर को एक विशेष क्षमता दी। केवल जानकारी रखने के बजाय, अब यह लंगर एक स्मार्ट लाइब्रेरियन की तरह काम करता है। जैसे-जैसे कहानी आगे बढ़ती है, लंगर सक्रिय रूप से बाकी कॉन्टेक्स्ट से "पूछ" सकता है, "हे, उस 68 सेबों वाले विवरण के बारे में क्या था?" और उस विशिष्ट जानकारी को वापस सामने खींच सकता है।
    • ट्रैक 2 (सामान्य प्रवाह): बाकी की बातचीत ठीक वैसे ही चलती रहती है जैसे मॉडल को प्रशिक्षित किया गया था, बिना किसी हस्तक्षेप के।

यह एक बड़ी बात क्यों है?

  • कोई ट्रेनिंग की आवश्यकता नहीं: आपको मॉडल को फिर से सिखाने (जो महंगा और जोखिम भरा है) की जरूरत नहीं है। आप बस इस तरीके को एक नए लेंस की तरह प्लग-इन कर सकते हैं।
  • सुपर फास्ट: यह केवल शुरुआत में एक बार होता है। बाकी की बातचीत पहले जितनी ही तेज़ होती है।
  • हर जगह काम करता है: यह टेक्स्ट, गणित और यहाँ तक कि इमेज को देखते समय भी हैलुसिनेशन को ठीक करता है।

वास्तविक दुनिया का परिणाम

परीक्षणों में, SINKTRACK ने मेमोरी ग्लू (memory glue) की तरह काम किया।

  • जब संख्याओं की एक लंबी सूची वाली गणित की समस्या हल करने के लिए कहा गया, तो मॉडल पहली संख्या को नहीं भूला।
  • जब एक तस्वीर का वर्णन करने के लिए कहा गया, तो इसने वहां मौजूद बसों और पेड़ों पर टिके रहने के बजाय "उड़ने वाले हाथियों" का आविष्कार नहीं किया।
  • लंबी बातचीत में, इसने मूल निर्देशों को याद रखा, जबकि अन्य तरीके भटक जाते और रैंडम जवाब देते।

संक्षेप में: SINKTRACK उस एक चीज़ का उपयोग करता है जिसे AI स्वाभाविक रूप से याद रखता है (सबसे पहला टोकन) और उसे मूल कॉन्टेक्स्ट के लिए एक "GPS ट्रैकर" के साथ लोड करता है। यह AI को कल्पना की दुनिया में भटकने से रोकता है, यह सुनिश्चित करता है कि वह आपके द्वारा दिए गए तथ्यों पर टिका रहे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →