← नवीनतम पेपर
🤖 AI

SLASH the Sink: Sharpening Structural Attention Inside LLMs

यह शोधपत्र "Slash" का प्रस्ताव करता है, जो एक प्रशिक्षण-मुक्त विधि है जो "अटेंशन सिंक" (attention sink) का मुकाबला करने के लिए अटेंशन को पुनर्वितरित करके और मॉडल की ग्राफ टोपोलॉजी को पुनर्गठित करने की अंतर्निहित क्षमता को बढ़ाकर लार्ज लैंग्वेज मॉडल्स में ग्राफ तर्क (graph reasoning) को बेहतर बनाता है, जिससे भाषा प्रसंस्करण पूर्वाग्रहों और संरचनात्मक समझ के बीच के संघर्ष को दूर किया जा सके।

मूल लेखक: Yiming Liu, Bin Lu, Xinbing Wang, Chenghu Zhou, Meng Jin

प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yiming Liu, Bin Lu, Xinbing Wang, Chenghu Zhou, Meng Jin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "SLASH the Sink" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

बड़ी तस्वीर: एक बुद्धिमान पाठक जो विचलित हो जाता है

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, विद्वान लाइब्रेरियन (लार्ज लैंग्वेज मॉडल या LLM) है। यह लाइब्रेरियन कहानियों, कविताओं और बातचीत को समझने में अद्भुत है। हालाँकि, यदि आप उन्हें सबवे सिस्टम का नक्शा या किसी पारिवारिक वंशावली (family tree) की एक लंबी सूची थमा दें, तो वे अक्सर भ्रमित हो जाते हैं। उन्हें यह समझने में कठिनाई होती है कि स्टेशन आपस में कैसे जुड़े हैं या परिवार के सदस्य एक-दूसरे से कैसे संबंधित हैं।

इस पेपर के पीछे के शोधकर्ताओं ने पूछा: "क्या लाइब्रेरियन वास्तव में नक्शे के प्रति अंधा है, या वह केवल विचलित है?"

खोज: "सॉ टूथ" (Sawtooth) का रहस्य

टीम ने पाया कि लाइब्रेरियन अंधा नहीं है। लाइब्रेरियन के मस्तिष्क के भीतर एक छिपा हुआ पैटर्न है। जब वह किसी ग्राफ (जैसे कि एक नक्शा) को देख रहा होता है, तो लाइब्रेरियन का आंतरिक ध्यान स्वाभाविक रूप से एक "सॉ टूथ" (आरी के दांत जैसा) पैटर्न बनाता है।

  • उपमा: कल्पना कीजिए कि लाइब्रेरियन ट्रेन के कनेक्शनों की एक सूची पढ़ रहा है। भले ही टेक्स्ट केवल शब्दों की एक सपाट सूची है, लाइब्रेरियन की आँखें स्वाभाविक रूप से संबंधित स्टेशनों के बीच आगे-पीछे कूदती हैं, जिससे ध्यान का एक ज़िग-ज़ैग पैटर्न बनता है जो वास्तव में नक्शे से पूरी तरह मेल खाता है।
  • समस्या: हालाँकि, कमरे में एक तेज़, विचलित करने वाला शोर है जिसे "अटेंशन सिंक" (Attention Sink) कहा जाता है। यह इन मॉडल्स के प्रशिक्षण का एक दोष है: वे वाक्य के पहले कुछ शब्दों पर बहुत तीव्रता से ध्यान केंद्रित करने लगते हैं, जिससे वे बाकी सब कुछ अनदेखा कर देते हैं। यह "शुरुआत पर टकटकी लगाकर देखना" सामान्य टेक्स्ट पढ़ने के लिए तो अच्छा है, लेकिन यह नक्शे के कनेक्शनों को देखने की लाइब्रेरियन की स्वाभाविक क्षमता को दबा देता है। "सॉ टूथ" पैटर्न वहाँ मौजूद है, लेकिन वह पहले कुछ शब्दों के शोर में दब गया है।

समाधान: SLASH

लेखकों ने SLASH (स्ट्रक्चरल अटेंशन शार्पनिंग) नामक एक टूल बनाया है। इसे लाइब्रेरियन के लिए 'नॉइज़-कैंसलिंग हेडफ़ोन' की तरह समझें।

  • यह कैसे काम करता है: SLASH लाइब्रेरियन को कुछ नया नहीं सिखाता है। इसके लिए महंगे पुन: प्रशिक्षण (retraining) की आवश्यकता नहीं है। इसके बजाय, यह केवल विचलित करने वाले "पहले शब्दों" (सिंक) की आवाज़ को कम कर देता है और "सॉ टूथ" पैटर्न (नक्शे के कनेक्शन) की आवाज़ को बढ़ा देता है
  • परिणाम: ध्यान को पुनर्वितरित करके, छिपा हुआ नक्शा अचानक स्पष्ट हो जाता है। अब लाइब्रेरियन बिना दोबारा प्रशिक्षित हुए सही ढंग से ऐसे सवालों के जवाब दे सकता है जैसे "क्या स्टेशन A से स्टेशन B तक कोई रास्ता है?" या "इस अणु (molecule) के गुण क्या हैं?"

मुख्य निष्कर्ष (सरल हिंदी में)

  1. यह एक "प्लग-एंड-प्ले" समाधान है: आपको लाइब्रेरियन के मस्तिष्क को फिर से बनाने की आवश्यकता नहीं है। आपको बस इस अटेंशन एडजस्टमेंट को लागू करना है जब वे किसी प्रश्न का उत्तर दे रहे हों। यह तुरंत काम करता है।
  2. यह कई मॉडल्स पर काम करता है: टीम ने लोकप्रिय AI मॉडल्स (जैसे Llama और Qwen) के विभिन्न संस्करणों पर इसका परीक्षण किया। लगभग हर मामले में, मॉडल्स ग्राफ और अणुओं को समझने में काफी बेहतर हो गए।
  3. यह सबके लिए जादू नहीं है: यह सुधार उन मॉडल्स पर सबसे अच्छा काम करता है जिन्हें अभी तक विशेष रूप से ग्राफ पर प्रशिक्षित नहीं किया गया है। यदि किसी मॉडल को पहले से ही ग्राफ समझने के लिए गहन प्रशिक्षण (fine-tuning) दिया गया है, तो उसने पहले ही "शोर" को अनदेखा करना सीख लिया है, इसलिए SLASH बहुत अधिक मूल्य नहीं जोड़ता है।
  4. यह "हलुसिनेशन" (Hallucinations) को रोकता है: एक परीक्षण मामले में, एक सामान्य मॉडल ने एक नक्शे को देखा और आत्मविश्वास के साथ एक ऐसा रास्ता बना दिया जो अस्तित्व में ही नहीं था (हलुसिनेशन)। SLASH के साथ, मॉडल ने सही ढंग से कहा, "नहीं, वहां कोई रास्ता नहीं है," क्योंकि वह वास्तव में संरचना को देख पा रहा था।

सीमा (Limitation)

पेपर नोट करता है कि यह ट्रिक हर स्थिति के लिए जादुई छड़ी नहीं है। यदि आप मॉडल को ऐसा "ग्राफ" देते हैं जहाँ संरचना का महत्व नहीं है (जैसे कि सेंटीमेंट एनालिसिस कार्य जहाँ केवल शब्दों का अर्थ मायने रखता है, न कि उनका क्रम), तो स्ट्रक्चरल अटेंशन को बढ़ाने से मॉडल वास्तव में खराब हो सकता है। यह एक कविता पढ़ने के लिए मैप-रीडिंग टूल का उपयोग करने जैसा है; कभी-कभी, आपको केवल शब्दों को पढ़ने की आवश्यकता होती है, उनके कनेक्शनों को नहीं।

सारांश

यह पेपर बताता है कि AI मॉडल्स में नक्शों और संरचनाओं को समझने की एक छिपी हुई प्रतिभा पहले से ही है, लेकिन उनका प्रशिक्षण उन्हें इसे अनदेखा करने के लिए मजबूर करता है। SLASH एक सरल, मुफ्त टूल है जो विचलित करने वाले शोर को शांत करता है और उस छिपी हुई प्रतिभा को उभारता है, जिससे AI बिना किसी अतिरिक्त प्रशिक्षण के ग्राफ और अणुओं के बारे में बहुत बेहतर तरीके से तर्क करने में सक्षम होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →