← नवीनतम पेपर
🤖 machine learning

Attention Sinks and Outliers in Attention Residuals

यह शोध पत्र OASIS को प्रस्तुत करता है, जो एक नवीन तकनीक है जो AttnResidual आर्किटेक्चर में अटेंशन सिंक्स (attention sinks) और एक्टिवेशन आउटलेयर्स (activation outliers) को कम करने के लिए इंटर-लेयर नल सिग्नलिंग (inter-layer null signaling) का लाभ उठाती है, जिससे इन्फरेंस स्थिरता (inference stability), क्वांटाइजेशन मजबूती (quantization robustness) और डाउनस्ट्रीम टास्क प्रदर्शन में महत्वपूर्ण सुधार होता है।

मूल लेखक: Haozheng Luo, Haoran Dai, Shaoyang Zhang, Xi Chen, Eric Hanchen Jiang, Yijiang Li, Jingyuan Huang, Chenghao Qiu, Chenwei Xu, Zhenyu Pan, Haotian Zhang, Binghui Wang, Yan Chen

प्रकाशित 2026-05-19
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Haozheng Luo, Haoran Dai, Shaoyang Zhang, Xi Chen, Eric Hanchen Jiang, Yijiang Li, Jingyuan Huang, Chenghao Qiu, Chenwei Xu, Zhenyu Pan, Haotian Zhang, Binghui Wang, Yan Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक विशाल, सुपर-स्मार्ट लाइब्रेरी (AI मॉडल) है जहाँ हजारों लाइब्रेरियन (लेयर्स) मिलकर आपके सवालों के जवाब देते हैं। बेहतर होने के लिए, इन पुस्तकालयों ने एक नई प्रणाली का उपयोग करना शुरू किया जिसे AttnResidual कहा जाता है। यह प्रणाली लाइब्रेरियन को न केवल किताबें पढ़ने देती है, बल्कि लाइब्रेरी के विभिन्न फ्लोरों के बीच नोट्स भी पास करने की अनुमति देती है ताकि वे अपने उत्तरों को और बेहतर बना सकें।

हालाँकि, इस शोध पत्र के लेखकों ने इस नई प्रणाली में एक गड़बड़ी (glitch) पाई। यह दो बड़ी समस्याएँ पैदा कर रहा था:

  1. "सायरन" प्रभाव (अटेंशन सिंक्स): पुरानी प्रणाली में, शेल्फ पर रखी सबसे पहली किताब (पहला टोकन) सारा ध्यान खींच लेती थी, जिससे बाकी सब कुछ दब जाता था। नई प्रणाली में, यह समस्या और भी बदतर हो गई। लाइब्रेरियन उस पहली किताब पर इतने केंद्रित हो गए कि उन्होंने कहानी के बाकी हिस्सों को सुनना ही बंद कर दिया।
  2. "ज़ोर से चिल्लाने" की समस्या (आउटलियर्स): कभी-कभी, एक लाइब्रेरियन इतना उत्साहित या भ्रमित हो जाता था कि वह इतना ज़ोर से चिल्लाता था (एक "आउटलियर" बनाता था) कि उनके नोट्स रखने के लिए इस्तेमाल होने वाले नाजुक उपकरणों को ही तोड़ देता था (क्वांटाइजेशन)। इससे लाइब्रेरी नाजुक हो जाती थी और अपनी मेमोरी को कंप्रेस (संकुचित) करने की कोशिश में क्रैश होने की संभावना बढ़ जाती थी।

शोध पत्र का दावा है कि नई प्रणाली ने इन समस्याओं को इसलिए बढ़ाया क्योंकि इसने लाइब्रेरियन को अपना ध्यान केवल असली किताबों और असली फ्लोरों के बीच वितरित करने के लिए मजबूर किया। यदि वे कहना चाहते थे कि "यहाँ जोड़ने के लिए कुछ भी नया नहीं है," तो उन्हें उस "कुछ नहीं" को एक असली किताब में जबरदस्ती डालना पड़ता था, जिससे संख्याएँ अजीब तरह से बहुत बड़ी और अस्थिर हो जाती थीं।

समाधान: OASIS (द "साइलेंट ब्रेक" बटन)

लेखक OASIS नामक एक समाधान प्रस्तावित करते हैं। OASIS को लाइब्रेरी सिस्टम में एक विशेष "साइलेंट ब्रेक" बटन जोड़ने के रूप में समझें।

यह कैसे काम करता है, इसके सरल उदाहरण यहाँ दिए गए हैं:

  • "नल" चैनल (द ब्रेक रूम): एक लाइब्रेरियन को किसी असली किताब में "कुछ नहीं!" चिल्लाने के लिए मजबूर करने के बजाय (जिससे ज़ोर से चिल्लाने वाली समस्या होती है), OASIS उन्हें एक समर्पित ब्रेक रूम देता है। यदि किसी लाइब्रेरियन के पास जोड़ने के लिए कुछ भी उपयोगी नहीं है, तो वे बस ब्रेक रूम में जा सकते हैं। यह असली किताबों को शांत रखता है और संख्याओं को स्थिर रखता है।
  • "टीम लीडर" सिग्नल (टोकन-टू-डेप्थ कपलिंग): पुरानी प्रणाली में, फ्लोर मैनेजरों (डेप्थ रूटिंग) को यह पता नहीं चलता था कि कोई विशिष्ट लाइब्रेरियन बस ब्रेक ले रहा है। OASIS एक सिग्नल जोड़ता है: "हे, यह पूरी टीम वर्तमान में ब्रेक रूम में है।" फिर फ्लोर मैनेजर को पता चल जाता है कि उस टीम को काम भेजना बंद कर देना है और उन टीमों पर ध्यान केंद्रित करना है जो वास्तव में काम कर रही हैं।

शोध पत्र ने क्या पाया

शोधकर्ताओं ने इन दो लोकप्रिय लाइब्रेरी मॉडल्स (Llama और Qwen) पर इस नए "ब्रेक रूम" सिस्टम का परीक्षण किया और पाया:

  • शांत लाइब्रेरियन: "चिल्लाने" वाली संख्याएँ (आउटलियर्स) लगभग 84% तक गिर गईं। लाइब्रेरी बहुत अधिक शांत हो गई।
  • कम जुनून: लाइब्रेरियन ने पहली किताब के प्रति जुनून दिखाना बंद कर दिया। "सायरन" प्रभाव काफी कम हो गया।
  • मजबूत उपकरण: क्योंकि संख्याएँ शांत थीं, वे लाइब्रेरी की मेमोरी को बहुत अधिक मजबूती से कंप्रेस (जैसे कि फ़ाइल को ज़िप करना) कर सकते थे बिना उसे तोड़े।
    • जब उन्होंने मेमोरी को भारी रूप से कंप्रेस किया (4-बिट तक), तो लाइब्रेरी की गणित की समस्याओं (GSM8K) को हल करने की क्षमता वास्तव में पुराने सिस्टम की तुलना में 23% सुधर गई
    • जब उन्होंने मध्यम कंप्रेशन (8-बिट) का उपयोग किया, तो लाइब्रेरी ने कम गलतियाँ (लोअर परप्लेक्सिटी) कीं, लगभग 73%

मुख्य निष्कर्ष (The Bottom Line)

शोध पत्र का तर्क है कि AI को "कुछ नहीं" रखने के लिए एक विशिष्ट स्थान (एक नल चैनल) देकर और सिस्टम को यह बताने से कि उसका एक हिस्सा कुछ नहीं कर रहा है, हम AI को भ्रमित होने, चिल्लाने या पहले शब्द पर जुनूनी होने से रोक सकते हैं। यह AI को अधिक स्थिर, फोन या छोटे कंप्यूटरों के लिए छोटा करना आसान, और कठिन समस्याओं को हल करने में बेहतर बनाता है, और यह सब बिना पूरी लाइब्रेरी को फिर से प्रशिक्षित किए किया जा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →