← नवीनतम पेपर
🤖 machine learning

Contribution Weights: A Geometrical Analysis of Self-Attention Transformers

यह शोधपत्र "कंट्रीब्यूशन वेट्स" (Contribution Weights) को प्रस्तुत करता है, जो एक प्रोजेक्शन-आधारित मीट्रिक है जो वैल्यू वेक्टर ज्योमेट्री (value vector geometry) को शामिल करके पारंपरिक अटेंशन वेट्स में सुधार करता है ताकि अर्थपूर्ण रूप से महत्वपूर्ण टोकन की अधिक सटीक पहचान की जा सके और यह प्रकट करता है कि अटेंशन सिंक्स (attention sinks) मॉडल रिप्रेजेंटेशन को स्थिर करने के लिए सक्रिय रूप से सूचना को दबाते हैं।

मूल लेखक: Harry Jake Cunningham, Nicola Muca Cirone

प्रकाशित 2026-06-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Harry Jake Cunningham, Nicola Muca Cirone

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Contribution Weights: A Geometrical Analysis of Self-Attention Transformers" शोध पत्र का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ हिंदी अनुवाद दिया गया है।

बड़ी समस्या: "ज़ोर से चिल्लाना" बनाम "वास्तविक प्रभाव"

कल्पना कीजिए कि लोगों का एक बड़ा समूह किसी अंतिम निर्णय (AI का आउटपुट) पर पहुँचने की कोशिश कर रहा है। एक मानक लार्ज लैंग्वेज मॉडल (LLM) में, एक तंत्र होता है जिसे सेल्फ-अटेंशन (Self-Attention) कहा जाता है। आप इसे एक वोटिंग सिस्टम के रूप में देख सकते हैं जहाँ बातचीत में हर व्यक्ति (टोकन) यह चिल्लाकर बताता है कि वह अंतिम निर्णय को कितना प्रभावित करना चाहता है।

लंबे समय से, शोधकर्ताओं का मानना था कि जो सबसे ज़ोर से चिल्लाता है (जिसका अटेंशन वेट/attention weight सबसे अधिक होता है) वही सबसे महत्वपूर्ण व्यक्ति है। यदि किसी टोकन को 90% "चिल्लाने का वॉल्यूम" मिला, तो सभी ने मान लिया कि वह 90% काम कर रहा है।

यह शोध पत्र कहता है कि यह गलत है।

लेखक कहते हैं कि सिर्फ इसलिए कि कोई बहुत ज़ोर से चिल्ला रहा है, इसका मतलब यह नहीं है कि वह वास्तव में बदलाव ला रहा है। कल्पना कीजिए कि एक व्यक्ति बहुत ज़ोर से चिल्ला रहा है, लेकिन वह गलत दिशा में चिल्ला रहा है या उसने बहुत हल्की वस्तु पकड़ी हुई है। भले ही वह सबसे ज़ोर से चिल्लाए, वह वास्तव में समूह को उस दिशा में खींच सकता है जहाँ समूह नहीं जाना चाहता, या उसका योगदान इतना कम हो सकता है कि उसका कोई प्रभाव ही न पड़े।

नया समाधान: "कंट्रीब्यूशन वेट्स" (Contribution Weights)

इसे ठीक करने के लिए, लेखकों ने एक नया मीट्रिक बनाया जिसे "कंट्रीब्यूशन वेट्स" कहा जाता है।

इसे इस प्रकार समझें: केवल यह मापने के बजाय कि कोई व्यक्ति कितनी ज़ोर से चिल्ला रहा है, कंट्रीब्यूशन वेट्स एक साथ तीन चीज़ों को मापता है:

  1. वॉल्यूम (Volume): उन्हें कितना ध्यान मिला? (चिल्लाहट)।
  2. शक्ति (Strength): वे कितनी भारी वस्तु पकड़े हुए हैं? (वैल्यू वेक्टर का परिमाण/magnitude)।
  3. दिशा (Direction): क्या वे समूह को सही दिशा में धकेल रहे हैं, या वे प्रवाह के विरुद्ध धकेल रहे हैं? (दिशात्मक संरेखण/directional alignment)।

नौका (Rowboat) का उदाहरण:
कल्पना कीजिए कि लोगों की एक टीम नाव चला रही है।

  • पुराना तरीका (अटेंशन वेट्स): आप देखते हैं कि कौन सबसे ज़्यादा मेहनत से चप्पू चला रहा है (उच्च प्रयास)। आप मान लेते हैं कि सबसे मेहनती चलाने वाला सबसे महत्वपूर्ण है।
  • नया तरीका (कंट्रीब्यूशन वेट्स): आप देखते हैं कि वास्तव में नाव को आगे कौन बढ़ा रहा है।
    • यदि व्यक्ति A ज़ोर से चप्पू चला रहा है (उच्च अटेंशन) लेकिन वह पीछे की ओर (नेगेटिव अलाइनमेंट) चप्पू चला रहा है, तो वह वास्तव में नाव को धीमा कर रहा है।
    • यदि व्यक्ति B मध्यम गति से चप्पू चला रहा है लेकिन वह नाव की दिशा के साथ पूरी तरह तालमेल में है, तो वह वास्तविक काम कर रहा है।

शोध पत्र दिखाता है कि "कंट्रीब्यूशन वेट" मीट्रिक यह पहचानने में बहुत बेहतर है कि वास्तव में नाव को आगे बढ़ाने में कौन मदद कर रहा है।

बड़ी खोज: "सिंक" (Sink) टोकन्स

यह शोध पत्र एक अजीब घटना पर बहुत अधिक ध्यान केंद्रित करता है जिसे "अटेंशन सिंक" (Attention Sinks) कहा जाता है।

कई AI मॉडलों में, वाक्य का सबसे पहला टोकन (जैसे कि "स्टार्ट" बटन या कोई विशेष प्रतीक) बहुत अधिक अटेंशन प्राप्त करता है। उसे सारा "चिल्लाने का वॉल्यूम" मिल जाता है। वर्षों तक, शोधकर्ताओं ने सोचा कि यह टोकन केवल एक निष्क्रिय स्पंज (passive sponge) है, जो अतिरिक्त अटेंशन को सोख लेता है ताकि अन्य टोकन ध्यान केंद्रित कर सकें। उन्होंने इसे अटेंशन के लिए एक "कचरे के डिब्बे" (trash can) के रूप में देखा।

यह शोध पत्र इस कहानी को पूरी तरह बदल देता है।

अपने नए "कंट्रीब्यूशन वेट" टूल का उपयोग करते हुए, लेखकों ने पाया कि ये "सिंक" टोकन निष्क्रिय स्पंज नहीं हैं। वे सक्रिय व्यवधान पैदा करने वाले (active saboteurs) हैं (अच्छे अर्थ में!)।

  • ज्यामिति (Geometry): पहला टोकन एक बहुत ही हल्की वस्तु पकड़े हुए है (कम मैग्नीट्यूड) और वह बाकी सभी के विपरीत दिशा में है (नेगेटिव अलाइनमेंट)।
  • प्रभाव: क्योंकि यह विपरीत दिशा में है, यह एक ब्रेक (brake) की तरह कार्य करता है। यह वाक्य के अन्य हिस्सों से आने वाले कमजोर, भ्रमित संकेतों से उत्पन्न होने वाले "शोर" (noise) को रद्द कर देता है।
  • परिणाम: इस "ब्रेक" के बिना, कई छोटे, कमजोर चलाने वालों के संचित शोर के कारण नाव अपने रास्ते से भटक जाएगी। सिंक टोकन इस भटकाव को रोकने के लिए सक्रिय रूप से शोर को दबाता है ताकि नाव स्थिर रहे।

लेखकों ने पाया कि यदि आप इस "सिंक" टोकन को हटा देते हैं, तो नाव (AI) वाक्य को समझने में वास्तव में बदतर हो जाती है, भले ही पुराने मीट्रिक्स के अनुसार वह सिंक टोकन "कुछ भी नहीं" कर रहा था।

उन्होंने क्या परीक्षण किया

अपने तर्क को सिद्ध करने के लिए, लेखों ने AI मॉडलों पर एक "सर्जरी" की:

  1. उन्होंने विभिन्न मॉडलों (जैसे LLaMA, Mistral, आदि) को लिया।
  2. उन्होंने पुराने तरीके (अटेंशन) और नए तरीके (कंट्रीब्यूशन) के आधार पर सबसे "महत्वपूर्ण" टोकनों को हटाने की कोशिश की।
  3. परिणाम: जब उन्होंने पुराने तरीके के आधार पर टोकन हटाए, तो AI का प्रदर्शन तुरंत गिर गया। जब उन्होंने नए तरीके के आधार पर टोकन हटाए, तो AI काफी लंबे समय तक पूरी तरह से काम करता रहा।

इससे यह सिद्ध हुआ कि नया तरीका सही ढंग से उन टोकनों की पहचान करता है जो वास्तव में भारी काम कर रहे हैं और जो केवल "ज़ोर से चिल्लाने" वाले लेकिन बेकार थे।

सारांश

  • गलती: हम पहले सोचते थे कि "ज़ोर से चिल्लाना = महत्वपूर्ण होना।"
  • सुधार: अब हम जानते हैं कि "महत्वपूर्ण = ज़ोर से चिल्लाना + मज़बूत वस्तु + सही दिशा।"
  • आश्चर्य: "स्टार्ट" टोकन, जिसे सारा अटेंशन मिलता है, केवल एक निष्क्रिय प्लेसहोल्डर नहीं है। यह एक सक्रिय स्टेबलाइज़र (stabilizer) है जो शोर के विरुद्ध धक्का देकर AI की सोच को स्पष्ट रखने के लिए काम करता है।

शोध पत्र निष्कर्ष निकालता है कि AI कैसे सोचता है, इसे वास्तव में समझने के लिए, हम केवल यह नहीं देख सकते कि कौन सबसे ज़ोर से चिल्ला रहा है; हमें इस बात की ज्यामिति को देखना होगा कि वे बातचीत को आगे बढ़ाने के लिए कैसे धक्का दे रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →