← नवीनतम पेपर
🔬 physics

Multiscale POD of Transformer Attention Fields: Scale-Selective Analysis via Morlet Scalogram

यह शोध पत्र एक नवीन, आर्किटेक्चर-अज्ञेय (architecture-agnostic) ढांचे को प्रस्तुत करता है जो ट्रांसफार्मर अटेंशन फील्ड्स का विश्लेषण करने के लिए प्रॉपर ऑर्थोगोनल डिकंपोजिशन (POD) और मोरलट वेवलेट ट्रांसफॉर्म्स को अनुकूलित करता है, जो परत-निर्भर स्केल संगठन को प्रकट करता है और भाषाई एनोटेशन की आवश्यकता के बिना अटेंशन जटिलता के लिए एक डेटा-संचालित मीट्रिक प्रदान करता है।

मूल लेखक: Athanasios Zeris

प्रकाशित 2026-06-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Athanasios Zeris

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: एक ट्रांसफॉर्मर के "शोर" को सुनना

कल्पना कीजिए कि एक ट्रांसफॉर्मर मॉडल (चैटबॉट्स के पीछे का AI) एक विशाल, अराजक ऑर्केस्ट्रा है जो संगीत का एक टुकड़ा बजा रहा है। हर बार जब यह एक वाक्य पढ़ता है, तो संगीतकार ("अटेंशन हेड्स") एक साथ बज रहे होते हैं। एक इंसान के कान के लिए, यह शोर की एक दीवार जैसा सुनाई देता है।

यह पेपर उस ऑर्केस्ट्रा को सुनने का एक नया तरीका पेश करता है। हर एक नोट को समझने की कोशिश करने के बजाय, लेखक POD (प्रॉपर ऑर्थोगोनल डिकम्पोजिशन) नामक एक गणितीय उपकरण का उपयोग करते हैं ताकि उन मुख्य धुनों को खोजा जा सके जो बार-बार दोहराई जाती हैं।

वे ट्रांसफॉर्मर के अटेंशन (कि कैसे मॉडल शब्दों को एक-दूसरे से जोड़ता है) को एक अशांत नदी की तरह मानते हैं। जिस तरह एक नदी में बड़े घूमते हुए करंट और छोटी लहरें होती हैं, उसी तरह ट्रांसफॉर्मर में अटेंशन के बड़े, व्यापक पैटर्न और छोटे, विशिष्ट पैटर्न होते हैं। लक्ष्य "बड़े भंवरों" को "छोटी लहरों" से अलग करना है ताकि यह देखा जा सके कि मॉडल वास्तव में क्या कर रहा है।

दो-चरणीय प्रक्रिया: "लहर" और "छलनी"

लेखक शोर को साफ करने के लिए एक चतुर दो-चरणीय विधि का उपयोग करते हैं:

  1. वेव डिटेक्टर (मोर्लेट स्केलोग्राम - Morlet Scalogram):
    कल्पना कीजिए कि आप एक हेलीकॉप्टर से नदी को देख रहे हैं। आप जानना चाहते हैं: "बड़ी लहरें कहाँ हैं, और छोटी लहरें कहाँ हैं?"
    लेखक मोर्लेट स्केलोग्राम नामक टूल का उपयोग एक रडार की तरह करते हैं। यह ट्रांसफॉर्मर के अटेंशन को स्कैन करता है और उन्हें ठीक-ठीक बताता है कि वाक्य में कहाँ और किस आकार (स्केल) पर महत्वपूर्ण पैटर्न हो रहे हैं।
  • छोटे स्केल (Small scales): छोटे पैटर्न, जैसे किसी शब्द को उसके ठीक बगल वाले अक्षर से जोड़ना (व्याकरण)।
  • बड़े स्केल (Large scales): लंबे पैटर्न, जैसे पैराग्राफ की शुरुआत को अंत से जोड़ना (कहानी की संरचना)।
  1. छलनी (स्केल-सिलेक्टिव POD - Scale-Selective POD):
    एक बार जब उन्हें पता चल जाता है कि लहरें कहाँ हैं, तो वे पानी को फिल्टर करने के लिए एक "छलनी" (गौसियन विंडो) का उपयोग करते हैं। वे नदी को बाल्टियों में अलग करते हैं: एक बाल्टी छोटी लहरों के लिए, एक मध्यम लहरों के लिए, और एक बड़े ज्वार के लिए।
    फिर, वे प्रत्येक बाल्टी पर अलग से POD लागू करते हैं। POD एक "बेस्ट-ऑफ" फिल्टर की तरह है। यह "छोटी लहरों" वाली बाल्टी के सभी पैटर्न को देखता है और कहता है, "ठीक है, इन सभी सूक्ष्म गतिविधियों में से, ये तीन विशिष्ट गतिविधियाँ सबसे अधिक बार होती हैं और इनमें सबसे अधिक ऊर्जा होती है।" यह बड़े ज्वार वाली बाल्टी के लिए भी यही करता है।

उन्होंने क्या पाया: परतों (Layers) के अलग-अलग काम हैं

पैटर्न को आकार के आधार पर अलग करके, लेखकों ने एक स्पष्ट नियम खोजा कि ट्रांसफॉर्मर की परतें (AI द्वारा वाक्य को प्रोसेस करने के चरण) कैसे काम करती हैं:

  • शुरुआती परतें (द "माइक्रोस्कोप"): पहली कुछ परतें बारीक विवरणों के प्रति जुनूनी होती हैं। वे छोटे स्केल (जैसे 3-7 अक्षर) पर ध्यान केंद्रित करती हैं। वे "लहरों" को देख रही होती हैं—स्पेलिंग, विराम चिह्न और तत्काल व्याकरण।
  • बाद की परतें (द "टेलीस्कोप"): जैसे-जैसे जानकारी मॉडल में गहराई तक जाती है, ध्यान बदल जाता है। बाद की परतें छोटी लहरों को अनदेखा कर देती हैं और मोटे स्केल (20-50+ अक्षर) पर ध्यान केंद्रित करती हैं। वे "ज्वार" को देख रही होती हैं—पूरे वाक्यांशों, क्लॉज और समग्र कहानी का अर्थ।

उपमा (Analogy): एक किताब पढ़ने के बारे में सोचें।

  • लेयर 1 आपके अक्षरों को स्कैन करने जैसा है ताकि यह सुनिश्चित किया जा सके कि उनकी स्पेलिंग सही है।
  • लेयर 6 आपके मस्तिष्क द्वारा अध्याय के कथानक (plot) को समझने जैसा है।
    पेपर यह सिद्ध करता है कि मॉडल स्वाभाविक रूप से इसी तरह खुद को व्यवस्थित करता है: यह छोटी चीजों से शुरू होता है और बड़ी तस्वीर बनाने की ओर बढ़ता है।

अटेंशन की "ऊर्जा" (Energy)

लेखकों ने इन पैटर्न की "ऊर्जा" को भी मापा। भौतिकी में, ऊर्जा बताती है कि एक लहर कितनी मजबूत है। ट्रांसफॉर्मर में, "ऊर्जा" बताती है कि एक पैटर्न कितना महत्वपूर्ण है।

  • निष्कर्ष: शुरुआती परतों में, ऊर्जा हर जगह फैली हुई होती है (जैसे स्टैटिक शोर)। यह अनुमान लगाना कठिन है कि मॉडल आगे क्या करेगा क्योंकि वह बहुत से सूक्ष्म विवरणों को देख रहा है।
  • निष्कर्ष: बाद की परतों में, ऊर्जा केवल कुछ मजबूत पैटर्न में केंद्रित हो जाती है। मॉडल बहुत ही अनुमानित (predictable) और मुख्य विचारों पर केंद्रित हो जाता है।

उन्होंने इसे मापने के लिए एक "जटिलता स्कोर" (स्पेक्ट्रल कंसंट्रेशन इंडेक्स) बनाया।

  • उच्च स्कोर: मॉडल भ्रमित है या बहुत अधिक विशिष्ट विवरणों को देख रहा है (शुरुआती परतें)।
  • कम स्कोर: मॉडल ने मुख्य विषय को पा लिया है और वह उसी पर ध्यान केंद्रित कर रहा है (बाद की परतें)।

यह क्यों मायने रखता है (पेपर के अनुसार)

पेपर का दावा है कि यह विधि शक्तिशाली है क्योंकि इसे AI को बदलने या उससे सवाल पूछने की आवश्यकता नहीं है। यह बस AI को काम करते हुए देखती है और "प्रमुख पैटर्न" खोजने के लिए गणित का उपयोग करती है।

  1. यह इष्टतम (Optimal) है: गणित गारंटी देता है कि उनके द्वारा खोजे गए पैटर्न AI के व्यवहार को कम से कम लाइनों के साथ सारांशित करने का सबसे अच्छा संभव तरीका है। आप सटीकता खोए बिना इस जानकारी को और अधिक कंप्रेस नहीं कर सकते।
  2. यह "हेड्स" (Heads) को समझाता है: ट्रांसफॉर्मर में आमतौर पर प्रति परत 8 "हेड्स" (विशेषज्ञ प्रोसेसर) होते हैं। पेपर सुझाव देता है कि शायद हमें हर लेयर के लिए 8 हेड्स की आवश्यकता नहीं है।
    • शुरुआती परतों को अराजक शोर को संभालने के लिए अधिक हेड्स की आवश्यकता हो सकती है।
    • बाद की परतों को कम हेड्स की आवश्यकता हो सकती है क्योंकि पैटर्न इतने स्पष्ट और सरल हैं।
  3. यह एक संरचनात्मक उपमा है, भौतिकी नहीं: लेखक सावधान हैं कि वे यह नहीं कह रहे हैं कि AI वास्तव में एक तरल पदार्थ या नदी है। वे केवल नदियों का अध्ययन करने के लिए उपयोग किए जाने वाले गणित को उधार ले रहे हैं। इसमें कोई पानी या हवा शामिल नहीं है; यह केवल डेटा को व्यवस्थित करने का एक तरीका है।

एक वाक्य में सारांश

यह पेपर एक गणितीय "वेव डिटेक्टर" का उपयोग करके एक ट्रांसफॉर्मर के अटेंशन को छोटे और बड़े पैटर्न में अलग करता है, जिससे यह पता चलता है कि मॉडल सूक्ष्म विवरणों पर ध्यान केंद्रित करने से शुरू होता है और धीरे-धीरे बड़े विषयों को समझने की ओर बढ़ता है, और साथ ही यह भी सिद्ध करता है कि इन पैटर्न को हमारी सोच से कहीं अधिक सरलता से सारांशित किया जा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →