← नवीनतम पेपर
🤖 machine learning

WAV: Multi-Resolution Block Residual Routing for Deep Decoder-Only Transformers

यह शोधपत्र WAV v1 को प्रस्तुत करता है, जो गहरे डिकोडर-ओनली (decoder-only) ट्रांसफॉर्मर्स के लिए एक हल्का मल्टी-रेज़ोल्यूशन रेसिडुअल रूटिंग (multi-resolution residual routing) तरीका है जो अटेंशन-एमएलपी (attention-MLP) और अर्ली-लेट डायनेमिक्स (early-late dynamics) को कैप्चर करने के लिए दिशात्मक विवरण आधारों (directional detail bases) के साथ ब्लॉक-स्तरीय सारांशों को संवर्धित करता है, जो 48 परतों पर मौजूदा बेसलाइनों की तुलना में लॉन्ग-कॉन्टेक्स्ट लैंग्वेज मॉडलिंग कार्यों पर प्रदर्शन में महत्वपूर्ण सुधार करता है।

मूल लेखक: Kehan Wang

प्रकाशित 2026-06-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kehan Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत गहरे, बहुत बुद्धिमान रोबोट (एक "ट्रांसफॉर्मर") को कहानियाँ लिखना सिखाने की कोशिश कर रहे हैं। इस रोबोट को स्मार्ट बनाने के लिए, हम कई परतों वाले "सोचने के ब्लॉक्स" (thinking blocks) को एक के ऊपर एक रखते हैं। स्टैक जितना गहरा होगा, रोबोट उतना ही स्मार्ट हो सकता है।

हालाँकि, वर्तमान में इन रोबोटों के सीखने के तरीके में एक समस्या है।

पुराना तरीका: "ग्रुप फोटो" की समस्या

स्टैंडर्ड डीप लर्निंग में, हर बार जब रोबोट की एक परत सोचती है, तो वह अपने अब तक के सभी विचारों की एक चलती हुई सूची में अपना नया विचार जोड़ देती है। इसे "रेसिड्यूअल स्ट्रीम" (residual stream) कहा जाता है।

इसे एक ग्रुप फोटो की तरह समझें। यदि आपके पास 48 लोगों की एक टीम है, और आप याद रखना चाहते हैं कि टीम ने क्या किया, तो पुराना तरीका पूरी टीम की एक एकल, धुंधली ग्रुप फोटो लेता है। यह आपको बताता है, "यहाँ टीम की कुल स्थिति (position) है।"

लेकिन यह फोटो विवरणों को छोड़ देती है। यह आपको नहीं बताती कि:

  • कौन आगे खड़ा था और कौन पीछे?
  • किसने लाल शर्ट (अटेंशन) पहनी थी बनाम किसने नीली शर्ट (MLP)?
  • क्या टीम दिन के पहले भाग में आगे बढ़ी और दूसरे भाग में पीछे हटी?

पुराना तरीका (जिसे ब्लॉक अटेंशन रेसिडुअल्स कहा जाता है) इसे ठीक करने की कोशिश करता है, लेकिन पूरे समूह के बजाय छोटे समूहों (ब्लॉक्स) की फोटो लेकर। लेकिन फिर भी, यह केवल उस समूह की औसत स्थिति को ही याद रखता है। यह उस समूह के भीतर के उतार-चढ़ाव और दिशा के विवरण को फेंक देता है।

नया विचार: WAV v1 (एक "विस्तृत मानचित्र")

लेखक, केहन वांग, एक नया तरीका प्रस्तावित करते हैं जिसे WAV v1 कहा जाता है। केवल एक धुंधली ग्रुप फोटो लेने के बजाय, WAV v1 हर ग्रुप फोटो में दो अतिरिक्त "विस्तृत मानचित्र" (detail maps) जोड़ता है।

कल्पना कीजिए कि आप हाइकर्स (पदयात्रियों) के एक समूह (परतों का एक ब्लॉक) को देख रहे हैं।

  1. मुख्य फोटो (ब्लॉक सारांश): यह पुराना तरीका है। यह दिखाता है कि समूह कहाँ पहुँचा।
  2. मैप A (द "फेज़" डिटेल): यह मानचित्र "नेताओं" (अटेंशन लेयर्स) और "अनुयायियों" (MLP लेयर्स) के बीच के अंतर को उजागर करता है। यह पूछता है: "क्या नेताओं ने समूह को एक दिशा में खींचा, या अनुयायियों ने उन्हें दूसरी दिशा में खींचा?"
  3. मैप B (द "स्प्लिट" डिटेल): यह मानचित्र "सुबह की हाइक" (ब्लॉक का पहला आधा हिस्सा) और "दोपहर की हाइक" (ब्लॉक का दूसरा आधा हिस्सा) के बीच के अंतर को उजागर करता है। यह पूछता है: "क्या समूह ने शुरुआत में जोश दिखाया और फिर थक गया, या उन्होंने धीमी शुरुआत की और फिर गति पकड़ी?"

WAV v1 मुख्य फोटो को फेंकता नहीं है; यह बस इन दो अतिरिक्त मानचित्रों को जोड़ता है ताकि रोबट यात्रा के आकार को देख सके, न कि केवल मंजिल को।

यह कैसे काम करता है (एक "सुरक्षा जाल")

इन अतिरिक्त मानचित्रों को जोड़ना जोखिम भरा है। यदि आप रोबोट को बहुत जल्दी बहुत अधिक नई जानकारी देते हैं, तो वह भ्रमित हो सकता है और क्रैश हो सकता है (इसे ट्रेनिंग में "अस्थिरता" या instability कहा जाता है)।

इसे रोकने के लिए, लेखक एक चतुर सुरक्षा ट्रिक का उपयोग करते हैं:

  • "छेड़छाड़ न करें" का संकेत: जब रोबोट ट्रेनिंग शुरू करता है, तो उसे इन नए मानचित्रों को ज्यादातर अनदेखा करने के लिए कहा जाता है। यह रोबोट को एक भारी बैकपैक देने जैसा है जिसके साथ एक नोट लगा है: "इसे अभी मत खोलना।"
  • "वॉल्यूम नॉब": रोबोट को इन मानचित्रों की आवाज़ (volume) धीरे-धीरे बढ़ाने की अनुमति दी जाती है, लेकिन केवल तभी जब वह उन्हें वास्तव में मददगार पाता है।
  • "स्केल मैच": मानचित्रों को इस तरह समायोजित किया जाता है कि वे मुख्य फोटो की तुलना में बहुत तेज़ या बहुत धीमी न हों।

परिणाम: गहराई मायने रखती है

लेखक ने अलग-अलग परतों वाले रोबोटों (12, 24, और 48) पर इसका परीक्षण किया। परिणाम बहुत दिलचस्प थे और एक स्पष्ट पैटर्न का पालन करते थे:

  • उथले रोबोट (12 लेयर्स): अतिरिक्त मानचित्र बेकार थे। रोबोट पहले से ही इतना सरल था कि धुंधली ग्रुप फोटो ही काफी थी। मानचित्र जोड़ने से यह वास्तव में थोड़ा खराब हो गया क्योंकि यह केवल अतिरिक्त शोर (noise) था।
  • मध्यम रोबोट (24 लेयर्स): मानचित्रों ने मदद करना शुरू किया। रोबोट पुराने तरीके के साथ प्रतिस्पर्धी था।
  • गहरे रोबोट (48 लेयर्स): यहीं पर WAV v1 चमक उठा। रोबोट जितना गहरा होता, उसे उन अतिरिक्त विवरणों की उतनी ही अधिक आवश्यकता होती। 48 परतों के साथ, WAV v1 का उपयोग करने वाला रोबोट पुराने तरीके वाले रोबोट की तुलना में काफी बेहतर तरीके से सीखा।

निष्कर्ष

यह पेपर सुझाव देता है कि जैसे-जैसे हम गहरे और गहरे AI मॉडल बनाते जा रहे हैं, हम केवल यह जानकर संतुष्ट नहीं रह सकते कि "हम कहाँ पहुँचे।" हमें यह समझने की भी आवश्यकता है कि हम वहाँ कैसे पहुँचे, इसकी दिशा और संरचना क्या थी।

WAV v1 एक हल्का अपग्रेड है जो गहरे AI मॉडल को उनके अपने सोचने के ब्लॉक्स की "आंतरिक गतिशीलता" (internal dynamics) को देखने की अनुमति देता है। यह एक साधारण GPS से अपग्रेड करने जैसा है जो केवल आपकी मंजिल दिखाता है, और अब वह आपको ट्रैफिक पैटर्न, सड़क की स्थिति, और यह भी दिखाता है कि आपने रास्ते में कितनी तेज़ या धीमी गति से गाड़ी चलाई।

संक्षेप में: उथले AI के लिए, पुराना तरीका ठीक है। लेकिन बहुत गहरे AI के लिए, यात्रा के "दिशात्मक विवरणों" को जानना एक बड़ा अंतर पैदा करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →