← नवीनतम पेपर
🤖 machine learning

Parallax: Parameterized Local Linear Attention for Language Modeling

यह शोध पत्र पैरलैक्स (Parallax) को प्रस्तुत करता है, जो एक स्केलेबल और संख्यात्मक रूप से स्थिर पैरामीटराइज्ड लोकल लीनियर अटेंशन (Local Linear Attention) तंत्र है, जो LLA की कम्प्यूटेशनल बाधाओं को समाप्त करके, हार्डवेयर दक्षता को अनुकूलित करके और म्यूऑन (Muon) ऑप्टिमाइज़र के साथ एक नवीन तालमेल प्रदर्शित करके लैंग्वेज मॉडलिंग में पारेटो सुधार (Pareto improvements) प्राप्त करता है।

मूल लेखक: Yifei Zuo, Dhruv Pai, Zhichen Zeng, Alec Dewulf, Shuming Hu, Zhaoran Wang

प्रकाशित 2026-05-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yifei Zuo, Dhruv Pai, Zhichen Zeng, Alec Dewulf, Shuming Hu, Zhaoran Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कहानी को याद करने की कोशिश कर रहे हैं जो आपने अभी सुनी है। लार्ज लैंग्वेज मॉडल्स (LLMs) की दुनिया में, मस्तिष्क के उस हिस्से को जो इस स्मृति के लिए जिम्मेदार है, अटेंशन (Attention) कहा जाता है। वर्षों से, अटेंशन के काम करने का मानक तरीका ऐसा रहा है जैसे शब्दों की एक सूची को देखना और प्रत्येक को एक "प्रासंगिकता स्कोर" (relevance score) देना कि वह कितना अलग दिखता है। यदि कोई शब्द बहुत अलग है, तो उसे उच्च स्कोर मिलता है; यदि वह उबाऊ है, तो उसे कम स्कोर मिलता है। इसे सॉफ्टमैक्स अटेंशन (Softmax Attention) कहा जाता है।

हालाँकि, इस तरीके में एक दोष है: यह एक मानचित्र को देखने जैसा है जहाँ आप केवल समतल, औसत भूभाग देख पाते हैं। यह ढलानों और घुमावों को मिस कर देता है। एक नया विचार जिसे लोकल लीनियर अटेंशन (Local Linear Attention - LLA) कहा गया, उसने इस "ढलान" को देखने की कोशिश की, न कि केवल समतल औसत को। यह ऐसा है जैसे यह महसूस करना कि एक गेंद कहाँ लुढ़केगी, यह जानने के लिए नहीं कि वह कहाँ है, बल्कि यह जानने के लिए कि पहाड़ी कितनी खड़ी है।

समस्या क्या थी? इस "ढलान" विधि के लिए गणित बहुत भारी और अस्थिर था जिसे विशाल AI मॉडल्स वास्तविक जीवन में उपयोग कर सकें। यह एक फॉर्मूला 1 कार को कच्ची सड़क पर चलाने की तरह था; इसका इंजन बहुत शक्तिशाली था लेकिन रास्ता उसके अनुकूल नहीं था।

अब आता है पैरलैक्स (Parallax)

पैरलैक्स क्या है?

पैरलैक्स उस "ढलान" विधि का एक नया, सुव्यवस्थित संस्करण है। लेखकों ने मूल विचार के जटिल, भारी गणित को लिया और कठिन हिस्सों को एक चतुर, सीखने योग्य शॉर्टकट (learnable shortcut) से बदल दिया।

इसे इस तरह सोचिए:

  • पुराना तरीका (Softmax): आप एक लाइब्रेरियन से पूछते हैं, "कौन सी किताब सबसे अधिक प्रासंगिक है?" लाइब्रेरियन शीर्षकों को देखता है और उस एक को चुनता है जो सबसे अलग सुनाई देता है।
  • "ढलान" वाला तरीका (LLA): लाइब्रेरियन को एहसास होता है कि प्रासंगिकता केवल शीर्षक के बारे में नहीं है; यह इस बारे में है कि आप जिस शीर्षक को देख रहे हैं, उसके आसपास के शीर्षक कैसे बदलते हैं। लेकिन इस बदलाव की गणना करने के लिए हर एक शब्द के लिए एक सुपर-कंप्यूटर की आवश्यकता होती है।
  • पैरलैक्स (Parallax): लाइब्रेरियन एक विशेष ट्रिक सीख जाता है। हर बार भारी गणित करने के बजाय, वे एक छोटी, स्मार्ट नोटबुक (एक सीखा हुआ प्रोजेक्टर) रखते हैं जो संदर्भ के आधार पर तुरंत "ढलान" का अनुमान लगा लेती है। यह तेज़, स्थिर और आश्चर्यजनक रूप से सटीक है।

"जादुई" सामग्री: ऑप्टिमाइज़र (The Optimizer)

इस पेपर की सबसे आश्चर्यजनक खोजों में से एक यह है कि पैरलैक्स उस मानक "इंजन" के साथ अच्छा काम नहीं करता है जिसका उपयोग AI मॉडल्स को प्रशिक्षित करने के लिए किया जाता है (जिसे AdamW कहा जाता है)। यह एक हाई-परफॉर्मेंस रेसिंग इंजन को कार में डालने जैसा है लेकिन गलत ईंधन का उपयोग करने जैसा; कार लड़खड़ाने लगती है।

पेपर ने पाया कि पैरलैक्स को एक विशिष्ट, नए प्रकार के ईंधन की आवश्यकता है जिसे म्यून (Muon) कहा जाता है। जब आप म्यून का उपयोग करते हैं, तो पैरलैक्स पूरी क्षमता से चलता है और अपनी पूरी शक्ति को अनलॉक करता है। म्यून के बिना, पैरलैक्स पुराने तरीके से केवल थोड़ा ही बेहतर है। म्यून के साथ, यह काफी अधिक स्मार्ट हो जाता है। यह एक दुर्लभ मामला है जहाँ "इंजन" (ऑप्टिमाइज़र) और "कार का डिज़ाइन" (आर्किटेक्चर) को दौड़ जीतने के लिए पूरी तरह से मेल खाना चाहिए।

यह कितना तेज़ है?

लेखकों ने इसे केवल स्मार्ट ही नहीं बनाया; उन्होंने इसे तेज़ भी बनाया। उन्होंने आधुनिक ग्राफिक्स कार्डों के लिए विशेष रूप से एक कस्टम "इंजन" (कंप्यूटर कोड कर्नल) बनाया।

  • उनका दावा है कि "डिकोडिंग" चरण के दौरान (जब AI अगला शब्द लिख रहा होता है), उनकी विधि वर्तमान उद्योग मानक (फ्लैशअटेंशन - FlashAttention) के समान या उससे भी तेज़ है, भले ही वह अधिक जटिल गणित करती है।
  • उन्होंने इसे मेमोरी के कुशल उपयोग द्वारा हासिल किया, डेटा स्ट्रीम का पुन: उपयोग करके ताकि कंप्यूटर को लगातार नई जानकारी लेने के लिए रुकना न पड़े।

परिणाम

टीम ने दो आकार के AI मॉडल्स (0.6 बिलियन और 1.7 बिलियन पैरामीटर्स) पर पैरलैक्स का परीक्षण किया।

  • अधिक स्मार्ट: परीक्षणों में, पैरलैक्स मॉडल समान आकार के मानक मॉडल्स की तुलना में लगातार कम गलतियाँ (कम पर्प्लेक्सिटी/perplexity) करते हैं और सवालों के बेहतर जवाब देते हैं।
  • बेहतर मेमोरी: लंबी सूची से विशिष्ट तथ्यों को याद रखने की क्षमता की जांच करने वाले सिंथेटिक परीक्षणों पर, पैरलैक्स घास के ढेर में सही सुई खोजने में बहुत बेहतर था।
  • दक्षता (Efficiency): यहाँ तक कि जब उन्होंने मॉडल्स को बिल्कुल समान कंप्यूटिंग पावर या बिल्कुल समान संख्या में पैरामीटर्स का उपयोग करने के लिए समायोजित किया, तब भी पैरलैक्स जीत गया।

निचोड़ (The Bottom Line)

यह पेपर पैरलैक्स को पेश करता है, जो सूचना पर ध्यान देने का एक नया तरीका है। यह सोचने के पुराने "समतल" तरीके को "ढलान-जागरूक" (slope-aware) तरीके में अपग्रेड करता है, लेकिन गणित को सरल बनाता है ताकि यह वास्तविक कंप्यूटरों पर चल सके। महत्वपूर्ण रूप से, यह सबसे अच्छा तब काम करता है जब इसे म्यून (Muon) नामक एक विशिष्ट प्रशिक्षण उपकरण के साथ जोड़ा जाता है, जो एक शक्तिशाली संयोजन बनाता है जो गति और बुद्धिमत्ता दोनों में वर्तमान अत्याधुनिक मॉडल्स से बेहतर प्रदर्शन करता है।

लेखक इस बात पर जोर देते हैं कि यह पहली बार है जब इतने मजबूत संबंध को एक विशिष्ट आर्किटेक्चर (पैरलैक्स) और एक विशिष्ट ऑप्टिमाइज़र (म्यून) के बीच एक "पारेटो सुधार" (Pareto improvement) बनाने के लिए प्रदर्शित किया गया है—जिसका अर्थ है कि मॉडल को बड़ा या धीमा बनाए बिना वह बेहतर हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →