← नवीनतम पेपर
🤖 machine learning

ATMA: Length-Invariant Language Modeling via Polar Attention and Gated-Delta Compression Memory

यह शोध पत्र ATMA को प्रस्तुत करता है, जो एक हाइब्रिड आर्किटेक्चर है जो सॉफ्टमैक्स-आधारित लंबाई की बाधाओं को दूर करने के लिए एक नवीन तीन-चैनल पोलर अटेंशन मैकेनिज्म को गेटेड-डेल्टा कंप्रेशन मेमोरी के साथ जोड़ता है, जिससे निरंतरतापूर्ण परप्लेक्सिटी में कमी और 64K टोकन तक उच्च-सटीकता वाली लंबी दूरी की रिट्रीवल प्राप्त होती है।

मूल लेखक: Habibullah Akbar

प्रकाशित 2026-06-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Habibullah Akbar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ ATMA पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करते हुए विवरण दिया गया है।

बड़ी समस्या: "लंबी कहानी" की दुविधा

कल्पना कीजिए कि आप एक ऐसी कहानी को याद करने की कोशिश कर रहे हैं जो 64,000 शब्दों लंबी है। इस स्थिति को संभालने के आपके पास दो मुख्य तरीके हैं, लेकिन दोनों में एक घातक दोष है:

  1. "स्लाइडिंग विंडो" (Sliding Window) दृष्टिकोण: आप केवल किताब के अंतिम कुछ पन्नों को देखते हैं।
    • फायदे: आप तुरंत के विवरणों को पूरी तरह से याद रखते हैं।
    • नुकसे: आप उन चीजों के प्रति पूरी तरह अंधे हो जाते हैं जो 10 पन्ने पहले हुई थीं। यदि आपके प्रश्न का उत्तर पहले अध्याय में है, तो आप उसे पूरी तरह से चूक जाएंगे।
  2. "पूर्ण संदर्भ" (Full Context) दृष्टिकोण: आप एक साथ पूरी 64,000 शब्दों की कहानी को अपने दिमाग में रखने की कोशिश करते हैं।
    • फायदे: आप शुरुआत और अंत दोनों देख सकते हैं।
    • नुकसे: आपका मस्तिष्क अभिभूत (overwhelmed) हो जाता है। "सिग्नल" (महत्वपूर्ण तथ्य) "शोर" (बाकी सभी शब्द) में दब जाता है। यह एक स्टेडियम में चिल्लाते हुए लोगों के बीच एक फुसफुसाहट सुनने जैसा है; अंततः, आप कुछ भी स्पष्ट रूप से नहीं सुन पाते, और आपका प्रदर्शन गिर जाता है।

वर्तमान AI मॉडल (Large Language Models) ज्यादातर दूसरे दृष्टिकोण का उपयोग करते हैं, लेकिन जैसे-जैसे कहानी लंबी होती जाती है, वे "भूलने" लगते हैं या भ्रमित हो जाते हैं क्योंकि उनके द्वारा उपयोग की जाने वाली गणितीय प्रक्रिया (जिसे Softmax Attention कहा जाता है) उनका ध्यान बहुत अधिक बिखेर देती है।

समाधान: ATMA

लेखकों ने ATMA नामक एक नया मॉडल बनाया है। ATما को एक सुपर-स्मार्ट लाइब्रेरियन के रूप में सोचें जो बिना अभिभूत हुए एक विशाल पुस्तकालय को प्रबंधित करने के लिए एक विशेष तीन-भाग वाली प्रणाली का उपयोग करता है।

टेक्स्ट को देखने के केवल एक तरीके के बजाय, ATMA काम को तीन अलग-अलग चैनलों में विभाजित करता है:

1. "क्या" वाला चैनल (Polar Attention - दिशा/Direction)

कल्पना कीजिए कि आप एक विशिष्ट पुस्तक की तलाश कर रहे हैं। यह गिनने के बजाय कि कमरे में कितने लोग हैं, आप केवल इस पर ध्यान केंद्रित करते हैं कि वह पुस्तक कैसी दिखती है (उसका रंग, आकार, शीर्षक)।

  • यह कैसे काम करता है: ATMA का यह हिस्सा इस बात की परवाह नहीं करता कि कोई शब्द कितनी बार आया है। यह केवल जानकारी की दिशा या प्रकार पर ध्यान देता है।
  • जादू: भले ही पुस्तकालय 100 किताबों से बढ़कर 100,000 किताबें हो जाए, यह चैनल शांत रहता है। यह भीड़ के आकार से भ्रमित नहीं होता। यह बस उत्तर के सही "फीचर" की ओर इशारा करता है।

2. "कितना" वाला चैनल (Polar Attention - परिमाण/Magnitude)

अब, कल्पना कीजिए कि आपको यह जानने की आवश्यकता है कि सिग्नल कितना मजबूत है। क्या एक व्यक्ति ने उत्तर चिल्लाया, या एक पूरा समूह चिल्लाया?

  • यह कैसे काम करता है: यह चैनल "प्रभावी मिलान" (effective matches) को गिनता है। लेकिन यहाँ एक ट्रिक है: इसमें एक वॉल्यूम लिमिटर है।
  • जादू: यदि 1,000 लोग एक ही बात चिल्लाते हैं, तो एक सामान्य मस्तिष्क अभिभूत हो सकता है। ATMA का वॉल्यूम लिमिटर आवाज को नियंत्रित करता है ताकि वह फटे नहीं। यह कहता है, "ठीक है, यह बहुत सारे मिलान हैं, लेकिन मैं इसे एक 'बहुत तेज़' सिग्नल मानूँगा, न कि 'टूटे हुए स्पीकर' वाला सिग्नल।" यह बड़े वृत्तांतों के लिए भी गणित को स्थिर रखता है।

3. "दीर्घकालिक स्मृति" वाला चैनल (Gated-Delta Compression)

"क्या" और "कितना" चैनलों के साथ भी, आपको कहानी का सार रखने के लिए एक जगह की आवश्यकता होगी ताकि आपको हर बार पूरी चीज़ दोबारा न पढ़नी पड़े।

  • यह कैसे काम करता है: यह एक विशेष "स्टिक नोट" (sticky note) प्रणाली है। यह कहानी को पढ़ते समय लगातार एक सारांश अपडेट करती रहती है।
  • जादू: अधिकांश सारांश प्रणालियाँ "लॉसी" (lossy) होती हैं—वे विवरण भूल जाती हैं। लेकिन ATMA की मेमोरी "गेटेड" (gated) है। यह तय करती है कि क्या रखना है और किसे ओवरराइट करना है। यह एक उच्च-गुणवत्ता वाले संपीड़न (compression) एल्गोरिदम की तरह कार्य करता है जो मुख्य कथानक (सुई) को सुरक्षित रखता है, भले ही कहानी 64,000 शब्दों की क्यों न हो।

संयोजन ही कुंजी क्यों है

लेखकों ने पाया कि आप केवल इन तीन उपकरणों में से एक का उपयोग नहीं कर सकते; आपको इन तीनों को एक साथ काम करने की आवश्यकता है:

  • यदि आप केवल "क्या" चैनल का उपयोग करते हैं (Polar Attention), तो आप एक विशाल ढेर में विशिष्ट तथ्यों को खोजने की क्षमता खो देते हैं।
  • यदि आप केवल "मेमोरी" का उपयोग करते हैं, तो आपको एक अच्छा सारांश मिलता है लेकिन आप विशिष्ट, सटीक विवरण (जैसे टेक्स्ट में छिपा 5-अंकों का कोड) नहीं ढूंढ पाते।
  • ATMA इन सबको जोड़ता है: "क्या" वाला चैनल सटीक सुई को ढूंढता है, और "मेमोरी" वाला चैनल संदर्भ को स्थिर रखता है ताकि सुई खो न जाए।

परिणाम: "भूसे के ढेर में सुई" का परीक्षण

लेखकों ने एक विशिष्ट "सुई" (एक गुप्त कोड) को एक विशाल "भूसे के ढेर" (एक लंबा दस्तावेज़) के अंदर छिपाकर इसका परीक्षण किया।

  • पुराने मॉडल: जब दस्तावेज़ बहुत लंबा हो गया (उनके प्रशिक्षण काल से 32 गुना लंबा), तो पुराने मॉडल पूरी तरह विफल हो गए। उन्होंने 20% से भी कम समय में सुई को खोज पाए।
  • ATMA: 64,000 शब्दों (प्रशिक्षण लंबाई का 32 गुना) पर भी, ATMA ने 90%+ समय में सुई को खोज निकाला।
  • बोनस: इसने न केवल सुई को खोजा, बल्कि इसने बाकी कहानी को भी बेहतर ढंग से समझा (कम "परप्लेक्सिटी"), जिसका अर्थ है कि यह लंबे टेक्स्ट के कारण किसी भी अन्य मॉडल की तुलना में कम भ्रमित हुआ।

तकनीकी "सीक्रेट सॉस"

इसे वास्तविक कंप्यूटरों पर चलाने के लिए, लेखकों को कस्टम सॉफ्टवेयर "इंजन" (kernels) बनाने पड़े।

  • उन्होंने गणित करने का एक विशेष तरीका बनाया जो मेमोरी बचाता है, जैसे कि एक फ्लैश ड्राइव जो केवल उन्हीं पन्नों को लोड करती है जिनकी आपको अभी आवश्यकता है, बजाय इसके कि पूरी किताब को एक साथ RAM में लोड करने की कोशिश की जाए।
  • उन्होंने "मेमोरी अपडेट" को अनुकूलित किया ताकि यह कंप्यूटर को धीमा न करे, जिससे जटिल गणनाएं करते समय भी गति उच्च बनी रहे।

सारांश

ATMA लंबे ग्रंथों को पढ़ने का एक नया तरीका है। यह लंबे टेक्स्ट से अभिभूत होने की समस्या को हल करता है क्योंकि यह काम को विभाजित करता है:

  1. दिशा (Direction): हम क्या ढूंढ रहे हैं? (आकार के बावजूद शांत रहता है)।
  2. परिमाण (Magnitude): सिग्नल कितना मजबूत है? (आवाज को फटने से रोकता है)।
  3. स्मृति (Memory): एक स्मार्ट, संकुचित सारांश जो बड़ी तस्वीर को थामे रखता है।

इन सबको मिलाकर, ATMA 64,000 शब्दों के दस्तावेज़ को पढ़ सकता है और उसके अंदर छिपे एक छोटे से विवरण को भी ढूंढ सकता है, जो पिछले मॉडलों के लिए असंभव था।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →