← नवीनतम पेपर
💬 NLP

Depth-Recurrent Attention Mixtures: Giving Latent Reasoning the Attention it Deserves

यह शोध पत्र "Dreamer" को पेश करता है, जो डेप्थ-रिकरेंट अटेंशन मिश्रणों (depth-recurrent attention mixtures) का एक मॉड्यूलर फ्रेमवर्क है जो हिडन-साइज़ बॉटलनेक को दूर करता है और कुशल लेटेंट रीजनिंग (latent reasoning) को सक्षम बनाता है, जिससे अत्याधुनिक मॉडलों की तुलना में काफी कम प्रशिक्षण टोकन के साथ बेहतर प्रदर्शन प्राप्त होता है।

मूल लेखक: Jonas Knupp, Jan Hendrik Metzen, Jeremias Bohn, Georg Groh, Kristian Kersting

प्रकाशित 2026-01-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jonas Knupp, Jan Hendrik Metzen, Jeremias Bohn, Georg Groh, Kristian Kersting

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही जटिल पहेली को हल करने की कोशिश कर रहे हैं, जैसे कि कोई कठिन गणित का सवाल। आमतौर पर, AI मॉडल इसे खुद से बात करके, कदम-दर-कदम, विचारों की एक लंबी श्रृंखला लिखकर हल करते हैं। यह एक छात्र द्वारा एक साधारण समीकरण को हल करने के लिए 10 पन्नों का निबंध लिखने जैसा है। इसमें बहुत समय, कागज (कंप्यूटिंग पावर) और ऊर्जा लगती है।

यह शोध पत्र AI के सोचने का एक नया तरीका पेश करता है जिसे Dreamer (डेप्थ-रिकरेंट अटेंशन मिक्स्चर) कहा जाता है। एक लंबा निबंध लिखने के बजाय, Dreamer अपने दिमाग के अंदर एक "गुप्त भाषा" में सोचता है, बिना एक शब्द कहे अपने उत्तर को बेहतर बनाने के लिए बार-बार खुद को दोहराता है।

यह कैसे काम करता है, यहाँ सरल उपमाओं के साथ समझाया गया है:

1. समस्या: "फंसी हुई लिफ्ट" और "भीड़भाड़ वाला कमरा"

लेखकों का कहना है कि AI को इस तरह सोचने के लिए बनाने के पिछले प्रयासों में दो बड़ी समस्याएं थीं:

  • भीड़भाड़ वाला कमरा (हिडन-साइज़ बॉटलनेक): कल्पना कीजिए कि एक छोटा कमरा है जहाँ AI अपने विचारों को रखने की कोशिश करता है। यदि कमरा बहुत छोटा है, तो वह कठिन समस्याओं को हल करने के लिए पर्याप्त जानकारी नहीं रख पाएगा। यह एक पूरे पुस्तकालय को बैकपैक में ले जाने की कोशिश करने जैसा है; अंततः, आपको चीजें छोड़नी पड़ेंगी।
  • फंसी हुई लिफ्ट (लेयर-साइज़ बॉटलनेक): कल्पना कीजिए कि एक इमारत है जहाँ हर मंजिल एक अलग, विशाल कमरा है। ऊपर जाने के लिए (कठिन समस्याओं को हल करने के लिए), आपको आमतौर पर अधिक कमरे वाला एक बड़ा भवन बनाना पड़ता है। यह महंगा और धीमा है।

2. समाधान: एक "स्मार्ट, पुन: प्रयोज्य लिफ्ट"

Dreamer इस समस्या को हल करने के लिए इमारत की संरचना को बदलकर इसे ठीक करता है।

A. पुन: प्रयोज्य लिफ्ट (डेप्थ रिकरेंस)
सोचने की प्रक्रिया के प्रत्येक चरण के लिए एक नया, विशाल कमरा बनाने के बजाय, Dreamer एक ही एकल, जादुई कमरे का उपयोग करता है जिसे वह बार-बार देखता है।

  • उपमा: एक शेफ के स्टू (stew) पकाने के बारे में सोचें। हर सामग्री के लिए एक नया बर्तन खरीदने के बजाय, वे एक ही बर्तन का उपयोग करते हैं, उसमें सामग्री डालते हैं और उसे बार-बार चलाते हैं। यह जगह (पैरामीटर्स) और पैसा (कंप्यूटिंग पावर) बचाता है।
  • चुनौती: यदि आप केवल एक ही कमरे का पुन: उपयोग करते हैं, तो शेफ भ्रमित हो सकता है या पहले जोड़ी गई चीजों को भूल सकता है।

B. "मेमोरी विंडो" (डेप्थ अटेंशन)
इस भ्रम को ठीक करने के लिए, Dreamer एक विशेष खिड़की जोड़ता है जिसे डेप्थ अटेंशन कहा जाता है।

  • उपमा: कल्पना कीजिए कि शेफ के पास एक जादुई खिड़की है जो उन्हें बर्तन में किए गए उनके हर पिछले कदम को देखने देती है, न कि केवल पिछले कदम को। वे देख सकते हैं, "ओह, मैंने तीन कदम पहले नमक डाला था, और अब मुझे काली मिर्च डालने की जरूरत है।"
  • यह "छोटे कमरे" वाली समस्या को हल करता है। भले ही कमरा छोटा हो, लेकिन यह खिड़की उन्हें अपनी पूरी प्रक्रिया के इतिहास तक पहुँचने की अनुमति देती है। यह AI को बड़े दिमाग की आवश्यकता के बिना जटिल विचारों को रखने में सक्षम बनाता है।

C. "विशेषज्ञ टीम" (एक्सपर्ट अटेंशन)
इस एक ही कमरे के भीतर, केवल एक शेफ नहीं है। वहाँ हजारों छोटे, विशेषज्ञ विशेषज्ञों की एक टीम है (जैसे मसालों का मास्टर, गर्मी का मास्टर, समय का मास्टर)।

  • उपमा: प्रक्रिया के हर चरण के लिए, AI केवल उन 2 या 3 विशेषज्ञों को बुलाता है जिनकी उसे वास्तव में उस समय आवश्यकता होती है। वह पूरी रसोई को नहीं जगाता। यह प्रक्रिया को तेज़ और कुशल रखता है।

3. परिणाम: कम में अधिक स्मार्ट

लेखकों ने अपने नए "Dreamer" सिस्टम का परीक्षण वर्तमान में उपलब्ध सर्वश्रेष्ठ AI मॉडलों के साथ किया। उन्होंने सुनिश्चित किया कि तुलना निष्पक्ष हो, जिसके लिए उन्होंने कंप्यूटिंग पावर, मेमोरी और आकार का मिलान किया।

  • डेटा दक्षता: गणितीय कौशल सीखने के लिए, Dreamer को मानक मॉडलों की तुलना में 2 से 8 गुना कम प्रशिक्षण उदाहरणों की आवश्यकता पड़ी। यह एक ऐसे छात्र की तरह है जो एक विषय को 1 सप्ताह में सीख लेता है जिसे दूसरों को 8 सप्ताह लगते हैं।
  • प्रदर्शन: समान मात्रा में प्रशिक्षण के साथ, Dreamer ने उन मॉडलों के बराबर प्रदर्शन किया जो आकार में दोगुने बड़े थे।
  • गहन सोच: उन्होंने पाया कि Dreamer अपनी "विशेषज्ञ टीम" का बहुत अधिक रचनात्मक रूप से उपयोग करता है। जबकि मानक मॉडल एक ही क्रम में एक ही विशेषज्ञों का उपयोग करते हैं, Dreamer उन्हें गतिशील रूप से मिलाता है और नए तरीके से ज्ञान का पुन: उपयोग करता है।

सारांश

शोध पत्र का दावा है कि AI को अपने स्वयं के सोचने वाले परतों को "रीसायकल" (डेप्थ रिकरेंस) करने देने और उसे बिना अभिभूत हुए अपने इतिहास को देखने का तरीका (डेप्थ अटेंशन) देने से, हम ऐसे मॉडल बना सकते हैं जो:

  1. अधिक स्मार्ट हैं: वे जटिल तर्क समस्याओं को बेहतर ढंग से हल करते हैं।
  2. सस्ते हैं: उन्हें कम कंप्यूटिंग पावर और मेमोरी की आवश्यकता होती है।
  3. प्रशिक्षण में तेज़ हैं: वे कम डेटा से सीखते हैं।

लेखक इसे एक "मॉड्यूलर फ्रेमवर्क" कहते हैं, जिसका अर्थ है कि यह लेगो ब्लॉक्स की तरह है जहाँ आप बेहतर AI मस्तिष्क बनाने के लिए इस प्रकार के विभिन्न अटेंशन (अनुक्रम को देखना, गहराई को देखना, विशेषज्ञों को देखना) को मिला सकते हैं। उनका मानना है कि यह दृष्टिकोण AI को लंबे, दोहराव वाले टेक्स्ट बनाने के बजाय आंतरिक रूप से मानव की तरह तर्क करने में मदद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →