← नवीनतम पेपर
🤖 machine learning

LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining

यह शोध पत्र LoKiFormer प्रस्तुत करता है, जो एक नवीन लार्ज लैंग्वेज मॉडल आर्किटेक्चर है जो स्थानीय पैटर्न को कैप्चर करने के लिए लोकल फ्यूजन अटेंशन और स्पष्ट वैश्विक ज्ञान पुनर्प्राप्ति के लिए एक डिकपल्ड नॉलेज मेमोरी मॉड्यूल को एकीकृत करके प्रीट्रेनिंग दक्षता और अभिसरण गति को बढ़ाता है।

मूल लेखक: Qiuwu Chen, Zimo Liu, Yuchen Li, Ying Sun, Yifan Zhang, Zhijie Qiu, Zeng You, Ryan Dong, Simeng Ma, Yaofo Chen, Mingkui Tan

प्रकाशित 2026-08-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qiuwu Chen, Zimo Liu, Yuchen Li, Ying Sun, Yifan Zhang, Zhijie Qiu, Zeng You, Ryan Dong, Simeng Ma, Yaofo Chen, Mingkui Tan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को पढ़ना और लिखना सिखाने की कोशिश कर रहे हैं। यह रोबोट एक "लार्ज लैंग्वेज मॉडल" (LLM) है, जो कृत्रिम बुद्धिमत्ता (AI) का एक प्रकार है और कहानियाँ लिखने से लेकर गणित की समस्याओं को हल करने तक हर चीज़ में अविश्वसनीय रूप से कुशल हो चुका है। लेकिन एक पेंच है: इन रोबोट्स को पढ़ाना एक चम्मच से स्विमिंग पूल भरने जैसा है। इसमें बहुत अधिक समय और कंप्यूटर पावर लगता है, और रोबोट कभी-कभी इस बात को लेकर भ्रमित हो जाते हैं कि वे वास्तव में क्या सीख रहे हैं।

यह समझने के लिए कि ऐसा क्यों है, इस तरह सोचें जैसे कोई इंसान एक वाक्य पढ़ता है। हम तुरंत समझ जाते हैं कि पास-पास रखे शब्द आमतौर पर आपस में जुड़े होते हैं (जैसे "गर्म" और "कॉफी"), लेकिन हमें उन तथ्यों को भी याद रखने की आवश्यकता होती है जो हमने वर्षों पहले सीखे थे (जैसे "कॉफी एक बीज/फल है")। वर्तमान AI मॉडल यह दोनों काम एक साथ करने के लिए "अटेंशन" (attention) नामक एक तंत्र का उपयोग करते हैं, जो यह देखने के लिए हर एक शब्द को देखता है कि वे एक-दूसरे से कैसे संबंधित हैं। समस्या यह है कि यह एक किताब को ऐसे पढ़ने जैसा है जैसे आप एक ही समय में पन्ने पर मौजूद हर एक अक्षर को घूर रहे हों; यह थका देने वाला और अक्षम है। साथ भी, जब रोबोट अपने सामान्य ज्ञान (जैसे इतिहास या विज्ञान के तथ्य) को संग्रहीत करने की कोशिश करता है, तो वह उस ज्ञान को अपने मस्तिष्क के भीतर बहुत ही अव्यवस्थित तरीके से छिपा देता है, जिससे ज़रूरत पड़ने पर सही तथ्य को ढूँढना कठिन हो जाता है। वैज्ञानिक एक ऐसा रोबोट बनाना चाहते हैं जो तेज़ी से सीख सके, कम ऊर्जा का उपयोग करे, और जानता हो कि उसकी जानकारी कहाँ मिलेगी।

यहाँ LoKiFormer आता है, जो इन AI दिमागों के लिए एक नया डिज़ाइन है जो रोबोट के पढ़ने वाले चश्मे और उसके मेमोरी बैंक के एक चतुर अपग्रेड की तरह काम करता है। इस शोध के पीछे के शोधकर्ताओं ने, जिनका नेतृत्व क्यूवू चेन और ज़ीमो लियू ने किया, देखा कि पुराने तरीके से ऊर्जा बर्बाद हो रही थी। उन्होंने रोबोट की सीखने की प्रक्रिया को ठीक करने के लिए दो नए उपकरण प्रस्तावित किए: एक "लोकल" (स्थानीय) चीजों को संभालने के लिए और दूसरा "ग्लोबल" (वैश्विक) चीजों (दुनिया के बड़े तथ्यों) को संभालने के लिए।

सबसे पहले, उन्होंने स्थानीय समस्या को लोकल फ्यूजन अटेंशन (LFA) नामक चीज़ से हल किया। कल्पना कीजिए कि आप एक वाक्य पढ़ रहे हैं। रोबोट को यह समझने के बजाय कि "बिल्ली" शब्द पैराग्राफ के हर दूसरे शब्द से कैसे संबंधित है, LFA रोबोट को एक विशेष जोड़ी "लोकल दूरबीन" देता है। ये दूरबीनें केवल पास के कुछ शब्दों पर ज़ूम करती हैं और उन्हें पहले आपस में मिला देती हैं। यह ऐसा है जैसे रोबोट पूरे शहर को समझने से पहले अपने आस-पास के पड़ोस का एक त्वरित, आसान सारांश प्राप्त कर लेता है। इससे रोबोट अनावश्यक काम करने से बच जाता है। शोध पत्र दिखाता है कि इस सरल चरण को जोड़ने से, रोबोट स्थानीय पैटर्न को बहुत तेज़ी से समझना सीख जाता है, जिससे वह बाद में बड़ी और अधिक जटिल संबंधों पर अपना ध्यान केंद्रित कर पाता है।

दूसरा, उन्होंने मेमोरी की समस्या को नॉलेज मेमोरी मॉड्यूल (KMM) के साथ ठीक किया। पुराने मॉडलों में, रोबोट का ज्ञान एक ऐसे पुस्तकालय की तरह था जहाँ किताबें अलमारियों से चिपकी हुई थीं और पढ़ने के निर्देशों के साथ मिली हुई थीं। यदि रोबोट को "भौतिकी" के बारे में किसी तथ्य की आवश्यकता होती, तो उसे पूरे बिखरे हुए पुस्तकालय में हाथ-पांव मारने पड़ते। LoKiFormer का KMM एक पूरी तरह से व्यवस्थित, लेबल वाली फाइलिंग कैबिनेट की तरह है जो पढ़ने के निर्देशों से अलग है। यह तथ्यों को विशिष्ट, पते योग्य (addressable) स्लॉट में संग्रहीत करता है। जब रोबलेट को "रसायन विज्ञान" के बारे में कुछ जानने की आवश्यकता होती है, तो वह बिना विचलित हुए सीधे "रसायन विज्ञान" वाले दराज तक जा सकता है और सही फ़ाइल निकाल सकता है। यह ज्ञान को संग्रहीत करने से उसे उपयोग करने की प्रक्रिया को अलग करता है, जिससे प्रक्रिया बहुत स्पष्ट और लचीली हो जाती है।

इन दोनों उपकरणों को एक साथ रखने के परिणाम प्रभावशाली हैं। शोधकर्ताओं ने अपने नए LoKiFormer मॉडल को प्रशिक्षित किया और पाया कि इसने मानक मॉडलों की तुलना में 1.33 गुना तेज़ी से सीखा। इसे समझने के लिए, जबकि एक मानक मॉडल को समझ के एक निश्चित स्तर तक पहुँचने के लिए 10,000 चरणों के माध्यम से पढ़ना पड़ता, LoKiFormer ने केवल 7,500 चरणों में वही स्तर प्राप्त कर लिया। यह समय और ऊर्जा की एक बड़ी बचत है। इससे भी रोमांचक बात यह है कि उनके मॉडल का एक छोटा संस्करण (7 बिलियन पैरामीटर्स वाला) अन्य कंपनियों के बहुत बड़े और प्रसिद्ध मॉडलों से बेहतर प्रदर्शन करता है, जो भाषा की समझ, तर्क और यहाँ तक कि कोडिंग के परीक्षणों में भी उन्हें पीछे छोड़ देता है।

यह शोध पत्र सुझाव देता है कि यह नया आर्किटेक्चर न केवल रोबोट को तेज़ बनाता है; बल्कि यह रोबोट को जो वह जानता है उसका उपयोग करने में भी स्मार्ट बनाता है। "लोकल" रीडिंग को "ग्लोबल" मेमोरी से अलग करके, मॉडल जटिल कार्यों को अधिक प्रभावी ढंग से संभाल सकता है। शोधकर्ताओं ने यह भी दिखाया कि "फाइलिंग कैबिनेट" (KMM) वास्तव में प्रशिक्षण के दौरान खुद को व्यवस्थित करता था, जिसमें अलग-अलग दराज स्वाभाविक रूप से इतिहास, भौतिकी या बीजगणित जैसे विभिन्न विषयों के विशेषज्ञ बन गए। इसका मतलब है कि रोबोट केवल रट नहीं रहा है; वह जानकारी को इस तरह से प्राप्त करना सीख रहा है जैसे मनुष्य अपने स्वयं के ज्ञान तक पहुँचते हैं।

संक्षेप में, LoKiFormer बताता है कि हमें AI मॉडलों को बेहतर बनाने के लिए उन्हें बड़ा और अधिक महंगा बनाने की आवश्यकता नहीं है। इसके बजाय, उन्हें सूक्ष्म विवरणों को देखने के लिए बेहतर उपकरण और अपने बड़े तथ्यों को संग्रहीत करने का एक साफ तरीका देकर, हम ऐसा AI बना सकते हैं जो तेज़ी से सीखता है, कम लागत में प्रशिक्षित होता है, और दुनिया को अधिक स्पष्टता से समझता है। यह एक याद दिलाता है कि कभी-कभी, एक सुपर-इंटेलिजेंट मशीन बनाने का सबसे अच्छा तरीका उसे अपनी मेज व्यवस्थित करने में मदद करना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →