← नवीनतम पेपर
💬 NLP

Compressing Sequences in the Latent Embedding Space: KK-Token Merging for Large Language Models

यह शोध पत्र K-Token Merging को प्रस्तुत करता है, जो एक लेटेंट-स्पेस कंप्रेशन फ्रेमवर्क है जो विविध कार्यों में उच्च प्रदर्शन बनाए रखते हुए लार्ज लैंग्वेज मॉडल्स में इनपुट लंबाई और कम्प्यूटेशनल लागत को महत्वपूर्ण रूप से कम करने के लिए एक लाइटवेट एनकोडर के माध्यम से निरंतर टोकन एम्बेडिंग्स को मर्ज करता है।

मूल लेखक: Zihao Xu, John Harvill, Ziwei Fan, Yizhou Sun, Hao Ding, Hao Wang

प्रकाशित 2026-04-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zihao Xu, John Harvill, Ziwei Fan, Yizhou Sun, Hao Ding, Hao Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक दोस्त को एक जटिल कहानी समझाने की कोशिश कर रहे हैं, लेकिन आपके दोस्त का ध्यान बहुत जल्दी भटक जाता है और उसकी याददाश्त बहुत कम है। यदि आप पूरी कहानी शब्द-दर-शब्द सुनाने की कोशिश करते हैं, तो वह घबरा जाता है और इसमें बहुत समय लगता है।

आज के समय में लार्ज लैंग्वेज मॉडल्स (LLMs) के साथ भी यही समस्या है। जब आप किसी AI को एक लंबा दस्तावेज़, एक बड़ी कोड फ़ाइल, या एक विशाल इतिहास की किताब पढ़ने के लिए कहते हैं, तो AI को हर एक शब्द (टोकन) को व्यक्तिगत रूप से प्रोसेस करना पड़ता है। जितने अधिक शब्द आप जोड़ते हैं, कंप्यूटर के सोचने की प्रक्रिया उतनी ही कठिन और धीमी होती जाती है। यह बिल्कुल वैसा ही है जैसे अपने बैकपैक में एक लाइब्रेरी ले जाने की कोशिश करना; जैसे-जैसे यह भारी होता जाता है, आपकी चाल धीमी होती जाती है।

यह पेपर एक चतुर नए तरीके को पेश करता है जिसे K-Token Merging कहा जाता है। यह कैसे काम करता है, यहाँ सरल भाषा में समझाया गया है:

समस्या: "शब्द-दर-शब्द" की बाधा

वर्तमान में, यदि आप AI को 1,000 शब्द देते हैं, तो वह उन्हें संभालने के लिए 1,000 अलग-अलग वस्तुओं के रूप में मानता है।

  • पुराना तरीका: कल्पना कीजिए कि आप अपने दोस्त को एक पैकेज भेज रहे हैं। आप अपने पत्र का हर एक शब्द एक अलग स्टिकी नोट (sticky note) पर लिखते हैं। आप 1,000 स्टिकी नोट्स को एक साथ चिपका देते हैं। आपके दोस्त को संदेश समझने के लिए हर एक नोट को पढ़ना पड़ता है। यह धीमा और अव्यवस्थित है।
  • खामी: उन में से कई स्टिकी नोट्स अनावश्यक (redundant) होते हैं। यदि आप कहते हैं "The cat sat on the mat," तो "The," "cat," "sat," "on," और "the" जैसे शब्द अक्सर एक साथ इतने बार आते हैं कि वे एक अनुमानित पैटर्न बना लेते हैं। AI को उन्हें पांच अलग-अलग चीजों के रूप में देखने की आवश्यकता नहीं है; उसे बस उस वाक्यांश के विचार को समझने की आवश्यकता है।

समाधान: "स्मार्ट समराइज़र" (K-Token Merging)

लेखक संदेश भेजने का एक नया तरीका प्रस्तावित करते हैं। 1,000 स्टिकी नोट्स भेजने के बजाय, वे शब्दों को भेजने से पहले उन्हें एक साथ जोड़ने के लिए एक स्मार्ट समराइज़र (एक हल्का एनकोडर) का उपयोग करते हैं।

  • उपमा (Analogy): कल्पना कीजिए कि आप हर 4 शब्दों (एक "K-token" ब्लॉक) को एक समूह में रखते हैं और उन्हें एक एकल, अत्यंत सघन "जादुвिक कार्ड" (magic card) पर चिपका देते हैं।
    • 1,000 स्टिकी नोट्स भेजने के बजाय, अब आप केवल 250 जादुвिक कार्ड भेजते हैं।
    • प्रत्येक कार्ड में उन 4 शब्दों का सार होता है, जो एक एकल, संक्षिप्त सिग्नल में संकुचित (compress) होता है।
    • AI को 1,000 नोट्स के बजाय ये 250 कार्ड मिलते हैं। यह बहुत तेज़ी से प्रोसेस करता है क्योंकि इसे संभालने के लिए चीज़ें कम हैं।

AI इन जादुविक कार्डों को कैसे समझता है?

आप पूछ सकते हैं: "यदि हम शब्दों को जादुविक कार्डों में बदल देते हैं, तो क्या AI भ्रमित नहीं हो जाएगा?"

यहीं पर उनके नुस्खे का दूसरा हिस्सा आता है: LoRA Adaptation

  • AI को एक ऐसे छात्र के रूप में सोचें जिसने मानक स्टिकी नोट्स पढ़ना सीख लिया है।
  • शोधकर्ता इस छात्र को एक विशेष "प्रशिक्षण पाठ्यक्रम" (LoRA नामक तकनीक का उपयोग करके) देते हैं ताकि वह इन नए "जादुविक कार्डों" को पढ़ना सीख सके।
  • छात्र यह सीख जाता है कि एक कार्ड का अर्थ चार शब्द है। वह पैटर्न को समझ लेता है।
  • महत्वपूर्ण बात: जब AI अपना उत्तर लिखना (generate करना) शुरू करता है, तो वह वापस सामान्य स्टिकी नोट्स पर आ जाता है। यह जादुविक कार्ड आउटपुट नहीं करता; यह सामान्य शब्द आउटपुट करता है। यह सुनिश्चित करता है कि अंतिम उत्तर मनुष्यों के लिए पठनीय बना रहे।

यह पिछले तरीकों से बेहतर क्यों है?

पिछले तरीकों ने उन शब्दों को हटाने की कोशिश की जिन्हें वे महत्वहीन समझते थे (जैसे "the" या "a" को हटाना)।

  • जोखिम: यदि आप गणित की समस्या या कोड की एक लाइन में से कोई शब्द हटा देते हैं, तो पूरी चीज़ टूट जाती है। यह एक रेसिपी को सारामांशित करने की कोशिश करने जैसा है जिसमें आप उन सामग्रियों को फेंक देते हैं जिन्हें आप "वैकल्पिक" समझते हैं।
  • नया तरीका: K-Token Merging कुछ भी फेंकता नहीं है। यह सभी जानकारी को रखता है लेकिन उसे अधिक सघन रूप में पैक करता है। यह एक सूटकेस पैक करने जैसा है: कपड़ों को फर्श पर छोड़ने के बजाय, आप उन्हें कसकर तह करते हैं। आपके पास अभी भी सभी कपड़े हैं, लेकिन वे कम जगह घेरते हैं।

परिणाम: गति बनाम बुद्धिमत्ता

शोधकर्ताओं ने तीन अलग-अलग चुनौतियों पर इसका परीक्षण किया:

  1. तर्क पहेलियाँ (Logic Puzzles): संबंधों को खोजने के लिए एक ट्री डायग्राम को पढ़ना।
  2. सेंटिमेंट एनालिसिस (Sentiment Analysis): यह देखने के लिए कि अमेज़न समीक्षाएं खुश हैं या दुखी, समीक्षाओं को पढ़ना।
  3. कोडिंग: कोड को पढ़ना और बग को ठीक करना।

जादुविक आंकड़े:

  • वे इनपुट के आकार को 75% तक कम करने में सक्षम रहे। (यदि आपके पास 1,000 शब्दों का प्रॉम्प्ट होता, तो AI को केवल 250 "कार्डों" को प्रोसेस करना पड़ता था)।
  • नुकसान? AI का प्रदर्शन बहुत कम गिरा। कुछ परीक्षणों में, यह अनकंप्रेस्ड संस्करण जितना ही स्मार्ट था।
  • जीत: क्योंकि AI को 75% कम आइटम प्रोसेस करने थे, इसलिए कंप्यूटर ने बहुत अधिक समय और ऊर्जा बचाई। वास्तव में, लंबे कार्यों के लिए, वे अनुमान लगाते हैं कि यह आवश्यक कंप्यूटिंग पावर का 94% तक बचा सकता है

बड़ी तस्वीर

K-Token Merging को मानव विचार के लिए एक कंप्रेशन एल्गोरिदम के रूप में सोचें। जैसे एक ZIP फ़ाइल दस्तावेज़ों के फोल्डर को कंप्रेस करती है ताकि आप उन्हें तेज़ी से ईमेल कर सकें, यह तरीका AI के मस्तिष्क के भीतर के "विचारों" को कंप्रेस करता है ताकि वह बिना थके या मेमोरी खत्म हुए लंबी किताबें पढ़ सके, लंबा कोड लिख सके और अधिक जटिल प्रश्नों के उत्तर दे सके।

यह साबित करता है कि हमें AI को तेज़ बनाने के लिए जानकारी को हटाने की आवश्यकता नहीं है; हमें बस इसे अधिक कुशलता से पैक करना सीखना होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →