← नवीनतम पेपर
💬 NLP

LMK > CLS: Landmark Pooling for Dense Embeddings

यह शोधपत्र लैंडमार्क (LMK) पूलिंग को प्रस्तुत करता है, जो एक नवीन रिप्रजेंटेशन लर्निंग रणनीति है जो अनुक्रमों (sequences) को लैंडमार्क टोकन सम्मिलित करने वाले चंक्स (chunks) में विभाजित करती है ताकि स्थानीय प्रमुख विशेषताओं और दीर्घ-संदर्भ एक्सट्रपलेशन (long-context extrapolation) के बीच प्रभावी ढंग से संतुलन बनाया जा सके, जिससे लघु-संदर्भ प्रदर्शन को बनाए रखते हुए दीर्घ-संदर्भ कार्यों पर पारंपरिक [CLS] और मीन पूलिंग विधियों से बेहतर प्रदर्शन किया जा सके।

मूल लेखक: Meet Doshi, Aashka Trivedi, Vishwajeet Kumar, Parul Awasthy, Yulong Li, Jaydeep Sen, Radu Florian, Sachindra Joshi

प्रकाशित 2026-01-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Meet Doshi, Aashka Trivedi, Vishwajeet Kumar, Parul Awasthy, Yulong Li, Jaydeep Sen, Radu Florian, Sachindra Joshi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने एक दोस्त को एक बहुत लंबे उपन्यास का सारांश (summary) समझा रहे हैं। आपको कहानी के सबसे महत्वपूर्ण हिस्सों को पकड़ना होगा ताकि आपका दोस्त पूरी किताब पढ़े बिना भी पूरी कहानी समझ सके।

आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, यह बिल्कुल वही काम है जो "डेंस एम्बेडिंग्स" (dense embeddings) करते हैं। वे लंबे टेक्स्ट (जैसे दस्तावेज़, लेख या कोड) को एक एकल, संक्षिप्त नंबरों की सूची (एक वेक्टर) में बदल देते हैं जो उस पूरी चीज़ के अर्थ का प्रतिनिधित्व करती है। AI इन सारांशों का उपयोग जानकारी खोजने, समान दस्तावेज़ों को समूहबद्ध करने या टेक्स्ट को वर्गीकृत करने के लिए करता है।

समस्या यह है: उस सारांश को कैसे बनाया जाए?

पुराने तरीके: "हीरो" और "औसत"

लंबे समय से, AI शोधकर्ता टेक्स्ट को सारांशित करने के लिए दो मुख्य तरीकों का उपयोग करते आए हैं, और यह पेपर तर्क देता है कि जब टेक्स्ट बहुत लंबा हो जाता है, तो दोनों में खामियां होती हैं।

  1. "हीरो" टोकन ([CLS]):
    इसे एक नाटक के एक विशिष्ट पात्र को नियुक्त करने जैसा समझें जो कहानी की सारी यादें अपने पास रखता है, जिसे "हीरो" कहा जाता है। AI में, यह एक विशेष टोकन (एक प्लेसहोल्डर) है जिसे टेक्स्ट के बिल्कुल शुरुआत में रखा जाता है। मॉडल को इस तरह प्रशिक्षित किया जाता है कि वह इस एक टोकन को सब कुछ याद रखने के लिए मजबूर करे।
  • खामी: पेपर में पाया गया कि यह "हीरो" अभिभूत (overwhelmed) हो जाता है। यह कहानी की शुरुआत को बहुत अच्छी तरह से याद रखता है लेकिन बीच और अंत को "अनदेखा" करना शुरू कर देता है। यदि कहानी 100 पन्नों की है, तो हीरो केवल पहले कुछ पन्ने ही वास्तव में याद रखता है। यह एक भारी बैकपैक उठाने जैसा है; आप जितना आगे चलते हैं, उतनी ही चीजें गिराते जाते हैं।
  1. "औसत" (मीन पूलिंग - Mean Pooling):
    यह तरीका ऐसा है जैसे आप टेक्स्ट के हर एक शब्द को लेते हैं, उन्हें जोड़ते हैं, और कुल शब्दों की संख्या से विभाजित करके एक "मध्यम मार्ग" का सारांश प्राप्त करते हैं।
  • खामी: यह महत्वपूर्ण चीजों को कमज़ोर (dilute) कर देता है। यदि किसी दस्तावेज़ में एक महत्वपूर्ण वाक्य है जो किसी रहस्य को सुलझाता है, लेकिन उसमें 999 उबाऊ वाक्य हैं, तो "औसत" विधि उस महत्वपूर्ण वाक्य के प्रभाव को मिटा देती है। यह एक सूप बनाने जैसा है जहाँ आप एक विशाल बर्तन में नमक की एक छोटी सी बूंद डालते हैं; स्वाद हल्का और फीका हो जाता है।

नया समाधान: लैंडमार्क पूलिंग (Landmark Pooling - LMK)

लेखक एक नई विधि प्रस्तावित करते हैं जिसे लैंडमार्क (LMK) पूलिंग कहा जाता है।

कल्पना कीजिए कि आप एक बहुत लंबे रास्ते पर हाइकिंग कर रहे हैं। पूरे रास्ते को याद रखने के लिए शुरुआत में एक व्यक्ति (द हीरो) पर निर्भर रहने के बजाय, या हर एक कदम को समान रूप से याद रखने के बजाय, आप हर कुछ मील पर साइनपोस्ट (Landmarks/लैंडमार्क) लगाते हैं।

  • यह कैसे काम करता है: AI लंबे टेक्स्ट को टुकड़ों (chunks) में तोड़ देता है। प्रत्येक टुकड़े के अंत में, यह एक विशेष "लैंडमार्क" टोकन डाल देता है।
  • सारांश: अंतिम सारांश बनाने के लिए, AI हर शब्द को नहीं देखता है, और न ही यह केवल शुरुआत को देखता है। यह केवल लैंडमार्क्स को देखता है। यह प्रत्येक साइनपोस्ट की "याददाश्त" लेता है और उन लैंडमार्क्स का औसत निकालता है।

यह बेहतर क्यों है?

  • कोई ओवरलोड नहीं: क्योंकि यहाँ कई लैंडमार्क्स हैं, इसलिए किसी एक अकेले को पूरी किताब का भार नहीं उठाना पड़ता।
  • कोई कमी नहीं (No Dilution): क्योंकि लैंडमार्क्स को बार-बार लगाया जाता है, इसलिए वे प्रत्येक खंड के "स्वाद" को पकड़ लेते हैं। किताब के बीच में स्थित वह महत्वपूर्ण वाक्य अपना खुद का लैंडमार्क प्राप्त करता है, जिससे वह उबाऊ हिस्सों के कारण दब नहीं जाता।
  • लंबी दूरी: यह बहुत बड़े दस्तावेज़ों (जैसे 32,000 शब्दों लंबे) के लिए भी बहुत अच्छा काम करता है, जहाँ पुराना "हीरो" तरीका पूरी तरह विफल हो जाता है।

परिणाम: लंबाई के विरुद्ध दौड़

शोधकर्ताओं ने विभिन्न कार्यों पर पुराने तरीकों के मुकाबले इस नई विधि का परीक्षण किया:

  • लघु कथाएँ (Short Stories): छोटे टेक्स्ट पर, नई विधि पुराने "हीरो" तरीके की तरह ही अच्छा काम करती है। यह कुछ भी खराब नहीं करती।
  • लंबे उपन्यास (Long Novels): बहुत लंबे टेक्स्ट पर, नया तरीका प्रतियोगिता को पछाड़ देता है। यह "हीरो" या "औसत" तरीकों की तुलना में बहुत बेहतर तरीके से सही जानकारी खोज लेता है।

उन्होंने यह भी पाया कि भले ही उन्होंने AI को लघु कथाओं पर प्रशिक्षित किया हो, फिर भी "लैंडमार्क" विधि बाद में लंबी कहानियों को संभाल सकती है (जिसे "एक्सट्रपलेशन" कहा जाता है)। हालाँकि, पुराना "हीरो" तरीका भ्रमित हो जाता है और जब टेक्स्ट उसके प्रशिक्षण से अधिक लंबा हो जाता है, तो खराब प्रदर्शन करता है।

निचोड़ (The Bottom Line)

यह पेपर AI की एक बड़ी समस्या के लिए एक सरल, व्यावहारिक समाधान पेश करता है: महत्वपूर्ण विवरणों को खोए बिना लंबे टेक्स्ट का सारांश कैसे बनाया जाए।

एक एकल "हीरो" टोकन को कई "लैंडमार्क" साइनपोस्टों से बदलकर, AI सूचनाओं के समुद्र में जवाब खोजने के लिए पूरी लाइब्रेरी को पढ़ सकता है, जिससे यह जानकारी खोजने में बहुत बेहतर हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →