← नवीनतम पेपर
💬 NLP

Long-Context Encoder Models for Polish Language Understanding

यह शोध पत्र एक उच्च-गुणवत्ता वाले, लंबे-संदर्भ वाले पोलिश एनकोडर मॉडल को प्रस्तुत करता है जो दो-चरणीय प्रशिक्षण प्रक्रिया और नॉलेज डिस्टिलेशन के माध्यम से 8192 टोकन तक संसाधित करने में सक्षम है, जो लघु ग्रंथों पर दक्षता बनाए रखते हुए लंबे दस्तावेज़ों की समझ सहित 25 कार्यों पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Sławomir Dadas, Rafał Poświata, Marek Kozłowski, Małgorzata Grębowiec, Michał Perełkiewicz, Paweł Klimiuk, Przemysław Boruta

प्रकाशित 2026-03-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sławomir Dadas, Rafał Poświata, Marek Kozłowski, Małgorzata Grębowiec, Michał Perełkiewicz, Paweł Klimiuk, Przemysław Boruta

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक शानदार लाइब्रेरियन है जिसका नाम Polish-RoBERTa है। वर्षों से, यह लाइब्रेरियन पोलिश भाषा में किताबों को व्यवस्थित करने, सवालों के जवाब देने और कहानियों का सारांश देने में सर्वश्रेष्ठ रहा है। लेकिन एक पेच है: यह लाइब्रेरियन एक बार में केवल एक ही पेज का टेक्स्ट पढ़ सकता है। यदि आप उन्हें पूरा उपन्यास या कोई मोटा कानूनी अनुबंध थमा देते हैं, तो वे केवल पहला पेज पढ़ पाते हैं और बाकी के बारे में केवल अनुमान लगाते हैं। यह आधुनिक कार्यों के लिए एक समस्या है, जैसे कि लंबे बैंक रिपोर्टों का विश्लेषण करना या पूरे समाचार लेखों को पढ़ना।

इस शोध पत्र के लेखकों ने इस लाइब्रेरियन को एक सुपरपावर दी है: एक ही बार में पूरी किताब (8,192 पेज या "टोकन" तक) पढ़ने और समझने की क्षमता, बिना छोटी कहानियों पर अपनी पैनी पकड़ खोए।

यह कहानी कैसे हुई, इसे सरल शब्दों में यहाँ समझाया गया है:

1. समस्या: "एक-पेज" की सीमा

पुराने AI मॉडल बहुत कम ध्यान अवधि वाले लाइब्रेरियन की तरह होते हैं। वे त्वरित कार्यों (जैसे यह जांचना कि कोई ट्वीट खुश है या दुखी) के लिए बेहतरीन हैं, लेकिन लंबे दस्तावेज़ों के सामने वे घबरा जाते हैं। वास्तविक दुनिया में, विशेष रूप से बैंकिंग और वित्त में, दस्तावेज़ अक्सर लंबे और जटिल होते हैं। आप केवल मॉर्टगेज समझौते का पहला पेज पढ़कर पूरे सौदे को समझने की उम्मीद नहीं कर सकते।

2. समाधान: एक "लॉन्ग-रीड" (लंबा पढ़ने वाला) लाइब्रेरियन प्रशिक्षित करना

टीम ने अपने मौजूदा, उच्च-गुणवत्ता वाले पोलिश लाइब्रेरियन को लंबी किताबें पढ़ने का क्रैश कोर्स दिया। उन्होंने इसे दो चतुर चरणों में किया:

  • चरण 1: मानचित्र सीखना (पोजीशनल एम्बेडिंग्स): कल्पना कीजिए कि लाइब्रेरियन के पास एक छोटे शहर (512 पेज) का नक्शा है। अचानक, उन्हें पूरे देश (8,192 पेज) में नेविगेट करने की आवश्यकता होती है। यदि आप उन्हें केवल नया नक्शा दे देते हैं, तो वे खो जाते हैं। इसलिए, पहले उन्होंने लाइब्रेरियन के मस्तिष्क को फ्रीज कर दिया और केवल उन्हें नए मानचित्र (शब्दों की स्थितियों) पर प्रशिक्षित किया। इससे उन्हें यह समझने में मदद मिली कि वे एक लंबे टेक्स्ट में कहाँ हैं, बिना यह भूले कि छोटे टेक्स्ट को कैसे पढ़ा जाता है।
  • चरण 2: पूरी लाइब्रेरी पढ़ना (पूर्ण प्रशिक्षण): एक बार जब लाइब्रेरियन को नक्शा पता चल गया, तो उन्होंने उन्हें फिर से पूरी लाइब्रेरी पढ़ने दी। अभ्यास के लिए उन्होंने 150 बिलियन पोलिश शब्दों का एक विशाल संग्रह उपयोग किया। इसे कुशल बनाने के लिए, उन्होंने विशेष "फ्लैश अटेंशन" (एक उच्च-गति वाली पढ़ने की तकनीक) का उपयोग किया और यह सुनिश्चित किया कि लाइब्रेरियन किताबों के ढेर को पढ़ते समय गलती से एक किताब की कहानी को दूसरी के साथ न मिला दे।

3. "पॉकेट" संस्करण: नॉलेज डिस्टिलेशन (ज्ञान आसवन)

हर किसी को ऐसे लाइब्रेरियन की आवश्यकता नहीं होती जो एक बार में पूरी लाइब्रेरी पढ़ सके। कभी-कभी, आपको बस एक स्मार्टफोन या टैबलेट जैसे छोटे डिवाइस पर एक त्वरित सहायक की आवश्यकता होती है। इन उपकरणों में सीमित मेमोरी और बैटरी होती है।

इसे हल करने के लिए, टीम ने अपने सुपर-लाइब्रेरियन के छोटे, संकुचित संस्करण बनाए:

  • उन्होंने बड़े मॉडल को लिया और उसके "मस्तिष्क" (परतों) का आधा (या यहाँ तक कि तीन-चौथाई) हिस्सा हटा दिया।
  • फिर, उन्होंने नॉलेज डिस्टिलेशन नामक तकनीक का उपयोग किया। इसे एक मास्टर शेफ (बड़ा मॉडल) द्वारा एक जूनियर शेफ (छोटा मॉडल) को खाना बनाना सिखाने के रूप में सोचें। जूनियर शेफ मास्टर को देखता है और उसके परिणामों की नकल करने की कोशिश करता है, जिससे वह मास्टर के लगभग समान होने का हुनर सीखता है, लेकिन बहुत तेज़ और हल्का होकर।
  • उन्होंने एक "प्रोग्रेसिव" (क्रमिक) विधि भी आजमायी: जूनियर शेफ को पहले एक मध्यम आकार का शेफ बनने के लिए सिखाना, और फिर उन्हें एक बहुत छोटे आकार में सिकोड़ देना। यह सबसे अच्छा काम कर गया, जिससे सबसे छोटे मॉडल में भी गुणवत्ता बनी रही।

4. टेस्ट ड्राइव: 25 अलग-अलग चुनौतियाँ

यह देखने के लिए कि क्या उनका नया लाइब्रेरियन वास्तव में अच्छा था, उन्होंने इसे 25 विभिन्न कार्यों के साथ एक कठिन टेस्ट ड्राइव से गुजारा।

  • मानक परीक्षण: उन्होंने जांचा कि क्या यह अभी भी पुराने कामों को अच्छी तरह से कर सकता है (जैसे टेक्स्ट में नाम पहचानना या मूवी रिव्यू का अनुमान लगाना)।
  • नया "FinBench" परीक्षण: चूंकि मॉडल एक बैंक के लिए बनाया गया था, इसलिए उन्होंने FinBench नामक एक विशेष परीक्षण सूट बनाया। इसमें लंबे मॉर्टगेज दस्तावेज़ पढ़ने, ग्राहकों के ईमेल को वर्गीकृत करने और शेयर बाजार की खबरों का विश्लेषण करने जैसे कार्य शामिल थे।
  • परिणाम: नया मॉडल (Polish-RoBERTa-8k) स्पष्ट विजेता था। यह लंबे दस्तावेज़ों (जैसे मॉर्टगेज अनुबंध) को पढ़ने में सर्वश्रेष्ठ था और साथ ही छोटे कार्यों के लिए पुराने मॉडलों के समान ही सक्षम बना रहा। यहाँ तक कि उनके छोटे, संकुचित संस्करणों ने भी आश्चर्यजनक रूप से अच्छा प्रदर्शन किया।

5. वास्तविक दुनिया की जीत: बैंक के भीतर

अंत में, उन्होंने एक प्रमुख पोलिश बैंक (PKO Bank Polski) के वास्तविक, गुप्त डेटा पर इस मॉडल का परीक्षण किया।

  • कार्य: हजारों ग्राहक ईमेल और कानूनी मॉर्टगेज दस्तावेज़ों को वर्गीकृत करना।
  • परिणाम: नया मॉडल, विशेष रूप से वह जिसे बैंकिंग-विशिष्ट टेक्स्ट पर अतिरिक्त प्रशिक्षण मिला था, पिछले सर्वश्रेष्ठ मॉडल की तुलना में काफी बेहतर प्रदर्शन कर गया। इसने ग्राहक ईमेल को पिछले सर्वश्रेष्ठ मॉडल की तुलना में 8% बेहतर तरीके से वर्गीकृत किया।

मुख्य निष्कर्ष

यह शोध पत्र एक ऐसे पोलिश AI के बारे में है जिसे स्मार्ट होने और तेज़ होने के बीच किसी एक को चुनने की ज़रूरत नहीं है।

  • बड़ा मॉडल: एक पूरा उपन्यास (8,192 टोकन) पढ़ सकता है और संदर्भ को पूरी तरह से समझ सकता है।
  • छोटे मॉडल: आपके फोन में फिट होने वाले पॉकेट-साइज़ संस्करणों की तरह हैं, लेकिन फिर भी वे लंबे टेक्स्ट को किसी भी अन्य मॉडल से बेहतर पढ़ सकते हैं।

यह साबित करता है कि आपको लंबे दस्तावेज़ों को समझने के लिए एक विशाल, महंगे "डिकोडर" AI (जैसे कि कहानियाँ लिखने वाले) की आवश्यकता नहीं है। एक विशेष "एनकोडर" AI, जिसे सही ढंग से प्रशिक्षित किया गया हो, यह काम सस्ता, तेज़ और उतना ही प्रभावी ढंग से कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →