← नवीनतम पेपर
💬 NLP

Seq vs Seq: An Open Suite of Paired Encoders and Decoders

यह शोध पत्र एट्टिन (Ettin) सुइट का परिचय देता है, जो समान डेटा और रेसिपी पर प्रशिक्षित युग्मित एनकोडर-ओनली (encoder-only) और डिकोडर-ओनली (decoder-only) मॉडलों का एक संग्रह है, जो उनके संबंधित आकारों के लिए नया अत्याधुनिक प्रदर्शन स्थापित करता है और यह प्रदर्शित करता है कि नेटिव आर्किटेक्चर अपने विशिष्ट कार्यों पर अनुकूलित मॉडलों की तुलना में काफी बेहतर प्रदर्शन करते हैं।

मूल लेखक: Orion Weller, Kathryn Ricci, Marc Marone, Antoine Chaffin, Dawn Lawrie, Benjamin Van Durme

प्रकाशित 2026-03-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Orion Weller, Kathryn Ricci, Marc Marone, Antoine Chaffin, Dawn Lawrie, Benjamin Van Durme

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप किताबों का एक पुस्तकालय बना रहे हैं। लंबे समय से, पुस्तकालयाध्यक्ष (AI समुदाय) दो विशिष्ट प्रकार के पुस्तक पाठकों के प्रति जुनूनी रहे हैं:

  1. "डिकोडर" (कहानीकार - The Storyteller): यह पाठक शून्य से नई कहानियाँ लिखने में अद्भुत है। यदि आप उन्हें कहानी की पहली पंक्ति दें, तो वे पूरी कहानी लिख सकते हैं। वे अभी शो के सितारे हैं (जैसे प्रसिद्ध Llama या GPT मॉडल)।
  2. "एनकोडर" (विश्लेषक - The Analyst): यह पाठक नई कहानियाँ लिखने में बहुत खराब है, लेकिन जो कुछ उन्होंने पहले ही पढ़ लिया है, उसे समझने में वे अविश्वसनीय हैं। यदि आप उनसे पूछें, "क्या यह वाक्य खुशी वाला है या दुख वाला?" या "क्या इन दो वाक्यों का अर्थ एक ही है?", तो वे बहुत तेज़ और सटीक होते हैं।

समस्या:
वर्षों तक, लोगों ने "विश्लेषक" बनाना बंद कर दिया क्योंकि "कहानीकार" अधिक लोकप्रिय हो गए। लोगों ने सोचने शुरू कर दिया, "एक विशेषज्ञ विश्लेषक की क्या आवश्यकता है जब एक कहानीकार सब कुछ कर सकता है?" उन्होंने कहानीकारों को अतिरिक्त होमवर्क देकर विश्लेषक की तरह व्यवहार करने के लिए प्रशिक्षित करने की कोशिश की। लेकिन यह सेब और संतरे की तुलना करने जैसा महसूस हुआ क्योंकि कहानीकार बहुत बड़े थे और उन्हें अलग डेटा पर प्रशिक्षित किया गया था जबकि पुराने विश्लेषक अलग थे। हमें नहीं पता था कि क्या कहानीकार वास्तव में बेहतर था, या उसके पास केवल अधिक प्रशिक्षण था।

समाधान: "एट्टिन" (Ettin) सूट
लेखकों ने मॉडलों का एक बिल्कुल नया पुस्तकालय बनाया जिसे Ettin कहा जाता है (इसका नाम नॉर्स पौराणिक कथाओं के एक दो सिर वाले दानव पर रखा गया है)।

Ettin को एक जुड़वा प्रयोग के रूप में सोचें। उन्होंने मॉडलों के जोड़े बनाए:

  • जुड़वा A: एक शुद्ध विश्लेषक (Encoder)।
  • जुवा B: एक शुद्ध कहानीकार (Decoder)।

यहाँ जादू का नुस्खा है: वे जुड़वा हैं। वे बिल्कुल एक ही आकार के हैं, उन्होंने बिल्कुल एक जैसा भोजन खाया है (प्रशिक्षण डेटा), और उन्हें एक ही घर में पाला गया है (समान प्रशिक्षण रेसिपी)। एकमात्र अंतर उनका काम करने का तरीका है: एक को "खाली स्थान भरने" के लिए कहा जाता है (विश्लेषक), और दूसरे को "अगला शब्द लिखने" के लिए कहा जाता है (कहानीकार)।

उन्होंने क्या खोजा

  1. विशेषज्ञ जीतते हैं:
    जब उन्होंने जुड़वाओं का परीक्षण किया, तो परिणाम स्पष्ट थे।
  • यदि आपको किसी चीज़ को वर्गीकृत करने की आवश्यकता है (जैसे ईमेल को "स्पैम" या "स्पैम नहीं" में छाँटना) या जानकारी खोजने की आवश्यकता है, तो विश्लेषक (Encoder) हर बार जीतता है।
  • यदि आपको रचनात्मक टेक्स्ट जेनरेट करने या कहानी लिखने की आवश्यकता है, तो कहानीकार (Decoder) हर बार जीतता है।
  1. आप केवल "प्रशिक्षण" के माध्यम से इसे नहीं बदल सकते:
    कई लोगों ने एक कहानीकार को लेकर उसे अतिरिक्त होमवर्क देकर विश्लेषक की तरह व्यवहार करने के लिए प्रशिक्षित करने की कोशिश की।
  • उपमा: कल्पना कीजिए कि एक पेशेवर उपन्यासकार को गति से पढ़ने (speed-reading) की परीक्षा देने के लिए मजबूर किया जा रहा है। वे थोड़ा बेहतर हो सकते हैं, लेकिन वे कभी भी एक पेशेवर स्पीड-रीडर को नहीं हरा पाएंगे जिसने अपना पूरा जीवन यही करने में बिताया है।
  • शोध में पाया गया कि एक कहानीकार को विश्लेषण कार्यों के लिए बहुत लंबे समय तक प्रशिक्षित करने के बाद भी, वह विश्लेक के कार्य में उसे हरा नहीं सका। वास्तव में, एक छोटा सा विश्लेषक अक्सर एक विशाल कहानीकार से बेहतर होता है जो विश्लेषक का काम करने की कोशिश कर रहा हो।
  1. "पूर्वाग्रह" (Bias) का आश्चर्य:
    लेखकों ने यह भी देखा कि ये जुड़वा लिंग (gender) के बारे में कैसे "सोचते" हैं। उन्होंने पाया कि विश्लेषक (Encoders) तटस्थ भाषा (जैसे "वे/they") का उपयोग करने की अधिक संभावना रखते थे, जबकि कहानीकार (Decoders) पुरुष सर्वनाम की ओर झुकने की अधिक संभावना रखते थे। यह दर्शाता है कि जिस तरह से आप एक मॉडल को प्रशिक्षित करते हैं, वह उसकी केवल कौशल क्षमता ही नहीं, बल्कि उसका व्यक्तित्व भी बदल देता है।

यह क्यों महत्वपूर्ण है
यह शोध पत्र एक बॉक्सिंग मैच के निष्पक्ष रेफरी की तरह है। इससे पहले, लोग एक हेवीवेट चैंपियन (बड़ा कहानीकार) की तुलना एक लाइटवेट नौसिखिए (पुराना विश्लेषक) से कर रहे थे और कह रहे थे, "देखो, कहानीकार बेहतर है!"

अब, Ettin के साथ, हमारे पास एक हेवीवेट कहानीकार और एक हेवीवेट विश्लेषक के बीच मुकाबला है। निर्णय यह है: वे दोनों चैंपियन हैं, लेकिन अलग-अलग भार वर्ग (weight classes) में।

  • यदि आप एक चैटबॉट बनाना चाहते हैं या उपन्यास लिखना चाहते हैं? तो डिकोडर (कहंतकार) का उपयोग करें।
  • यदि आप एक सर्च इंजन, स्पैम फ़िल्टर, या चिकित्सा निदान उपकरण बनाना चाहते हैं? तो एक कहानीकार को यह काम करने के लिए मजबूर न करें। एक समर्पित विश्लेषक (Encoder) खोजें।

लेखकों ने अपने सभी ब्लूप्रिंट, डेटा और जुड़वा मॉडलों को मुफ्त में जारी कर दिया है, ताकि अन्य वैज्ञानिक अनुमान लगाना बंद कर सकें और सही काम के लिए सही उपकरण बनाना शुरू कर सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →