← नवीनतम पेपर
💬 NLP

Register Always Matters: Analysis of LLM Pretraining Data Through the Lens of Language Variation

यह अध्ययन प्रदर्शित करता है कि प्रीट्रेनिंग डेटा का भाषाई रजिस्टर लार्ज लैंग्वेज मॉडल के प्रदर्शन को महत्वपूर्ण रूप से प्रभावित करता है, जो यह प्रकट करता है कि जहाँ समाचार (News) टेक्स्ट उप-इष्टतम हैं, वहीं ओपिनियन (Opinion), हाउ-टू-इंस्ट्रक्शंस (How-to-Instructions) और सूचनात्मक विवरण (Informational Description) रजिस्टरों को शामिल करने से मॉडल की क्षमताओं में पर्याप्त सुधार होता है।

मूल लेखक: Amanda Myntti, Erik Henriksson, Veronika Laippala, Sampo Pyysalo

प्रकाशित 2026-05-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Amanda Myntti, Erik Henriksson, Veronika Laippala, Sampo Pyysalo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक छोटे बच्चे को बोलना और दुनिया को समझना सिखाने की कोशिश कर रहे हैं। आपके पास किताबों का एक विशाल पुस्तकालय है, लेकिन उन्हें बस यादृच्छिक (random) ढेर के रूप में देने के बजाय, आप उन्हें शैली (genre) के आधार पर वर्गीकृत करने का निर्णय लेते हैं: कुछ रेसिपी की किताबें हैं, कुछ समाचार रिपोर्ट हैं, कुछ गीत के बोल हैं, कुछ राय वाले ब्लॉग पोस्ट हैं और कुछ विज्ञान की पाठ्यपुस्तकें हैं।

यह शोध पत्र एक सरल लेकिन गहरा प्रश्न पूछता है: क्या यह मायने रखता है कि आप बच्चे को सिखाने के लिए किन किताबों का उपयोग करते हैं?

अधिकांश लोग जो AI (लार्ज लैंग्वेज मॉडल्स) बना रहे हैं, वे यह मान लेते हैं कि "जितना अधिक डेटा हो, उतना बेहतर है" और यदि आप केवल "बुरे" डेटा (जैसे स्पैम या घृणास्पद सामग्री) को हटा देते हैं, तो बाकी सब समान रूप से अच्छा है। यह अध्ययन कहता है: नहीं, टेक्स्ट का "स्वाद" बहुत अधिक मायने रखता है।

यहाँ उनके निष्कर्षों का रोजमर्रा के उदाहरणों के साथ विवरण दिया गया है:

1. "एक-शैली" (One-Genre) प्रयोग

शोधकर्ताओं ने कई छोटे AI मॉडल बनाए। प्रत्येक मॉडल को उसके पूरे प्रशिक्षण जीवन के लिए केवल एक प्रकार के टेक्स्ट (एक 'रजिस्टर') के साथ प्रशिक्षित किया गया।

  • "रेसिपी" मॉडल: केवल "कैसे करें" (How-to) निर्देशों पर प्रशिक्षित।
  • "न्यूज़" मॉडल: केवल समाचार लेखों पर प्रशिक्षित।
  • "लिरिक्स" मॉडल: केवल गीतों के बोलों पर प्रशिक्षित।
  • "ओपिनियन" मॉडल: केवल समीक्षाओं और ब्लॉग पोस्ट पर प्रशिक्षित।

आश्चर्यजनक परिणाम:

  • "न्यूज़" मॉडल निराशाजनक था। आप सोच सकते हैं कि केवल समाचार पढ़ने से आप बुद्धिमान बनते हैं, लेकिन केवल समाचारों पर प्रशिक्षित मॉडल काफी खराब प्रदर्शन करता था। यह एक ऐसे छात्र की तरह था जो केवल दैनिक सुर्खियां पढ़ता है लेकिन कभी समस्या समाधान या गहरे सिद्धांतों को नहीं समझ पाता।
  • "ओपिनियन" मॉडल एक सितारा था। यह सबसे बड़ा झटका था। राय, समीक्षाओं और तर्कों (जैसे Yelp समीक्षाएं या राजनीतिक ब्लॉग) से भरे टेक्स्ट ने मॉडल को अविश्वसनीय रूप से अच्छा प्रदर्शन कराया। ऐसा लगता है कि तर्क करना, समझाने और एक दृष्टिकोण व्यक्त करना AI के लिए एक गुप्त सुपरपावर है।
  • "लिरिक्स" मॉडल संघर्ष करता रहा। चूंकि उन्होंने जिन परीक्षणों का उपयोग किया था वे तर्क और तथ्यों के बारे में थे, इसलिए कविता और गीतों पर प्रशिक्षित मॉडल उन सवालों के जवाब देने के बारे में नहीं जान पाया। (लेखक नोट करते हैं कि इसका मतलब यह नहीं है कि कविता बेकार है, बल्कि यह कि इसने इन विशिष्ट परीक्षणों में मदद नहीं की)।

2. "मिक्स-एंड-मैच" सफलता

शोधकर्ताओं ने फिर सर्वश्रेष्ठ प्रदर्शन करने वाली शैलियों को एक साथ मिलाने का प्रयास किया। उन्होंने सब कुछ ब्लेंडर में नहीं डाला; उन्होंने सावधानीपूर्वक विजेताओं का चयन किया।

  • जीत का नुस्खा: उन्होंने पाया कि "कैसे करें" निर्देश (How-to Instructions), सूचनात्मक विवरण (Informational Descriptions) (जैसे विकिपीडिया), और राय (Opinions) को मिलाने से एक ऐसा मॉडल बना जो पूरे, अव्यवस्थित इंटरनेट पर प्रशिक्षित मॉडल से भी अधिक स्मार्ट था।
  • "न्यूज़" और "चैट" का जाल: जब उन्होंने मिश्रण में समाचार या "इंटरैक्टिव चर्चा" (जैसे फोरम चैट) को जोड़ा, तो मॉडल इन परीक्षणों पर वास्तव में और भी कमज़ोर हो गया। यह सूप में बहुत अधिक पानी मिलाने जैसा है; इसने उस स्वाद को पतला कर दिया जो काम कर रहा था।

3. विशिष्ट महाशक्तियाँ (Specialized Superpowers)

अध्ययन ने यह भी दिखाया कि विभिन्न शैलियाँ AI को अलग-अलग "मांसपेशियां" सिखाती हैं:

  • "कैसे करें" निर्देशों ने AI को भौतिक तर्क (जैसे, "यदि मैं गिलास गिरा दूँ, तो क्या वह टूट जाएगा?") में उत्कृष्ट बनाया, लेकिन सामान्य सामान्य ज्ञान (trivia) में खराब।
  • कथा/कहानी (Narrative/Storytelling) ने AI को सामाजिक स्थितियों को समझने में बेहतर बनाया लेकिन विज्ञान के सवालों के जवाब देने में कमजोर।
  • राय (Opinions) ने AI की सामान्य समझ (common sense) और सामाजिक बातचीत को समझने की क्षमता को बढ़ाया।

मुख्य निष्कर्ष

लेखक निष्कर्ष निकालते हैं कि रजिस्टर (Register) हमेशा मायने रखता है।

प्रीट्रेनिंग डेटा को एक आहार की तरह समझें। आप केवल "भोजन" सामान्य रूप से नहीं खा सकते; आपको पोषक तत्वों के एक विशिष्ट मिश्रण की आवश्यकता है।

  • यदि आप केवल "समाचार" खाते हैं, तो आपका AI थोड़ा उबाऊ और कम रचनात्मक हो जाता है।
  • यदि आप केवल "गीत" खाते हैं, तो आपका AI काव्यमय हो जाता है लेकिन गणित नहीं कर पाता।
  • यदि आप निर्देश (चीजें कैसे काम करती हैं), विवरण (चीजें क्या हैं), और राय (लोग चीजों के बारे में कैसा महसूस करते हैं) को मिलाते हैं, तो आपको एक पूर्ण विकसित, उच्च-प्रदर्शन वाला AI प्राप्त होता है।

इसका भविष्य के लिए क्या अर्थ है (लेख के अनुसार):
इंटरनेट से अधिक डेटा निकालने के बजाय, हमें इस बात पर अधिक ध्यान देना चाहिए कि हम किस प्रकार के डेटा को चुनते हैं। टेक्स्ट की "शैली" को समझकर, हम केवल एक बड़े रैंडम टेक्स्ट के ढेर के काम करने की उम्मीद करने के बजाय, कम बर्बादी के साथ बेहतर AI मॉडल बना सकते हैं।

नोट: लेखक इस बात पर जोर देते हैं कि यह अध्ययन छोटे मॉडलों पर किया गया था ताकि इन सिद्धांतों का परीक्षण किया जा सके। उन्होंने इन विशिष्ट "आहारों" का वास्तविक दुनिया की चिकित्सा सलाह, कानूनी सलाह या अन्य उच्च-जोखिम वाले अनुप्रयोगों में प्रदर्शन कैसे होगा, इसका परीक्षण नहीं किया है, इसलिए हमें नहीं पता कि ये विशिष्ट "आहार" उन जटिल, वास्तविक दुनिया के परिदृश्यों में कैसे प्रदर्शन करेंगे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →