← नवीनतम पेपर
💻 computer science

The Limits of Training Data Size in Foundation Models: An Empirical Analysis of Quality Filtering under a Fixed Token Pool

एक निश्चित 24-मिलियन-टोकन पूल पर अनुभवजन्य प्रयोगों के माध्यम से, यह शोध पत्र प्रदर्शित करता है कि एक निश्चित कंप्यूट बजट के तहत आक्रामक गुणवत्ता फ़िल्टरिंग अक्सर अत्यधिक डेटा पुनरावृत्ति को मजबूर करके मॉडल के प्रदर्शन को नुकसान पहुँचाती है, जबकि निम्न-गुणवत्ता वाले डेटा को बनाए रखना और उच्च-गुणवत्ता वाले उपसमुच्चयों का ओवरसैंपलिंग करना विभिन्न लक्ष्यों में बेहतर या समतुल्य परिणाम प्रदान करता है।

मूल लेखक: Alexander Memming

प्रकाशित 2026-07-28
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Alexander Memming

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को मानव भाषा बोलना सिखाने की कोशिश कर रहे हैं। इसे करने के लिए, आपको इसे टेक्स्ट का एक विशाल पुस्तकालय खिलाना होगा—किताबें, वेबसाइटें, लेख और बहुत कुछ। लंबे समय तक, वैज्ञानिकों ने सोचा कि एकमात्र चीज़ जो मायने रखती है वह यह है कि आप रोबोट को कितना टेक्स्ट खिला सकते हैं। जितना बड़ा पुस्तकालय होगा, रोबोट उतना ही स्मार्ट बनेगा। इस विचार को "स्केलिंग" कहा जाता है, और यही कारण है कि हमारे AI असिस्टेंट आज इतने अच्छे हैं।

लेकिन इसमें एक पेंच है। सारा टेक्स्ट एक जैसा नहीं होता। कुछ पेज बकवास, स्पैम या निरर्थक बातों से भरे होते हैं, जबकि अन्य विशेषज्ञों द्वारा लिखे जाते हैं और उपयोगी जानकारी से भरपूर होते हैं। इसलिए, शोधकर्ताओं ने पूछना शुरू किया: "क्या हमें बुरा डेटा फेंक देना चाहिए और केवल सबसे अच्छी किताबें ही रोबोट को देनी चाहिए?" इसे "क्वालिटी फिल्टरिंग" (गुणवत्ता छँटाई) कहा जाता है। हालाँकि, इस खेल में एक दूसरा नियम भी है: रोबोट तब सबसे अच्छा सीखता है जब वह ताज़ा जानकारी देखता है। यदि आप उसे बार-बार वही कुछ पेज पढ़ने के लिए मजबूर करते हैं, तो वह सीखना बंद कर देता है और केवल रटने लगता है। यह शोध एक पेचीदा संतुलन की खोज करता है: यदि आप बुरा टेक्स्ट फेंक देते हैं, तो आपके पास पढ़ने के लिए कम पेज बचते हैं, जिसका अर्थ है कि रोबोट को अच्छे पेजों को अधिक बार पढ़ना होगा। क्या कम, लेकिन बेहतर पेज होने से मदद मिलती है, या क्या रोबोट एक ही चीज़ को बहुत बार पढ़कर ऊब जाता है और भ्रमित हो जाता है?


द ग्रेट लाइब्रेरी एक्सपेरिमेंट (महान पुस्तकालय प्रयोग)

इस अध्ययन में, अलेक्जेंडर मेमिंग नामक एक शोधकर्ता ने इस पहेली को सुलझाने के लिए एक चतुर प्रयोग तैयार किया। उन्होंने पूरे इंटरनेट का उपयोग नहीं किया (जो आसानी से परीक्षण करने के लिए बहुत विशाल है)। इसके बजाय, उन्होंने लगभग 24 मिलियन शब्दों का एक "फिक्स्ड पूल" बनाया—वेब का एक छोटा, प्रबंधनीय हिस्सा। फिर उन्होंने यह समान शब्दों का पूल कई छोटे AI मॉडल्स को दिया, लेकिन उन्होंने प्रत्येक के लिए नियम बदल दिए।

कुछ मॉडल्स के लिए, उन्होंने सभी शब्दों को रखा। दूसरों के लिए, उन्होंने एक सख्त लाइब्रेरियन की तरह काम किया और निचले आधे, चौथाई, आठवें, या यहाँ तक कि केवल शीर्ष सोलहवें हिस्से के शब्दों को हटा दिया, केवल उन्हीं को रखा जिन्हें कंप्यूटर ने "उच्च गुणवत्ता" वाला समझा। उन्होंने एक तीसरा तरीका भी आजमाया: कुछ भी हटाने के बजाय, उन्होंने पूरा पुस्तकालय रखा लेकिन रोबोट को बताया कि वह "सर्वश्रेष्ठ" पेजों को "ठीक-ठाक" पेजों की तुलना में कई अधिक बार पढ़े।

फिर उन्होंने इन रोबोट्स का तीन अलग-अलग चीजों पर परीक्षण किया:

  1. द रॉ वेब (कच्चा वेब): सब कुछ का मिश्रण, बिल्कुल वैसा ही जैसा उनके प्रशिक्षण के लिए इस्तेमाल किया गया पुस्तकालय था।
  2. "एडु" टेक्स्ट (शैक्षिक टेक्स्ट): उच्च-गुणवत्ता वाले, शैक्षिक पेज (उस प्रकार के जिन्हें रोबोट पसंद करता था)।
  3. विकीट (WikiText): विश्वकोश लेखों का एक पूरी तरह से अलग सेट जिसे रोबोट ने पहले कभी नहीं देखा था।

आश्चर्यजनक निष्कर्ष

परिणाम थोड़े उतार-चढ़ाव भरे थे, और उन्होंने खेल के नियमों को तीन बड़े तरीकों से बदल दिया।

1. यह इस पर निर्भर करता है कि आप किससे बात कर रहे हैं
सबसे बड़ा आश्चर्य यह था कि "क्वालिटी फिल्टरिंग" हमेशा रोबोट को स्मार्ट नहीं बनाती। यह पूरी तरह से इस पर निर्भर करता है कि आप रोबोट से क्या करवाना चाहते हैं।

  • यदि आप चाहते हैं कि रोबोट बिखरे हुए, वास्तविक इंटरनेट को समझे: "बुरे" टेक्स्ट को हटा देने से वास्तव में रोबोट को नुकसान पहुँचा। शोधकर्ता ने जितना अधिक फ़िल्टर किया, रोबोट का प्रदर्शन उतना ही खराब होता गया। यह वैसा ही है जैसे किसी शहर में गाड़ी चलाना सीखने के लिए केवल एक आदर्श, खाली रेसट्रैक पर अभ्यास करना। जब आप अंततः सड़क के गड्ढों और ट्रैफिक वाली असली सड़कों पर पहुँचते हैं, तो आप दुर्घटनाग्रस्त हो जाते हैं। फ़िल्टर किए गए डेटा पर प्रशिक्षित रोबोट वास्तविक वेब की अव्यवस्था को नहीं संभाल सका।
  • यदि आप चाहते हैं कि रोबोट उच्च-गुणवत्ता वाले विषयों का विशेषज्ञ बने: तो फ़िल्टरिंग ने थोड़ी मदद की। यदि लक्ष्य एक विद्वान या विश्वकोश की तरह बोलना था, तो केवल बेहतरीन पेजों को रखने से रोबोट थोड़ा बेहतर बना।

2. आप जितना अधिक प्रशिक्षण लेते हैं, उतना ही कम फ़िल्टर करना चाहिए
यहाँ सबसे महत्वपूर्ण सबक है: आपका बजट आपकी सर्वश्रेष्ठ रणनीति बदल देता है।
कल्पना कीजिए कि आपके पास एक छोटा पॉकेट मनी (छोटा प्रशिक्षण बजट) है। आप केवल सबसे महंगे, उच्च-गुणवत्ता वाले खिलौने खरीदने के लिए प्रलोभित हो सकते हैं। लेकिन यदि आपके पास एक बड़ा भत्ता (विशाल बजट) है, तो केवल महंगे खिलौने खरीदना मतलब बहुत जल्दी नए खिलौनों की कमी हो जाना। आप बार-बार एक ही महंगे खिलौने के साथ खेलते रहेंगे जब तक कि आप ऊब न जाएं।
अध्ययन में पाया गया कि जैसे-जैसे प्रशिक्षण बजट बढ़ता गया, "सर्वश्रेष्ठ" रणनीति बदल गई। शुरुआत में, केवल शीर्ष 1/16 डेटा रखना ठीक लग रहा था। लेकिन जैसे-जैसे रोबोट को अधिक प्रशिक्षित किया गया (डेटा को 4.1 बार के बजाय 8.2 बार पढ़ने के बाद), वह छोटा, फ़िल्टर किया गया पुस्तकालय एक आपदा बन गया। रोबोट ऊब गया और गलतियाँ करने लगा। एक बड़े बजट के लिए सबसे अच्छी रणनीति अधिक डेटा रखना निकला, यहाँ तक कि बिखरे हुए हिस्सों को भी, ताकि रोबोट नई चीजें देख सके।

3. इसे फेंकें नहीं, बस इसे अधिक पढ़ें
शोधकर्ता ने "बुरे टेक्स्ट को फेंकने" बनाम "अच्छे टेक्स्ट को अधिक बार पढ़ने" की भी तुलना की।

  • "फेंक देने" का तरीका: आप निम्न-गुणवत्ता वाले पेजों को हटा देते हैं।
  • "अधिक पढ़ने" का तरीका: आप सभी पेजों को रखते हैं, लेकिन रोबोट को बताते हैं, "हे, इन शीर्ष पेजों को 16 बार पढ़ो, लेकिन नीचे के पेजों को केवल एक बार पढ़ो।"

जब शोधकर्ता बहुत आक्रामक होने की कोशिश कर रहा था (केवल शीर्ष 1/16 हिस्सा रखने के लिए), तो "अधिक पढ़ें" वाला तरीका भारी अंतर से जीत गया। यह "फेंक देने" के तरीके से 0.39 नैट्स (एक इकाई जो बताती है कि रोबोट अगले शब्द की कितनी अच्छी भविष्यवाणी करता है) बेहतर था।
इसे इस तरह सोचें: यदि आपका कोई पसंदीदा गाना है, तो आप या तो अपने प्लेलिस्ट के सभी अन्य गानों को हटा सकते हैं और उस एक गाने को 16 बार सुन सकते हैं (फेंक देना), या आप अपनी पूरी प्लेलिस्ट रख सकते हैं लेकिन सुनिश्चित कर सकते हैं कि वह पसंदीदा गाना 16 गुना अधिक बार बजे (अधिक पढ़ें)। दूसरा तरीका बेहतर है क्योंकि आपके पास चीज़ों को दिलचस्प बनाए रखने के लिए अन्य गाने भी बैकग्राउंड में रहते हैं, और आप पूर्ण पुस्तकालय की अनूठी विविधता को खोते नहीं हैं।

निचोड़ (The Bottom Line)

यह पेपर यह नहीं कहता कि हम AI को स्मार्ट बनाने की कोशिश करना बंद कर दें। इसके बजाय, यह हमें चेतावनी देता है कि हम आँख मूंदकर "बुरे" डेटा को नहीं फेंक सकते।

  • यदि आप वास्तविक दुनिया को समझना चाहते हैं, तो फ़िल्टर न करें: यदि आप एक ऐसा AI चाहते हैं जो बिखरे हुए इंटरनेट को समझता है, तो बिखरे हुए डेटा को रखें।
  • यदि आपके पास बड़ा बजट है, तो बहुत अधिक फ़िल्टर न करें: यदि आपके पास बहुत अधिक कंप्यूटिंग पावर है, तो आपको डेटा की एक विशाल विविधता की आवश्यकता है। यदि आप बहुत सख्ती से फ़िल्टर करते हैं, तो आप AI को खुद को दोहराने के लिए मजबूर करते हैं, और इससे उसकी सीखने की प्रक्रिया रुक जाती है।
  • दोहराव, हटाने से बेहतर है: यदि आप वास्तव में सबसे अच्छे डेटा पर ध्यान केंद्रित करना चाहते हैं, तो बाकी को हटाएँ नहीं। बस यह सुनिश्चित करें कि AI बुरे की तुलना में अच्छे हिस्से को अधिक बार देखे।

यह अध्ययन छोटे मॉडल्स और डेटा के एक छोटे हिस्से पर किया गया था, इसलिए हम निश्चित रूप से यह नहीं कह सकते कि भविष्य के विशाल AI मॉडल्स के साथ क्या होगा। लेकिन सबक स्पष्ट है: डेटा की गुणवत्ता और डेटा की मात्रा को अलग-अलग मानना एक गलती है। वे आपस में जुड़े हुए हैं, और AI को प्रशिक्षित करने का सबसे अच्छा तरीका इस बात पर निर्भर करता है कि आपके पास खर्च करने के लिए कितना समय और पैसा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →