← नवीनतम पेपर
🤖 AI

CuraWeb: Joint Optimization of Quality, Redundancy, and Diversity for Web-Scale Pretraining Data

यह शोधपत्र CuraWeb को प्रस्तुत करता है, जो एक नवीन 2T-टोकन अंग्रेजी कॉर्पस है जिसे एक संयुक्त अनुकूलन ढांचे के माध्यम से निर्मित किया गया है जो गुणवत्ता, अतिरेक और विविधता को संतुलित करता है ताकि एकल-उद्देश्यीय क्यूरेशन की सीमाओं को दूर किया जा सके, जिसके परिणामस्वरूप एक अधिक समग्र डेटा वितरण प्राप्त होता है जो ज्ञान-गहन और तर्क संबंधी कार्यों पर LLM के प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है।

मूल लेखक: Peiguang Li, Yongwei Zhou, Juncheng Diao, Yuchun Fan, Jian Yang, Jianxiao Yang, Zhongda Su, Shuguang Jiao, Xiao Wei, Zhiye Zou, Gan Dong, Zhizhao Zeng, Rongxiang Weng, Jingang Wang, Xunliang Cai

प्रकाशित 2026-07-28
📖 9 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Peiguang Li, Yongwei Zhou, Juncheng Diao, Yuchun Fan, Jian Yang, Jianxiao Yang, Zhongda Su, Shuguang Jiao, Xiao Wei, Zhiye Zou, Gan Dong, Zhizhao Zeng, Rongxiang Weng, Jingang Wang, Xunliang Cai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को दुनिया को समझना सिखाने की कोशिश कर रहे हैं। इसे करने के लिए, आप उसे केवल कुछ पाठ्यपुस्तकें नहीं देते; बल्कि आप उसके दिमाग में पूरा इंटरनेट डाल देते हैं। आधुनिक आर्टिफिशियल इंटेलिजेंस (AI) इसी तरह सीखता है। वैज्ञानिक इसे "प्री-ट्रेनिंग" (pre-training) कहते हैं। रोबोट यह सीखने के लिए वेबसाइटों, समाचार लेखों और फ़ोरमों से अरबों वाक्य पढ़ता है कि इंसान कैसे बोलते हैं, सोचते हैं और समस्याओं को हल करते हैं। लेकिन यहाँ एक पेंच है: इंटरनेट अव्यवस्थित है। यह स्पैम, कॉपी-पेस्ट किए गए निरर्थक कंटेंट और बार-बार आने वाले विज्ञापनों से भरा हुआ है। यदि आप रोबोट को जंक फूड खिलाएंगे, तो वह बीमार हो जाएगा और स्पष्ट रूप से सोच नहीं पाएगा। इसलिए, शोधकर्ताओं को सख्त पोषण विशेषज्ञों (nutritionists) की तरह काम करना पड़ता है, जो खराब चीजों को छानकर बाहर निकाल दें और केवल उच्च-गुणवत्ता वाली, विविध और दिलचस्प जानकारी को ही रखें। बड़ा सवाल जिसका वे सामना कर रहे हैं वह यह है: आप इंटरनेट को कैसे साफ करें बिना अनजाने में उन दुर्लभ, अजीब और शानदार विचारों को फेंक दिए जो रोबोट को वास्तव में स्मार्ट बनाते हैं?

यहाँ CuraWeb आता है, जो Meituan के शोधकर्ताओं द्वारा एक नया प्रोजेक्ट है जो इस अव्यवस्थित समस्या को हल करने की कोशिश करता है। पिछले तरीकों को रेत को छानने वाली एक विशाल, कुंद छलनी (blunt sieve) के रूप में समझें। यदि आप छलनी को बहुत जोर से हिलाते हैं, तो आप गंदगी के साथ सोने के टुकड़ों को भी खो देते हैं। डेटा को साफ करने का पुराना तरीका वैसा ही था: इसने "बुरे" टेक्स्ट को फ़िल्टर करने के लिए सरल नियमों का उपयोग किया, लेकिन ऐसा करते हुए, इसने जटिल गणित, कोडिंग और विज्ञान के लेखों को भी हटा दिया क्योंकि वे सामान्य वाक्यों की तुलना में "अजीब" दिखते थे। CuraWeb टीम ने महसूस किया कि एक वास्तव में शानदार AI बनाने के लिए, आपको अधिक सूक्ष्म दृष्टिकोण की आवश्यकता है। वे केवल डेटा को साफ नहीं करना चाहते थे; वे इसे एक संग्रहालय क्यूरेटर (museum curator) की तरह क्यूरेट करना चाहते थे, यह सुनिश्चित करते हुए कि संग्रह उच्च-गुणवत्ता वाला हो, दोहराव वाला न हो, और मानव ज्ञान के हर कोने को कवर करता हो।

"एक ही आकार के लिए सभी" (One-Size-Fits-All) छलनी की समस्या

लंबे समय तक, AI के लिए डेटा तैयार करने का मानक तरीका एक फैक्ट्री असेंबली लाइन की तरह था। पहले, आप टेक्स्ट को एक नियम-आधारित फ़िल्टर से गुजारते हैं (जैसे यह देखना कि क्या किसी पेज पर बहुत अधिक संख्या या अजीब प्रतीक हैं)। फिर, आप इसे एक मॉडल के माध्यम से चलाते हैं जो यह अनुमान लगाता है कि टेक्स्ट "अच्छा" है या नहीं। अंत में, आप डुप्लिकेट को हटा देते हैं। लेखकों ने पाया कि समस्या यह है कि यह असेंबली लाइन हर विषय के साथ एक जैसा व्यवहार करती है। यह एक ऐसे लाइब्रेरियन की तरह है जो किसी भी ऐसी किताब को फेंक देने का निर्णय लेता है जिसका शीर्षक लंबा हो या जिसमें जटिल शब्दावली हो क्योंकि वह "अव्यवस्थित" दिखती है।

वास्तविकता में, एक गणित की पाठ्यपुस्तक या कोडिंग मैनुअल एक साधारण ब्लॉग पोस्ट की तुलना में अव्यवस्थित होता है। इसमें फॉर्मूले, प्रतीक और अजीब फॉर्मेटिंग होती है। पुराने फिल्टरों ने इन्हें त्रुटि माना और इन्हें हटा दिया। इसका मतलब था कि AI उन चीजों से सीखने का अवसर खो रहा था जो उसे स्मार्ट बनाती हैं: जटिल तर्क और विशेष ज्ञान। पुराने तरीकों का चलन एक "समरूप" (homogenized) आहार बनाने का भी था, जहाँ AI केवल मनोरंजन या खरीदारी जैसे लोकप्रिय विषयों के बारे में पढ़ता था, जिससे विज्ञान, कानून और विशिष्ट शौक में पाए जाने वाले 'लॉन्ग-टेल' ज्ञान की कमी रह जाती थी।

CuraWeb समाधान: एक स्मार्ट, मल्टी-ट्रैक किचन

CuraWeb टीम ने डेटा को पकाने का एक नया तरीका प्रस्तावित किया, जो एक एकल, कुंद फ़िल्टर से बदलकर तीन चीजों के संयुक्त अनुकूलन (joint optimization) की ओर बढ़ गया: गुणवत्ता (Quality) (क्या यह अच्छा है?), अतिरेक (Redundancy) (क्या यह एक कॉपी है?), और विविधता (Diversity) (क्या यह अद्वितीय है?)। उन्होंने एक ऐसा ढांचा बनाया जो विशेषज्ञ शेफ की एक टीम की तरह कार्य करता है, जिसमें से प्रत्येक का एक विशिष्ट कार्य है, जो AI के लिए 2-ट्रिलियन-टोकन का भोज तैयार करने के लिए मिलकर काम करता है।

1. अनुकूलित छलनी (डोमेन-अवेयर फ़िल्टरिंग)

हर चीज़ के लिए नियमों का एक सेट उपयोग करने के बजाय, CuraWeb एक "स्मार्ट छलनी" का उपयोग करता है जो एक ब्लॉग पोस्ट और एक गणित की समस्या के बीच अंतर जानता है।

  • पुराना तरीका: यदि किसी दस्तावेज़ में बहुत अधिक प्रतीक (जैसे +, -, =) होते थे, तो पुराने नियम उसे कचरा समझकर हटा देते थे।
  • CuraWay: उन्होंने महसूस किया कि गणित और कोडिंग के लिए, वे प्रतीक आवश्यक हैं। इसलिए, उन्होंने एक "प्रायोरिटी बाईपास" बनाया। यदि सिस्टम पता लगाता है कि दस्तावेज़ गणित, विज्ञान या कोडिंग के बारे में है, तो यह सख्त "कोई प्रतीक नहीं" वाले नियम को छोड़ देता है। यह इन जटिल दस्तावेजों को अगले चरण में जाने देता है, जिससे यह सुनिश्चित होता है कि AI कैलकुलस करने या कोड लिखने की अपनी क्षमता न खो दे। उन्होंने अपने नियमों को कम आक्रामक भी बनाया, जिससे वे उपयोगी जानकारी के अधिक अंशों को रख सके जिन्हें पुराने फिल्टर बाहर कर देते थे।

2. "सॉफ्ट" डुप्लिकेट डिटेक्टर

कल्पना कीजिए कि आपके पास एक पुस्तकालय है जहाँ कोई व्यक्ति बस नाम बदलकर एक ही फॉर्म बार-बार प्रिंट करता रहता है। एक साधारण स्कैनर इसे मिस कर सकता है क्योंकि टेक्स्ट बिल्कुल एक जैसा नहीं है।

  • पुराना तरीका: पुराने सिस्टम एक "हार्ड थ्रेशोल्ड" का उपयोग करते थे। यदि दो दस्तावेज़ 95% समान दिखते थे, तो वे एक को हटा देते थे। लेकिन यह खतरनाक था। विशिष्ट क्षेत्रों में, विशेषज्ञ अक्सर समान तकनीकी शब्दों का उपयोग करते हैं, जिससे उनका लेखन बहुत समान दिखता है भले ही वे अलग बातें कह रहे हों। एक हार्ड डिलीट इन मूल्यवान, अद्वितीय अंतर्दृष्टि को मिटा देता।
  • CuraWay: उन्होंने एक सॉफ्ट सिमेंटिक डीडुप्लिकेशन (Soft Semantic Deduplication) रणनीति पेश की। किसी दस्तावेज़ को दूसरे के समान दिखने पर तुरंत हटाने के बजाय, वे एक "मतदान प्रणाली" का उपयोग करते हैं। वे कई कोणों से जांचते हैं कि वह कितना समान है। यदि कोई दस्तावेज़ वाकई बहुत समान है (जैसे कि कॉपी-पेस्ट किया गया काम), तो उसे भारी दंड (penalty) मिलता है। लेकिन यदि वह केवल उसी तकनीकी विषय के कारण समान है, तो उसे हल्का दंड मिलता है। दस्तावेज़ को तभी हटाया जाता है जब "पेनल्टी स्कोर" बहुत अधिक हो जाता है। यह एक ऐसे लाइब्रेरियन की तरह है जो किसी किताब को सिर्फ इसलिए नहीं फेंकता क्योंकि वह दूसरे विषय के बारे में है; वह उसे तभी फेंकता है जब वह वास्तव में वही कहानी हो। इस पद्धति ने कठिन मामलों में गलत डिलीशन (अच्छी चीजों को फेंकना) को 37.5% से घटाकर 28.03% कर दिया।

3. स्मार्ट सैंपलर (पावर सैंपलिंग)

एक बार जब आपका डेटा साफ हो जाता है, तो आपको यह तय करना होता है कि वास्तव में रोबोट को क्या खिलाना है। आप उसे सब कुछ नहीं खिला सकते, इसलिए आपको सबसे अच्छा चुनना होगा।

  • पुराना तरीका: कुछ सिस्टम बस यादृच्छिक (random) उच्च-गुणवत्ता वाले दस्तावेज़ चुनते थे। अन्य गुणवत्ता और विविधता को संतुलित करने की कोशिश करते थे लेकिन अक्सर एक उबाऊ मिश्रण ही बन पाते थे।
  • CuraWay: उन्होंने एक पावर सैंपलिंग (Power Sampling) विधि बनाई। कल्पना कीजिए कि एक लॉटरी है जहाँ सबसे दिलचस्प, उच्च-मूल्य वाले दस्तावेज़ों (जैसे गहरे वैज्ञानिक शोध पत्र या चतुर तर्क कार्य) के टिकटों पर बहुत बड़े नंबर हैं, जिससे उनके चुने जाने की संभावना बहुत अधिक हो जाती है। उन्होंने दो चीजों पर दस्तावेज़ों को स्कोर दिया: लेखन गुणवत्ता (Writing Quality) (क्या यह अच्छी तरह लिखा गया है?) और सामग्री मूल्य (Content Value) (क्या यह कुछ नया सिखाता है?)। उन्होंने इन स्कोरों को मिलाया और सबसे अच्छे दस्तावेज़ों को बढ़ाने के लिए एक "पावर" फंक्शन का उपयोग किया। इसका मतलब है कि AI को औसत दर्जे की चीज़ों के बजाय उच्च-मूल्य वाले, विविध ज्ञान से भरपूर आहार मिलता है।

परिणाम: एक स्मार्ट रोबोट

शोधकर्ताओं ने अपने नए डेटासेट, CURAWEB का परीक्षण करने के लिए, इस पर एक 3-बिलियन-पैरामीटर वाला AI मॉडल प्रशिक्षित किया। उन्होंने इस मॉडल की तुलना FineWeb-Edu और DCLM जैसे प्रसिद्ध डेटासेट्स पर प्रशिक्षित अन्य मॉडलों से की।

परिणाम स्पष्ट थे: CuraWeb बेहतर काम करता है।

  • कुल प्रदर्शन: CuraWeb पर प्रशिक्षित मॉडल ने 10 अलग-अलग बेंचमार्क पर औसतन 48.07% स्कोर किया, जो पिछले सर्वश्रेष्ठ (DCLM) से 1.82% अधिक था।
  • तर्क और ज्ञान: सबसे बड़ी जीत उन कार्यों में हुई जिनमें गहराई से सोचने की आवश्यकता होती है। GSM8K नामक गणित परीक्षण पर, CuraWeb मॉडल ने अगले सर्वश्रेष्ठ की तुलना में 4.39% की छलांग लगाई। एक सामान्य ज्ञान परीक्षण (MMLU) पर, इसमें 6.61% का सुधार हुआ।
  • "स्पेशलिस्ट" प्रभाव: अध्ययन ने दिखाया कि जबकि कुछ पुराने डेटासेट्स विशिष्ट चीजों (जैसे पाठ्यपुस्तकें) के लिए अच्छे थे लेकिन अन्य के लिए खराब थे, CuraWeb हर जगह मजबूत था। इसने एक कौशल के बदले दूसरा कौशल नहीं खोया; इसने रोबोट की तर्क करने और जटिल विषयों को समझने की क्षमता में सुधार किया, बिना उसकी सामान्य समझ को खोए।

यह क्यों महत्वपूर्ण है

यह शोध पत्र सुझाव देता है कि AI का भविष्य केवल इसे अधिक डेटा खिलाने के बारे में नहीं है; बल्कि इसे बेहतर डेटा खिलाने के बारे में है। डेटा को "साफ" करने का पुराना दृष्टिकोण अक्सर किसी भी ऐसी चीज़ को हटाकर इसे "कम बुद्धिमान" बना देता था जो एक मानक वाक्य की तरह नहीं दिखती थी। CuraWeb दिखाता है कि डेटा को फ़िल्टर करने, डुप्लिकेट हटाने और चयन करने के मामले में स्मार्ट होकर, हम ऐसे AI मॉडल बना सकते हैं जो न केवल अधिक सटीक हैं, बल्कि उन कठिन, रचनात्मक और विशिष्ट कार्यों में भी बेहतर हैं जिनकी मनुष्यों को आवश्यकता होती है।

संक्षेप में, लेखकों ने न केवल इंटरनेट को साफ करने का एक बेहतर तरीका खोजा; उन्होंने इसकी आत्मा को संरक्षित करने का एक तरीका भी खोजा—वह अजीब, जटिल और शानदार हिस्सा जो हमें इंसान बनाता है—और उसे मशीनों को दे दिया। उनके प्रयोग बताते हैं कि यदि आप डेटा के साथ सावधानी से व्यवहार करते हैं, उसकी विविधता और जटिलता का सम्मान करते हैं, तो AI तेजी से सीखता है और गहराई से सोचता है। यह एक याद दिलाता है कि आर्टिफिशियल इंटेलिजेंस की दौड़ में, सामग्री की गुणवत्ता उतनी ही मायने रखती है जितना कि बर्तन का आकार।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →