← नवीनतम पेपर
💬 NLP

Auditing Chinese Web-scale Corpora via Sampled BPE Token Statistics

यह शोधपत्र Sampled-BPE को प्रस्तुत करता है, जो एक हल्का (lightweight) टोकन-स्तरीय ऑडिटिंग पाइपलाइन है जो छोटे नमूनों पर BPE टोकेनाइज़र को प्रशिक्षित करके वेब-स्केल चीनी कॉर्पोरा में प्रदूषण की कुशलतापूर्वक पहचान करता है, जो खुले डेटासेट्स में व्यापक और परिवर्तनशील संदूषण को प्रकट करता है और आगे के विश्लेषण के लिए एक पदानुक्रमित डेटासेट प्रदान करता है।

मूल लेखक: Qingjie Zhang, Ziqi Tang, Jie Zhang, Gelei Deng, Jinfeng Li, YueFeng Chen, Yitong Yang, Hui Xue, Tianwei Zhang, Han Qiu

प्रकाशित 2026-08-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qingjie Zhang, Ziqi Tang, Jie Zhang, Gelei Deng, Jinfeng Li, YueFeng Chen, Yitong Yang, Hui Xue, Tianwei Zhang, Han Qiu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

इंटरनेट की कल्पना एक विशाल, अनंत पुस्तकालय के रूप में करें जहाँ हर किताब, ब्लॉग और टूटे हुए वेबपेज का एक टेक्स्ट पेज है। वर्षों से, वैज्ञानिक कंप्यूटर को इस पुस्तकालय को पढ़ने और समझने के लिए सिखाने की कोशिश कर रहे हैं ताकि "लार्ज लैंग्वेज मॉडल्स" (LLMs)—जैसे कि वे एआई असिस्टेंट जिनसे आप चैट कर सकते हैं—बनाए जा सकें। लेकिन समस्या यह है कि इंटरनेट केवल एक साफ-सुथरा पुस्तकालय नहीं है; यह स्पैम, घोटाले और अनुचित सामग्री से भरा एक अस्त-व्यस्त बाजार भी है। जब एआई इस अव्यवस्थित पुस्तकालय से सीखता है, तो वह अनजाने में बुरी आदतें भी सीख सकता है, जैसे कि ऑनलाइन जुए के बारे में लिखना या अजीब, अपमानजनक वाक्यांश उत्पन्न करना। इसे "कॉर्पस पॉल्यूशन" (corpus pollution) कहा जाता है। इसे ठीक करने के लिए, शोधकर्ताओं को पुस्तकालय का ऑडिट करने की आवश्यकता है, लेकिन पुस्तकालय इतना विशाल है (खरबों पेज!) कि हर एक पेज को पढ़ने में एक मानव जीवन से भी अधिक समय लग जाएगा। उन्हें एक ऐसा तरीका चाहिए जिससे वे हर एक चीज़ की जाँच किए बिना अंदर झाँक सकें और खराब चीजों को ढूँढ सकें।

यह बिल्कुल वही काम है जिसे पेपर "ऑडिटिंग चाइनीज़ वेब-स्केल कॉर्पोरा वाया सैम्पल्ड बीपीई टोकन स्टैटिस्टिक्स" (Auditing Chinese Web-scale Corpora via Samplemed BPE Token Statistics) हल करता है। लेखकों ने, जो त्सिंगहुआ विश्वविद्यालय और अन्य संस्थानों की एक टीम है, महसूस किया कि पूरे चीनी इंटरनेट को खराब सामग्री के लिए स्कैन करना बहुत धीमा और महंगा था। इसलिए, उन्होंने SAMPLED-BPE नामक एक चतुर शॉर्टकट का आविष्कार किया। इसे एक समुद्री जीवविज्ञानी की तरह समझें जो यह जानना चाहता है कि एक विशाल महासागर कितना प्रदूषित है। हर एक बूंद को इकट्ठा करने के बजाय, वे अलग-अलग जगहों से कुछ छोटे नमूने लेते हैं, उनका विश्लेषण करते हैं, और उस आधार पर पूरे महासागर के प्रदूषण स्तर का अनुमान लगाते हैं। इस मामले में, "महासागर" चीनी वेब है, और "प्रदूषण" जहरीले या स्पैमी शब्द (टोकन) हैं जो एआई मॉडल्स में समा जाते हैं।

उनकी पद्धति आश्चर्यजनक रूप से सरल लेकिन शक्तिशाली है। वे विशाल चीनी टेक्स्ट डेटा का एक बहुत छोटा हिस्सा (कुल का केवल 0.25% जितना छोटा) लेते हैं, केवल उसी हिस्से पर एक विशेष "टोकनाइज़र" (एक उपकरण जो टेक्स्ट को छोटे टुकड़ों या 'टोकन' में तोड़ता है) को प्रशिक्षित करते हैं, और फिर देखते हैं कि कौन से टोकन सबसे अधिक बार दिखाई देते हैं। यदि टेक्स्ट का एक हिस्सा उनके छोटे से नमूने में लगातार दिखाई देता है, तो इसकी संभावना है कि वह पूरे डेटासेट में एक सामान्य पैटर्न है। इसके बाद वे उन बार-बार आने वाले हिस्सों का अर्थ समझने के लिए वेब पर खोज करके एक स्मार्ट एआई असिस्टेंट का उपयोग करते हैं। यदि कोई हिस्सा किसी जुआ वेबसाइट या अश्लील वाक्यांश के रूप में निकलता है, तो वे उसे चिह्नित कर देते हैं।

उनके निष्कर्ष चौंकाने वाले हैं। उन्होंने 11 अलग-अलग ओपन-सोर्स चीनी टेक्स्ट संग्रहों और 2021 से 2026 तक के चीनी वेब के 6 स्नैपशॉट का ऑडिट किया। उन्होंने पाया कि प्रदूषण हर जगह है, लेकिन यह समान रूप से फैला हुआ नहीं है। कुछ डेटासेट अपेक्षाकृत साफ हैं, जबकि अन्य पूरी तरह से खराब सामग्री में डूबे हुए हैं। उदाहरण के लिए, OSCAR नामक एक डेटासेट को 83% से अधिक प्रदूषित पाया गया, जिसमें अधिकांश वयस्क सामग्री (adult content) थी। दूसरा, mC4, ऑनलाइन जुए के शब्दों से भारी रूप से प्रदूषित था। इससे भी दिलचस्प बात यह है कि उन्होंने पाया कि "चाइनीज़ कॉमन क्रॉल" (एक विशाल, कच्चा वेब डंप) अत्यधिक प्रदूषित है, और प्रदूषण का प्रकार समय के साथ बदलता रहता है। 2026 में, उनके स्नैपशॉट में लगभग 69% सामग्री वयस्क सामग्री थी, जबकि जुए से संबंधित सामग्री 2021 के बाद से काफी कम हो गई थी। यह बताता है कि वेब पर मौजूद खराब चीजें एक बदलता हुआ लक्ष्य हैं; जैसे ही स्पैम का एक प्रकार ब्लॉक किया जाता है, दूसरा सामने आ जाता है।

यह पेपर इस विचार का भी खंडन करता है कि आप केवल "बुरे शब्दों" की एक निश्चित सूची बनाकर उन्हें फ़िल्टर कर सकते हैं। क्योंकि प्रदूषण बहुत तेज़ी से बदलता है और अक्सर चालाकी भरे, संक्षिप्त या मिश्रित शब्दों का उपयोग करता है (जैसे कि एक जुए के शब्द को बनाने के लिए दो सामान्य शब्दों को मिलाना), एक स्थिर सूची जल्दी ही बेकार हो जाएगी। इसके बजाय, लेखक सुझाव देते हैं कि हमें वेब का नियमित रूप से ऑडिट करना जारी रखना चाहिए, जैसा कि उन्होंने किया। दूसरों की मदद करने के लिए, उन्होंने 6,30,000 से अधिक रिकॉर्ड वाला एक विशाल नया डेटासेट जारी किया है, जो इन प्रदूषित टोकनों को "वृक्षों" (trees) के रूप में व्यवस्थित करता है जो दिखाते हैं कि कैसे छोटे, बुरे शब्द लंबे, अधिक जटिल बुरे वाक्यांशों में विकसित होते हैं।

संक्षेप में, यह पेपर साबित करता है कि यह जानने के लिए कि समुद्र गंदा है, आपको पूरा समुद्र पढ़ने की आवश्यकता नहीं है; एक स्मार्ट, छोटा नमूना एक स्पष्ट तस्वीर पाने के लिए पर्याप्त है। उन्होंने दिखाया कि चीनी वेब वर्तमान में एआई प्रशिक्षण के लिए एक बहुत ही प्रदूषित स्थान है, और प्रदूषण तेजी से बदलता और विकसित होता रहता है। उनका नया टूल, SAMPLED-BPE, इन विशाल डेटासेट्स की जांच महीनों के बजाय घंटों में करना संभव बनाता है, जिससे शोधकर्ताओं को इंटरनेट के विशाल आकार से अभिभूत हुए बिना अपने एआई मॉडल्स को साफ रखने का एक तरीका मिलता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →