Auditing Chinese Web-scale Corpora via Sampled BPE Token Statistics
यह शोधपत्र Sampled-BPE को प्रस्तुत करता है, जो एक हल्का (lightweight) टोकन-स्तरीय ऑडिटिंग पाइपलाइन है जो छोटे नमूनों पर BPE टोकेनाइज़र को प्रशिक्षित करके वेब-स्केल चीनी कॉर्पोरा में प्रदूषण की कुशलतापूर्वक पहचान करता है, जो खुले डेटासेट्स में व्यापक और परिवर्तनशील संदूषण को प्रकट करता है और आगे के विश्लेषण के लिए एक पदानुक्रमित डेटासेट प्रदान करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
इंटरनेट की कल्पना एक विशाल, अनंत पुस्तकालय के रूप में करें जहाँ हर किताब, ब्लॉग और टूटे हुए वेबपेज का एक टेक्स्ट पेज है। वर्षों से, वैज्ञानिक कंप्यूटर को इस पुस्तकालय को पढ़ने और समझने के लिए सिखाने की कोशिश कर रहे हैं ताकि "लार्ज लैंग्वेज मॉडल्स" (LLMs)—जैसे कि वे एआई असिस्टेंट जिनसे आप चैट कर सकते हैं—बनाए जा सकें। लेकिन समस्या यह है कि इंटरनेट केवल एक साफ-सुथरा पुस्तकालय नहीं है; यह स्पैम, घोटाले और अनुचित सामग्री से भरा एक अस्त-व्यस्त बाजार भी है। जब एआई इस अव्यवस्थित पुस्तकालय से सीखता है, तो वह अनजाने में बुरी आदतें भी सीख सकता है, जैसे कि ऑनलाइन जुए के बारे में लिखना या अजीब, अपमानजनक वाक्यांश उत्पन्न करना। इसे "कॉर्पस पॉल्यूशन" (corpus pollution) कहा जाता है। इसे ठीक करने के लिए, शोधकर्ताओं को पुस्तकालय का ऑडिट करने की आवश्यकता है, लेकिन पुस्तकालय इतना विशाल है (खरबों पेज!) कि हर एक पेज को पढ़ने में एक मानव जीवन से भी अधिक समय लग जाएगा। उन्हें एक ऐसा तरीका चाहिए जिससे वे हर एक चीज़ की जाँच किए बिना अंदर झाँक सकें और खराब चीजों को ढूँढ सकें।
यह बिल्कुल वही काम है जिसे पेपर "ऑडिटिंग चाइनीज़ वेब-स्केल कॉर्पोरा वाया सैम्पल्ड बीपीई टोकन स्टैटिस्टिक्स" (Auditing Chinese Web-scale Corpora via Samplemed BPE Token Statistics) हल करता है। लेखकों ने, जो त्सिंगहुआ विश्वविद्यालय और अन्य संस्थानों की एक टीम है, महसूस किया कि पूरे चीनी इंटरनेट को खराब सामग्री के लिए स्कैन करना बहुत धीमा और महंगा था। इसलिए, उन्होंने SAMPLED-BPE नामक एक चतुर शॉर्टकट का आविष्कार किया। इसे एक समुद्री जीवविज्ञानी की तरह समझें जो यह जानना चाहता है कि एक विशाल महासागर कितना प्रदूषित है। हर एक बूंद को इकट्ठा करने के बजाय, वे अलग-अलग जगहों से कुछ छोटे नमूने लेते हैं, उनका विश्लेषण करते हैं, और उस आधार पर पूरे महासागर के प्रदूषण स्तर का अनुमान लगाते हैं। इस मामले में, "महासागर" चीनी वेब है, और "प्रदूषण" जहरीले या स्पैमी शब्द (टोकन) हैं जो एआई मॉडल्स में समा जाते हैं।
उनकी पद्धति आश्चर्यजनक रूप से सरल लेकिन शक्तिशाली है। वे विशाल चीनी टेक्स्ट डेटा का एक बहुत छोटा हिस्सा (कुल का केवल 0.25% जितना छोटा) लेते हैं, केवल उसी हिस्से पर एक विशेष "टोकनाइज़र" (एक उपकरण जो टेक्स्ट को छोटे टुकड़ों या 'टोकन' में तोड़ता है) को प्रशिक्षित करते हैं, और फिर देखते हैं कि कौन से टोकन सबसे अधिक बार दिखाई देते हैं। यदि टेक्स्ट का एक हिस्सा उनके छोटे से नमूने में लगातार दिखाई देता है, तो इसकी संभावना है कि वह पूरे डेटासेट में एक सामान्य पैटर्न है। इसके बाद वे उन बार-बार आने वाले हिस्सों का अर्थ समझने के लिए वेब पर खोज करके एक स्मार्ट एआई असिस्टेंट का उपयोग करते हैं। यदि कोई हिस्सा किसी जुआ वेबसाइट या अश्लील वाक्यांश के रूप में निकलता है, तो वे उसे चिह्नित कर देते हैं।
उनके निष्कर्ष चौंकाने वाले हैं। उन्होंने 11 अलग-अलग ओपन-सोर्स चीनी टेक्स्ट संग्रहों और 2021 से 2026 तक के चीनी वेब के 6 स्नैपशॉट का ऑडिट किया। उन्होंने पाया कि प्रदूषण हर जगह है, लेकिन यह समान रूप से फैला हुआ नहीं है। कुछ डेटासेट अपेक्षाकृत साफ हैं, जबकि अन्य पूरी तरह से खराब सामग्री में डूबे हुए हैं। उदाहरण के लिए, OSCAR नामक एक डेटासेट को 83% से अधिक प्रदूषित पाया गया, जिसमें अधिकांश वयस्क सामग्री (adult content) थी। दूसरा, mC4, ऑनलाइन जुए के शब्दों से भारी रूप से प्रदूषित था। इससे भी दिलचस्प बात यह है कि उन्होंने पाया कि "चाइनीज़ कॉमन क्रॉल" (एक विशाल, कच्चा वेब डंप) अत्यधिक प्रदूषित है, और प्रदूषण का प्रकार समय के साथ बदलता रहता है। 2026 में, उनके स्नैपशॉट में लगभग 69% सामग्री वयस्क सामग्री थी, जबकि जुए से संबंधित सामग्री 2021 के बाद से काफी कम हो गई थी। यह बताता है कि वेब पर मौजूद खराब चीजें एक बदलता हुआ लक्ष्य हैं; जैसे ही स्पैम का एक प्रकार ब्लॉक किया जाता है, दूसरा सामने आ जाता है।
यह पेपर इस विचार का भी खंडन करता है कि आप केवल "बुरे शब्दों" की एक निश्चित सूची बनाकर उन्हें फ़िल्टर कर सकते हैं। क्योंकि प्रदूषण बहुत तेज़ी से बदलता है और अक्सर चालाकी भरे, संक्षिप्त या मिश्रित शब्दों का उपयोग करता है (जैसे कि एक जुए के शब्द को बनाने के लिए दो सामान्य शब्दों को मिलाना), एक स्थिर सूची जल्दी ही बेकार हो जाएगी। इसके बजाय, लेखक सुझाव देते हैं कि हमें वेब का नियमित रूप से ऑडिट करना जारी रखना चाहिए, जैसा कि उन्होंने किया। दूसरों की मदद करने के लिए, उन्होंने 6,30,000 से अधिक रिकॉर्ड वाला एक विशाल नया डेटासेट जारी किया है, जो इन प्रदूषित टोकनों को "वृक्षों" (trees) के रूप में व्यवस्थित करता है जो दिखाते हैं कि कैसे छोटे, बुरे शब्द लंबे, अधिक जटिल बुरे वाक्यांशों में विकसित होते हैं।
संक्षेप में, यह पेपर साबित करता है कि यह जानने के लिए कि समुद्र गंदा है, आपको पूरा समुद्र पढ़ने की आवश्यकता नहीं है; एक स्मार्ट, छोटा नमूना एक स्पष्ट तस्वीर पाने के लिए पर्याप्त है। उन्होंने दिखाया कि चीनी वेब वर्तमान में एआई प्रशिक्षण के लिए एक बहुत ही प्रदूषित स्थान है, और प्रदूषण तेजी से बदलता और विकसित होता रहता है। उनका नया टूल, SAMPLED-BPE, इन विशाल डेटासेट्स की जांच महीनों के बजाय घंटों में करना संभव बनाता है, जिससे शोधकर्ताओं को इंटरनेट के विशाल आकार से अभिभूत हुए बिना अपने एआई मॉडल्स को साफ रखने का एक तरीका मिलता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।