GPT-NL Public Corpus: A Permissively Licensed, Dutch-First Dataset for LLM Pre-training
यह शोध पत्र GPT-NL पब्लिक कॉर्पस का परिचय देता है, जो कि 36 बिलियन अद्वितीय डच टोकन के साथ-साथ क्यूरेटेड अंग्रेजी, कोड और जर्मन/डेनिश डेटा वाला एक उदार लाइसेंस प्राप्त डेटासेट है, जिसे वैध और उपयोगी वाणिज्यिक भाषा मॉडल के विकास को सुगम बनाने के लिए डिज़ाइन किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन बहुत छोटे बच्चे (एक आर्टिफिशियल इंटेलिजेंस) को डच बोलना, सोचना और लिखना सिखाना चाहते हैं। इसके लिए, आपको उन्हें किताबें, समाचार पत्र और बातचीत की एक विशाल लाइब्रेरी देनी होगी ताकि वे पढ़ सकें।
हालाँकि, इसमें एक पेच है: आप शेल्फ से कोई भी किताब उठाकर नहीं ले सकते। आपको यह सुनिश्चित करना होगा कि आपके पास उसकी फोटोकॉपी करने का कानूनी अधिकार है, और आप बच्चे को नफरत भरे भाषण, झूठ या भ्रमित करने वाले बकवास से भरी किताबें नहीं देना चाहते।
यह पेपर इस कहानी के बारे में है कि कैसे नीदरलैंड की एक टीम ने एक विशेष, सुपर-लीगल और सुपर-क्लीन लाइब्रेरी बनाई, जिसे GPT-NL पब्लिक कॉर्पस कहा जाता है, विशेष रूप से AI को डच बोलना सिखाने के लिए।
यहाँ उनके प्रोजेक्ट का सरल उपमाओं (analogies) के माध्यम से विवरण दिया गया है:
1. समस्या: "खाली बुकशेल्फ़"
लंबे समय तक, यदि आप किसी AI को अंग्रेजी बोलने के लिए प्रशिक्षित करना चाहते थे, तो आप इंटरनेट का पूरा हिस्सा उसके दिमाग में डाल सकते थे। लेकिन डच के लिए? "बुकशेल्फ़" या तो खाली थी, या किताबें पेवॉल (paywalls) के पीछे बंद थीं, या उन्हें व्यावसायिक AI के लिए उपयोग करना अवैध था।
इस कारण से, डच बोलने वालों को उन "बहुभाषी" (multilingual) AI पर निर्भर रहना पड़ा जो मुख्य रूप से अंग्रेजी पर प्रशिक्षित थे। यह पियानो सीखने के लिए केवल एक वायलिन वादक को सुनने जैसा है; आप संगीत तो सीख जाते हैं, लेकिन तकनीक गलत हो जाती है।
2. समाधान: "GPT-NL पब्लिक कॉर्पस"
टीम ने एक नई लाइब्रेरी बनाई। यह केवल यादृच्छिक वेब पेजों का ढेर नहीं है; यह 21 विशिष्ट डच-भाषा संग्रहों का एक क्यूरेटेड कलेक्शन है।
- आकार: इसमें लगभग 36 बिलियन शब्द (टोकन) शुद्ध डच हैं जो पहले किसी अन्य AI ने नहीं देखे हैं।
- बोनस: उन्होंने इसमें कुछ अंग्रेजी, जर्मन, डेनिश और कोड (प्रोग्रामिंग भाषा) भी जोड़ा ताकि AI बेहतर तरीके से सीख सके, ठीक वैसे ही जैसे एक बच्चा अन्य भाषाओं को सुनने से बेहतर सीखता है।
3. तीन स्वर्णिम नियम (द "सेफ्टी फिल्टर्स")
इस लाइब्रेरी में प्रवेश करने से पहले, हर किताब को तीन सख्त परीक्षणों से गुजरना था:
- नियम #1: क्या यह उपयोगी है?
- उपमा: हम नहीं चाहते कि AI रैंडम स्पैम ईमेल या बकवास को याद करे। हम चाहते हैं कि यह तथ्य, तर्क और स्पष्ट संचार सीखे। उन्होंने ऐसे डेटा पर ध्यान केंद्रित किया जो AI को एक सहायक असिस्टेंट बनाने में मदद करे, न कि एक भ्रमित करने वाला सपने देखने वाला।
- नियम #2: क्या यह कानूनी है?
- उपमा: कल्पना कीजिए कि घर पर "अनाधिकृत प्रवेश निषेध" (No Trespassing) का बोर्ड लगा है। टीम ने केवल वही किताबें चुनीं जहाँ मालिक ने कहा, "हाँ, आप इसकी कॉपी कर सकते हैं!" (क्रिएटिव कॉमन्स लाइसेंस)। उन्होंने उन किताबों से परहेज किया जिन पर "व्यावसायिक उपयोग नहीं" या "व्युत्पन्न कार्य नहीं" (No Derivatives) के संकेत थे। वे एक ऐसी लाइब्रेरी बनाना चाहते थे जिसे कोई भी, यहाँ तक कि एक व्यवसाय भी, कानूनी रूप से उपयोग कर सके।
- नियम #3: क्या यह सुरक्षित है?
- उपमा: यदि आप एक बच्चे को बुलीइंग या नफरत भरे भाषण वाली किताब देते हैं, तो वह वैसा ही व्यवहार करने लग सकता है। टीम ने विषाक्त सामग्री (toxic content), पूर्वाग्रह और अपमानजनक भाषा को हटा दिया। वे चाहते थे कि AI विनम्र और सहायक हो।
4. उन्होंने शेल्फ कैसे भरे (स्रोत)
चूंकि वे पूरे इंटरनेट को खुरच (scrape) नहीं सकते थे, इसलिए उन्हें रचनात्मक होना पड़ा:
- "समय यात्री" (अभिलेखागार/Archives): उन्होंने पुराने किताबों और समाचार पत्रों (100 साल से अधिक पुराने) को डिजिटल बनाने के लिए डच अभिलेखागारों के साथ साझेदारी की। चूंकि ये बहुत पुराने हैं, इसलिए ये "पब्लिक डोमेन" में हैं (सभी के उपयोग के लिए मुफ्त)।
- "सरकारी मित्र": उन्होंने आधिकारिक दस्तावेजों, अदालती फैसलों और संसदीय रिकॉर्ड प्राप्त करने के लिए डच सरकार के साथ काम किया। ये आमतौर पर सार्वजनिक होते हैं, लेकिन एक साफ प्रारूप में मिलना कठिन होता है।
- "सिंथेटिक बिल्डर्स" (केवल टाइप 1 के लिए): उन्होंने केवल AI से नई कहानियाँ "बनाने" के लिए नहीं कहा (जो कि फर्जी हो सकती हैं)। इसके बजाय, उन्होंने तथ्य डेटाबेस (जैसे Wikidata) लिए और एक स्मार्ट स्क्रिप्ट का उपयोग करके उन्हें पठनीय वाक्यों में बदल दिया। यह एक स्प्रेडशीट जैसे "नाम: विलेम-अलेक्जेंडर, पद: राजा" को वाक्य में बदलने जैसा है: "विलेम-अलेक्जेंडर राजा हैं।"
- "अनुवादक" (YouTube): उन्होंने अंग्रेजी और स्पेनिश YouTube ट्रांसक्रिप्ट्स को लिया, उन्हें साफ किया, और उन्हें डच में बदलने के लिए एक अनुवाद टूल का उपयोग किया। इससे AI को यह सुनने का मौका मिला कि वास्तविक लोग कैसे बोलते हैं।
- "वेब स्वीपर" (C5): उन्होंने वेब को स्कैन करने के लिए एक विशेष टूल का उपयोग किया, लेकिन केवल उन पेजों के लिए जिन्होंने स्पष्ट रूप से कहा, "यह सामग्री उपयोग के लिए मुफ्त है।" वे कानूनी अधिकारों के बारे में 100% सुनिश्चित होने के लिए बाकी सब कुछ छानकर अलग कर दिए।
5. गुणवत्ता नियंत्रण (लाइब्रेरियन का निरीक्षण)
शेल्फ पर जाने से पहले, मानव पुस्तकालibrarians (डेटा क्यूरेटर) की एक टीम ने अंतिम जांच की।
- उन्होंने यह देखने के लिए नमूने देखे कि डच स्वाभाविक लग रही है या नहीं।
- उन्होंने व्यक्तिगत रहस्यों (जैसे फोन नंबर या पते) की जांच की और उन्हें हटा दिया।
- उन्होंने प्रत्येक पुस्तक के "जोखिम" को रेट किया। यदि किसी पुस्तक में थोड़ा सा पूर्वाग्रह था, तो वे सुरक्षा के लिए प्रशिक्षण के दौरान उसका कम उपयोग कर सकते थे।
6. यह क्यों महत्वपूर्ण है
यह पेपर केवल एक डेटासेट के बारे में नहीं है; यह निष्पक्षता और सुरक्षा के बारे में है।
- शोधकर्ताओं के लिए: यह उन्हें बिना मुकदमे के डर के बेहतर डच AI बनाने के लिए एक साफ, कानूनी शुरुआती बिंदु देता है।
- जनता के लिए: यह सुनिश्चित करता है कि भविष्य में हमारे द्वारा उपयोग किए जाने वाले AI उपकरण डच संस्कृति, कानूनों और भाषा को बेहतर ढंग से समझें, बिना खराब डेटा या अवैध सामग्री से दूषित हुए।
संक्षेप में: GPT-NL टीम ने केवल एक पूल में पानी की बाल्टी नहीं डाली। उन्होंने विशेष रूप से डच बोलने वाले AI के लिए एक फिल्टर्ड, कानूनी और उच्च गुणवत्ता वाला स्विमिंग पूल बनाया, यह सुनिश्चित करते हुए कि यह गोता लगाने के लिए सभी के लिए सुरक्षित है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।