← नवीनतम पेपर
💬 NLP

GPT-NL Public Corpus: A Permissively Licensed, Dutch-First Dataset for LLM Pre-training

यह शोध पत्र GPT-NL पब्लिक कॉर्पस का परिचय देता है, जो कि 36 बिलियन अद्वितीय डच टोकन के साथ-साथ क्यूरेटेड अंग्रेजी, कोड और जर्मन/डेनिश डेटा वाला एक उदार लाइसेंस प्राप्त डेटासेट है, जिसे वैध और उपयोगी वाणिज्यिक भाषा मॉडल के विकास को सुगम बनाने के लिए डिज़ाइन किया गया है।

मूल लेखक: Jesse van Oort, Frank Brinkkemper, Erik de Graaf, Bram Vanroy, Saskia Lensink

प्रकाशित 2026-04-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jesse van Oort, Frank Brinkkemper, Erik de Graaf, Bram Vanroy, Saskia Lensink

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन बहुत छोटे बच्चे (एक आर्टिफिशियल इंटेलिजेंस) को डच बोलना, सोचना और लिखना सिखाना चाहते हैं। इसके लिए, आपको उन्हें किताबें, समाचार पत्र और बातचीत की एक विशाल लाइब्रेरी देनी होगी ताकि वे पढ़ सकें।

हालाँकि, इसमें एक पेच है: आप शेल्फ से कोई भी किताब उठाकर नहीं ले सकते। आपको यह सुनिश्चित करना होगा कि आपके पास उसकी फोटोकॉपी करने का कानूनी अधिकार है, और आप बच्चे को नफरत भरे भाषण, झूठ या भ्रमित करने वाले बकवास से भरी किताबें नहीं देना चाहते।

यह पेपर इस कहानी के बारे में है कि कैसे नीदरलैंड की एक टीम ने एक विशेष, सुपर-लीगल और सुपर-क्लीन लाइब्रेरी बनाई, जिसे GPT-NL पब्लिक कॉर्पस कहा जाता है, विशेष रूप से AI को डच बोलना सिखाने के लिए।

यहाँ उनके प्रोजेक्ट का सरल उपमाओं (analogies) के माध्यम से विवरण दिया गया है:

1. समस्या: "खाली बुकशेल्फ़"

लंबे समय तक, यदि आप किसी AI को अंग्रेजी बोलने के लिए प्रशिक्षित करना चाहते थे, तो आप इंटरनेट का पूरा हिस्सा उसके दिमाग में डाल सकते थे। लेकिन डच के लिए? "बुकशेल्फ़" या तो खाली थी, या किताबें पेवॉल (paywalls) के पीछे बंद थीं, या उन्हें व्यावसायिक AI के लिए उपयोग करना अवैध था।

इस कारण से, डच बोलने वालों को उन "बहुभाषी" (multilingual) AI पर निर्भर रहना पड़ा जो मुख्य रूप से अंग्रेजी पर प्रशिक्षित थे। यह पियानो सीखने के लिए केवल एक वायलिन वादक को सुनने जैसा है; आप संगीत तो सीख जाते हैं, लेकिन तकनीक गलत हो जाती है।

2. समाधान: "GPT-NL पब्लिक कॉर्पस"

टीम ने एक नई लाइब्रेरी बनाई। यह केवल यादृच्छिक वेब पेजों का ढेर नहीं है; यह 21 विशिष्ट डच-भाषा संग्रहों का एक क्यूरेटेड कलेक्शन है।

  • आकार: इसमें लगभग 36 बिलियन शब्द (टोकन) शुद्ध डच हैं जो पहले किसी अन्य AI ने नहीं देखे हैं।
  • बोनस: उन्होंने इसमें कुछ अंग्रेजी, जर्मन, डेनिश और कोड (प्रोग्रामिंग भाषा) भी जोड़ा ताकि AI बेहतर तरीके से सीख सके, ठीक वैसे ही जैसे एक बच्चा अन्य भाषाओं को सुनने से बेहतर सीखता है।

3. तीन स्वर्णिम नियम (द "सेफ्टी फिल्टर्स")

इस लाइब्रेरी में प्रवेश करने से पहले, हर किताब को तीन सख्त परीक्षणों से गुजरना था:

  • नियम #1: क्या यह उपयोगी है?
    • उपमा: हम नहीं चाहते कि AI रैंडम स्पैम ईमेल या बकवास को याद करे। हम चाहते हैं कि यह तथ्य, तर्क और स्पष्ट संचार सीखे। उन्होंने ऐसे डेटा पर ध्यान केंद्रित किया जो AI को एक सहायक असिस्टेंट बनाने में मदद करे, न कि एक भ्रमित करने वाला सपने देखने वाला।
  • नियम #2: क्या यह कानूनी है?
    • उपमा: कल्पना कीजिए कि घर पर "अनाधिकृत प्रवेश निषेध" (No Trespassing) का बोर्ड लगा है। टीम ने केवल वही किताबें चुनीं जहाँ मालिक ने कहा, "हाँ, आप इसकी कॉपी कर सकते हैं!" (क्रिएटिव कॉमन्स लाइसेंस)। उन्होंने उन किताबों से परहेज किया जिन पर "व्यावसायिक उपयोग नहीं" या "व्युत्पन्न कार्य नहीं" (No Derivatives) के संकेत थे। वे एक ऐसी लाइब्रेरी बनाना चाहते थे जिसे कोई भी, यहाँ तक कि एक व्यवसाय भी, कानूनी रूप से उपयोग कर सके।
  • नियम #3: क्या यह सुरक्षित है?
    • उपमा: यदि आप एक बच्चे को बुलीइंग या नफरत भरे भाषण वाली किताब देते हैं, तो वह वैसा ही व्यवहार करने लग सकता है। टीम ने विषाक्त सामग्री (toxic content), पूर्वाग्रह और अपमानजनक भाषा को हटा दिया। वे चाहते थे कि AI विनम्र और सहायक हो।

4. उन्होंने शेल्फ कैसे भरे (स्रोत)

चूंकि वे पूरे इंटरनेट को खुरच (scrape) नहीं सकते थे, इसलिए उन्हें रचनात्मक होना पड़ा:

  • "समय यात्री" (अभिलेखागार/Archives): उन्होंने पुराने किताबों और समाचार पत्रों (100 साल से अधिक पुराने) को डिजिटल बनाने के लिए डच अभिलेखागारों के साथ साझेदारी की। चूंकि ये बहुत पुराने हैं, इसलिए ये "पब्लिक डोमेन" में हैं (सभी के उपयोग के लिए मुफ्त)।
  • "सरकारी मित्र": उन्होंने आधिकारिक दस्तावेजों, अदालती फैसलों और संसदीय रिकॉर्ड प्राप्त करने के लिए डच सरकार के साथ काम किया। ये आमतौर पर सार्वजनिक होते हैं, लेकिन एक साफ प्रारूप में मिलना कठिन होता है।
  • "सिंथेटिक बिल्डर्स" (केवल टाइप 1 के लिए): उन्होंने केवल AI से नई कहानियाँ "बनाने" के लिए नहीं कहा (जो कि फर्जी हो सकती हैं)। इसके बजाय, उन्होंने तथ्य डेटाबेस (जैसे Wikidata) लिए और एक स्मार्ट स्क्रिप्ट का उपयोग करके उन्हें पठनीय वाक्यों में बदल दिया। यह एक स्प्रेडशीट जैसे "नाम: विलेम-अलेक्जेंडर, पद: राजा" को वाक्य में बदलने जैसा है: "विलेम-अलेक्जेंडर राजा हैं।"
  • "अनुवादक" (YouTube): उन्होंने अंग्रेजी और स्पेनिश YouTube ट्रांसक्रिप्ट्स को लिया, उन्हें साफ किया, और उन्हें डच में बदलने के लिए एक अनुवाद टूल का उपयोग किया। इससे AI को यह सुनने का मौका मिला कि वास्तविक लोग कैसे बोलते हैं।
  • "वेब स्वीपर" (C5): उन्होंने वेब को स्कैन करने के लिए एक विशेष टूल का उपयोग किया, लेकिन केवल उन पेजों के लिए जिन्होंने स्पष्ट रूप से कहा, "यह सामग्री उपयोग के लिए मुफ्त है।" वे कानूनी अधिकारों के बारे में 100% सुनिश्चित होने के लिए बाकी सब कुछ छानकर अलग कर दिए।

5. गुणवत्ता नियंत्रण (लाइब्रेरियन का निरीक्षण)

शेल्फ पर जाने से पहले, मानव पुस्तकालibrarians (डेटा क्यूरेटर) की एक टीम ने अंतिम जांच की।

  • उन्होंने यह देखने के लिए नमूने देखे कि डच स्वाभाविक लग रही है या नहीं।
  • उन्होंने व्यक्तिगत रहस्यों (जैसे फोन नंबर या पते) की जांच की और उन्हें हटा दिया।
  • उन्होंने प्रत्येक पुस्तक के "जोखिम" को रेट किया। यदि किसी पुस्तक में थोड़ा सा पूर्वाग्रह था, तो वे सुरक्षा के लिए प्रशिक्षण के दौरान उसका कम उपयोग कर सकते थे।

6. यह क्यों महत्वपूर्ण है

यह पेपर केवल एक डेटासेट के बारे में नहीं है; यह निष्पक्षता और सुरक्षा के बारे में है।

  • शोधकर्ताओं के लिए: यह उन्हें बिना मुकदमे के डर के बेहतर डच AI बनाने के लिए एक साफ, कानूनी शुरुआती बिंदु देता है।
  • जनता के लिए: यह सुनिश्चित करता है कि भविष्य में हमारे द्वारा उपयोग किए जाने वाले AI उपकरण डच संस्कृति, कानूनों और भाषा को बेहतर ढंग से समझें, बिना खराब डेटा या अवैध सामग्री से दूषित हुए।

संक्षेप में: GPT-NL टीम ने केवल एक पूल में पानी की बाल्टी नहीं डाली। उन्होंने विशेष रूप से डच बोलने वाले AI के लिए एक फिल्टर्ड, कानूनी और उच्च गुणवत्ता वाला स्विमिंग पूल बनाया, यह सुनिश्चित करते हुए कि यह गोता लगाने के लिए सभी के लिए सुरक्षित है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →