GPT-NL Public Corpus: A Permissively Licensed, Dutch-First Dataset for LLM Pre-training
Dit artikel introduceert de GPT-NL Public Corpus, het grootste permissief gelicentieerde dataset voor het vooraf trainen van taalmodellen, dat zich primair richt op 36 miljard unieke Nederlandse tokens aangevuld met grote hoeveelheden Engels, code en andere talen, allemaal beschikbaar onder een CC-BY-licentie.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een enorme, slimme robot wilt bouwen die de Nederlandse taal perfect begrijpt en spreekt. Om dit te doen, moet je de robot laten lezen, lezen, lezen. Maar hier zit een probleem: je kunt niet zomaar alles van het internet kopiëren. Net als bij een bibliotheek, zijn er auteursrechten, privacyregels en regels over wat je mag doen met de boeken die je leent.
Dit paper introduceert de GPT-NL Public Corpus. Laten we dit uitleggen alsof we een gigantische, legale kookpartij voor een nieuwe chef-kok (de AI) organiseren.
1. Het Probleem: De "Grijze" Keuken
Vroeger was het makkelijk: je nam gewoon een emmer vol met internetteksten (zoals Common Crawl) en goot die in de mix. Maar dat is als het eten van onbekende bessen uit het bos. Het kan lekker zijn, maar het kan ook giftig zijn (fouten, haatzaaiende teksten) of illegaal (je mag het niet verkopen). Voor de Nederlandse taal was het zelfs erger: er was gewoon te weinig goed, veilig en legaal "voedsel" beschikbaar.
2. De Oplossing: De GPT-NL "Supermarkt"
De auteurs van dit paper hebben een enorme, legale supermarkt samengesteld. Dit is de GPT-NL Public Corpus.
- Het is een gigantisch buffet: Het bevat 36 miljard woorden puur in het Nederlands. Dat is meer dan wat er in andere datasets voor het Nederlands te vinden is.
- Het is 100% veilig: Alles in deze supermarkt heeft een duidelijk etiket. Niets is gestolen. Alles mag gebruikt worden, zelfs door bedrijven die er geld mee willen verdienen (dit heet een "permissieve licentie").
- Het is vers en gevarieerd: Naast het Nederlands, is er ook Engels, Duits, Deens en zelfs wat Fries toegevoegd. Waarom? Omdat een robot die Nederlands leert, ook wat Duits en Engels kan helpen om de grammatica beter te snappen (net als dat je beter Italiaans leert als je al Frans spreekt).
3. Hoe hebben ze dit gemaakt? (De Drie Regels)
Om in deze supermarkt te komen, moesten alle producten drie strenge regels doorstaan:
- Is het nuttig? (De "Geest" van de robot)
De robot moet niet alleen maar hallucineren (dromen van dingen die niet waar zijn). Daarom hebben ze gekozen voor feitelijke, betrouwbare bronnen. Denk aan overheidsdocumenten, oude boeken uit musea, en juridische uitspraken. Geen forumberichten van kwaadwillende mensen, maar serieuze teksten. - Is het legaal? (De "Rechter" van de robot)
Dit is het strengste deel. Ze hebben gekeken naar de auteursrechten.- Geen Wikipedia: Wikipedia is geweldig, maar je mag het niet zomaar gebruiken voor commerciële robots (vanwege de licentie). Dus die hebben ze eruit gelaten.
- Wel oude boeken: Alles wat ouder is dan 100 jaar is vaak "publiek domein" (ieders eigendom). Die hebben ze gedigitaliseerd.
- Wel toestemming: Ze hebben samen gewerkt met bibliotheken en overheidsinstanties om expliciete toestemming te krijgen om hun data te gebruiken.
- Is het veilig? (De "Bewaker" van de robot)
Ze hebben gekeken of er geen haatzaaiende teksten, racistische opmerkingen of privé-informatie in zaten. Ze hebben de data schoongeveegd, alsof je groenten wast voordat je ze kookt.
4. De Speciale Ingrediënten
Naast het "gewone" eten uit de supermarkt, hebben ze ook zelf nieuwe gerechten bedacht:
- De "Vertaler": Ze hebben YouTube-video's in het Engels en Spaans genomen en die door een slimme machine laten vertalen naar het Nederlands. Zo hebben ze veel spreektaal in het Nederlands.
- De "Feitenfabriek": Ze hebben een enorme database met feiten (Wikidata) genomen en die omgezet in lopende zinnen. Stel je voor: een lijstje met "Willem-Alexander is Koning" wordt omgezet in een verhaal dat de robot kan lezen.
- De "Netwerk-Filter": Ze hebben een nieuw gereedschap gebouwd om te kijken welke websites op het internet een "groen licht" (een legale licentie) hebben. Ze hebben alleen die stukken internet geselecteerd.
5. Waarom is dit belangrijk?
Stel je voor dat je een auto wilt bouwen, maar je hebt alleen slechte, roestige onderdelen. De auto rijdt niet goed en is gevaarlijk.
Voor Nederlandse AI-modellen was het zo: we moesten gebruikmaken van Amerikaanse modellen die Nederlands maar "een beetje" konden, omdat er geen goede Nederlandse onderdelen waren.
Met de GPT-NL Public Corpus hebben we nu een volledige, nieuwe, schone set onderdelen in het Nederlands.
- Bedrijven kunnen er hun eigen slimme assistenten mee bouwen zonder bang te zijn voor rechtszaken.
- Onderzoekers kunnen er mee experimenteren.
- De robot die hieruit komt, zal Nederlands niet alleen spreken, maar het ook begrijpen op een manier die past bij onze cultuur en wetten.
Kortom: Dit paper is het recept en de lijst met ingrediënten voor de meest uitgebreide, legale en veilige "voorraadkast" voor Nederlandse AI die er ooit is gemaakt. Het zorgt ervoor dat de Nederlandse taal in de toekomst niet meer de "stiefkind" is van de AI-wereld, maar een volwaardige speler.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.