Common Corpus: The Largest Collection of Ethical Data for LLM Pre-Training
Dit paper introduceert Common Corpus, de grootste open dataset voor het vooraf trainen van grote taalmodellen, die ongeveer twee biljoen tokens bevat van niet-geschreven of open gelicenseerde bronnen in diverse talen en domeinen om juridische risico's te vermijden en open wetenschap te ondersteunen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een enorme, slimme robot wilt bouwen die alles kan begrijpen en spreken. Om dit te doen, moet je de robot laten lezen, lezen, lezen. Maar hier zit een probleem: de meeste boeken, kranten en websites die we online vinden, zijn eigendom van iemand anders. Ze hebben een slotje erop (copyright). Als je die robot met die boeken voedt, kun je in de problemen komen met de wet, zoals een dief die een winkel binnenloopt om eten te stelen.
Dit is precies waar dit nieuwe onderzoek over gaat. De auteurs hebben een gigantische verzameling boeken en teksten bij elkaar gebracht die geen slotjes hebben. Ze noemen dit "Common Corpus".
Hier is de uitleg in simpele taal, met een paar creatieve vergelijkingen:
1. Het Probleem: De "Gestolen" Bibliotheek
Tot nu toe hebben de slimste robots (zoals GPT-4 of Llama) geleerd van een enorme hoop internettekst. Maar veel van die tekst is eigendom van auteurs, kranten of bedrijven.
- De Analogie: Stel je voor dat je een chef-kok bent die een receptenboek wil schrijven. Je loopt de hele stad rond en kopieert de recepten van andere restaurants. Je maakt een geweldig boek, maar de eigenaren van die restaurants kunnen je aanklagen omdat je hun intellectuele eigendom hebt gestolen.
- Het gevolg: Veel bedrijven durven hun robots niet meer te openen voor onderzoek, en juridische gevechten blokkeren de vooruitgang.
2. De Oplossing: De "Openbare Bibliotheek"
De auteurs van dit papier hebben een nieuwe verzameling gemaakt: Common Corpus.
- De Analogie: In plaats van recepten te stelen van restaurants, gaan ze naar de openbare bibliotheek en de gemeentelijke archieven. Ze halen alleen de boeken op die al publiek eigendom zijn (waar de auteurs al lang dood zijn en de auteursrechten verlopen) of boeken die de auteurs zelf gratis hebben vrijgegeven (zoals open source software).
- De grootte: Het is een enorme verzameling: ongeveer 2 biljoen woorden (tokens). Dat is alsof je alle boeken in een kleine stad in één stapel zet.
3. Wat zit er in de verzameling?
Het is niet zomaar een hoop tekst. Het is een zorgvuldig samengestelde "buffet" met zes verschillende hoofdgerechten:
- Overheid (Open Government): Wetten, financiële rapporten en officiële documenten.
- Cultuur (Open Culture): Oude boeken, kranten en verhalen uit de geschiedenis (soms uit de 18e eeuw!). Dit geeft de robot een gevoel voor geschiedenis en creativiteit.
- Wetenschap (Open Science): Artikelen en onderzoeken.
- Code (Open Code): Programmeertaal. Dit helpt de robot om te begrijpen hoe computers werken.
- Web (Open Web): Wikipedia en andere betrouwbare websites.
- Semantiek (Open Semantic): Feiten en data, zoals een gigantische encyclopedie.
Het unieke punt: De meeste andere grote verzamelingen zijn alleen in het Engels. Deze verzameling is meertalig. Je vindt er veel Frans, Duits, Spaans, maar ook minder bekende talen. Het is alsof je een wereldreis maakt in plaats van alleen naar de VS te gaan.
4. De "Schoonmaak" (Curation)
Omdat ze oude kranten en gescande boeken gebruiken, zit er vaak "vuil" in. Denk aan vlekken, slechte letters of fouten die de scanner heeft gemaakt.
- De Analogie: Stel je voor dat je een oude, stoffige kelder opruimt. Je moet de stof van de boeken halen, de beschadigde pagina's repareren en zorgen dat er geen gifmuis in de hoek zit (schadelijke of haatdragende teksten).
- De auteurs hebben speciale AI-tools gebouwd om dit vuil te verwijderen en de tekst schoon te maken, zodat de robot alleen de beste, veiligste informatie krijgt.
5. Het Resultaat: Een eerlijke test
Ze hebben twee kleine robots getraind met deze schone, legale verzameling.
- Het resultaat: Deze robots presteerden net zo goed als robots die zijn getraind op de "gestolen" verzamelingen.
- De boodschap: Je hoeft geen wetten te overtreden om een slimme robot te maken. Je kunt net zo goed (of zelfs beter) werken met een verzameling die voor iedereen open en legaal is.
Conclusie
Dit papier is als een bouwpakket voor een eerlijke toekomst. Het laat zien dat we een wereld kunnen bouwen waar kunstmatige intelligentie niet gebaseerd is op diefstal, maar op samenwerking en open kennis. Het is een uitnodiging aan iedereen: "Kijk, hier is de grondstof, bouw iets moois mee, en doe het op een eerlijke manier."
Kortom: Common Corpus is de grootste, schoonste en meest legale bibliotheek ter wereld voor het trainen van slimme computers, zodat we allemaal veilig kunnen leren van de kennis van de mensheid.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.