HPLT 3.0: Very Large-Scale Multilingual Resources for LLMs and MT. Mono- and Bi-lingual Data, Multilingual Evaluation, and Pre-Trained Models
Dit paper presenteert HPLT 3.0, een initiatief dat zeer grote, open en hoogwaardige meertalige datasets (30 biljoen tokens), een open-source verwerkingspijplijn, uitgebreide evaluatiebenchmarks en vooraf getrainde modellen beschikbaar stelt voor bijna 200 talen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat het bouwen van een slimme computer (een "Large Language Model" of LLM) net zo is als het trainen van een super-intelligent kind. Om dit kind slimmer te maken dan wie dan ook, moet je het niet alleen boeken laten lezen, maar de hele wereldbibliotheek. En niet zomaar een bibliotheek, maar één met boeken in bijna elke taal die er bestaat.
Dit is precies wat het HPLT 3.0-project doet. Hier is een uitleg in gewoon Nederlands, met een paar creatieve vergelijkingen.
1. De Ruwe Olie: Het Internet als een Modderpoel
Het internet is als een gigantische, onverzorgde modderpoel. Er zit waardevolle informatie in, maar ook veel vuil, reclame, dubbele berichten en onzin.
- HPLT 3.0 is als een super-efficiënte olieraffinaderij. Ze nemen deze modderpoel (het internet) en filteren het tot een kristalheldere, hoogwaardige brandstof: 30 biljoen woorden (tokens) in bijna 200 talen.
- Ter vergelijking: Andere grote projecten (zoals die van Google of Meta) focussen vaak alleen op het "Engelse" deel van de wereld. HPLT 3.0 zorgt ervoor dat ook talen als Fins, Estisch, Basque en Oekraïens evenveel aandacht krijgen. Het is een democratisering van kennis: niet alleen de rijke talen krijgen een supercomputer, maar ook de kleinere.
2. De Schoonmaak: Van Rommel naar Kostbaarheden
Hoe halen ze de goede teksten uit de rommel? Ze gebruiken een geautomatiseerd wasproces:
- Het Filteren: Stel je voor dat je een berg schelpen op het strand hebt. Je wilt alleen de schitterende parels. HPLT gebruikt slimme software om te kijken: "Is dit een echte tekst of alleen maar reclame?" "Is dit in de juiste taal geschreven?" "Bevat dit gevaarlijke of ongewenste inhoud?"
- Het Dubbelwerk: Vaak staan dezelfde teksten op duizenden websites. HPLT veegt deze kopieën weg (zoals het opruimen van dubbele foto's op je telefoon), zodat het kind alleen unieke verhalen leert.
- De Kwaliteitscontrole: Ze geven elke tekst een score. Teksten die eruitzien als een goed geschreven krantenartikel krijgen een hoge score. Teksten die eruitzien als spam krijgen een lage score.
3. De Test: Is het Kind nu Slim?
Nadat ze de data hebben schoongemaakt, moeten ze testen of het echt werkt.
- De Examens: Ze hebben een reeks "examens" bedacht (benchmarks) voor 9 Europese talen. Dit zijn vragen over logica, wereldkennis en taalgevoel.
- De Vergelijking: Ze hebben een computermodel getraind met de oude, rommelige data en een met de nieuwe, schone HPLT 3.0 data. Het resultaat? Het model met de schone data scoort veel beter. Het is alsof je een student laat studeren uit een goed georganiseerd leerboek in plaats van uit een stapel krantenknipsels met krassen en vlekken.
4. De Resultaten: Een Gevarieerd Team
Het project heeft niet alleen de data geproduceerd, maar ook de "studenten" zelf getraind:
- Monolinguale Experts: Ze hebben bijna 60 speciale modellen getraind, elk gespecialiseerd in één taal. Denk aan een team van 60 verschillende experts, waarbij elke expert de diepste geheimen van zijn eigen taal kent.
- Vertalers: Ze hebben ook een enorme verzameling van teksten gemaakt die in twee talen naast elkaar staan (zoals een Nederlands-Engels woordenboek, maar dan met hele zinnen en documenten). Dit helpt om machines beter te laten vertalen.
- Synthetische Data: Voor talen waar heel weinig teksten op het internet staan, hebben ze slimme machines gebruikt om extra teksten te "verzinnen" (vertalen van goede Engelse teksten naar die kleine talen). Dit is alsof je een vertaler gebruikt om een boek in een taal te schrijven waar nog nooit een boek in is geschreven.
5. Waarom is dit belangrijk? (De Ethiek)
Het verzamelen van al deze data is een ethisch dilemma. Het internet is van iedereen, maar ook van niemand.
- Het Dilemma: Ze gebruiken teksten die online staan, maar ze proberen heel zorgvuldig om geen privé-informatie (zoals telefoonnummers) of illegale inhoud te gebruiken.
- De Oplossing: Ze maken alles gratis en openbaar beschikbaar. In plaats dat één groot bedrijf (zoals een tech-gigant) de sleutel tot de kennisbibliotheek in zijn kluis bewaart, geven ze de sleutel aan iedereen. Zo kan elke universiteit, elke onderzoeker en elke kleine startup meedoen aan de toekomst van slimme computers.
Samenvattend
HPLT 3.0 is een gigantisch project waarbij een groep Europese onderzoekers het internet heeft schoongeveegd, gesorteerd en verpakt in een enorme, gratis bibliotheek voor bijna elke taal ter wereld. Ze hebben bewezen dat als je computers leert met schone, gevarieerde data, ze niet alleen slimmer worden, maar ook eerlijker en inclusiever. Het is een stap richting een wereld waar slimme technologie voor iedereen beschikbaar is, niet alleen voor degenen die Engels spreken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.