← Nieuwste papers
🤖 AI

daVinci-LLM:Towards the Science of Pretraining

Het paper introduceert daVinci-LLM, een volledig open initiatief dat industriële rekenkracht combineert met academische vrijheid om door middel van het 'Data Darwinism'-framework en systematische ablatiestudies de wetenschap van pretraining te bevorderen en een gestructureerde methodologie voor dataverwerking en curriculumontwerp te bieden.

Oorspronkelijke auteurs: Yiwei Qin, Yixiu Liu, Tiantian Mi, Muhang Xie, Zhen Huang, Weiye Si, Pengrui Lu, Siyuan Feng, Xia Wu, Liming Liu, Ye Luo, Jinlong Hou, Qipeng Guo, Yu Qiao, Pengfei Liu

Gepubliceerd 2026-03-31
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yiwei Qin, Yixiu Liu, Tiantian Mi, Muhang Xie, Zhen Huang, Weiye Si, Pengrui Lu, Siyuan Feng, Xia Wu, Liming Liu, Ye Luo, Jinlong Hou, Qipeng Guo, Yu Qiao, Pengfei Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat het bouwen van een kunstmatige intelligentie (AI) als het opvoeden van een superintelligent kind is. Tot nu toe hebben twee groepen mensen geprobeerd dit te doen, maar beide hadden een groot probleem:

  1. De grote tech-bedrijven (zoals OpenAI of Google) hebben de geld en de kracht om een kind te laten studeren aan de beste universiteit ter wereld, maar ze houden de lesboeken en de lesmethoden geheim. Ze zeggen: "Kijk, het kind kan dit doen," maar ze vertellen niet hoe ze het hebben leren doen.
  2. De academici (universiteiten) hebben de vrijheid om te experimenteren en alles openbaar te maken, maar ze hebben geen geld voor de dure "universiteit". Hun kinderen leren op een kleine schooltje, terwijl de anderen op een gigantisch complex studeren.

daVinci-LLM is een nieuw project dat precies in het midden zit. Het is alsof een rijke mecenas een groep onderzoekers heeft samengebracht die alle middelen hebben én alle vrijheid om te praten. Ze hebben een model getraind dat slechts 3 miljard "neuronen" (parameters) heeft, maar door slimme methoden presteert het net zo goed als modellen die twee keer zo groot zijn.

Hier is hoe ze dat deden, vertaald naar alledaagse taal:

1. De "Darwin-Data" Methode: Van Schroot naar Kunstwerk

Stel je voor dat je een enorme berg oud, vuil papier hebt (het internet). Je kunt dit papier gewoon in een machine gooien, maar dan krijg je rommel.
De onderzoekers gebruiken een 10-staps proces (het Darwinisme) om dit papier te verwerken:

  • Stap 1-3 (De schroothoop): Ze halen het vuil weg, sorteren op taal en gooien de onzin eruit.
  • Stap 4 (De restaurator): Ze nemen de interessante stukken en maken ze leesbaar. Ze halen de ruis weg, maar veranderen de inhoud niet.
  • Stap 5 (De leraar): Dit is de magische stap. Ze nemen moeilijke teksten (zoals een wetenschappelijk artikel) en laten een slimme AI de tekst herschrijven zodat het makkelijker te begrijpen is voor het kind. Ze voegen uitleg toe, maken logische stappen expliciet en bouwen bruggen tussen wat het kind al weet en wat het moet leren.

De les: Het is niet belangrijk hoeveel papier je hebt, maar hoe goed je het hebt voorbereid. Een stapel perfect voorbereide, leerzame teksten is beter dan een berg rommel.

2. Het Leerplan: Eerst de basis, dan de top

Ze hebben het trainen van het model opgedeeld in twee duidelijke fases, net zoals een schoolplan:

  • Fase 1: De brede basis (6 biljoen woorden).
    Het model leert eerst over van alles en nog wat: verhalen, nieuws, simpele code. Het is als het kind dat naar de basisschool gaat en alles een beetje leert. Ze merken dat het model snel stopt met leren over "algemene kennis" (het leert snel genoeg), maar blijft groeien in "redeneren" (wiskunde en programmeren).
  • Fase 2: De specialistische training (2 biljoen woorden).
    Omdat het model in de eerste fase al veel weet, gooien ze nu de "zware" stof erin. Ze stoppen met simpele teksten en gaan werken met vraag-en-antwoordparen en complexe problemen.
    • De analogie: Stel je voor dat je een atleet eerst laat hardlopen op een vlakke weg (Fase 1). Zodra die fit is, zet je hem op een steile berg (Fase 2) met extra gewichten. Als je dat te vroeg doet, valt hij om. Als je het te laat doet, wordt hij niet sterker. Ze vonden het perfecte moment om de "berg" in te gaan.

3. De "Muziekmix" van Data

Een groot probleem bij het trainen van AI is: "Hoeveel code, hoeveel wiskunde en hoeveel verhalen moeten we mengen?"

  • Als je te veel van één ding doet (bijvoorbeeld alleen wiskunde), wordt het model een genie in wiskunde, maar vergeet het hoe je een normaal gesprek voert.
  • De onderzoekers deden 200+ experimenten om de perfecte "cocktail" te vinden. Ze ontdekten dat je eerst een balans moet houden (30% vraag/antwoord, 30% code, 30% wetenschap), en pas op het allerlaatste moment de "vraag-en-antwoord" dosis kunt verhogen naar 70%.
  • De analogie: Je kunt een taart niet maken door alleen suiker te gebruiken, ook niet als je heel veel suiker hebt. Je hebt eerst bloem, eieren en boter nodig (de basis). Pas als de taart in de oven zit, kun je de suiker erover strooien om hem zoet te maken.

4. Waarom is dit zo belangrijk?

Vroeger was het trainen van AI een soort "zwarte doos". Bedrijven deden het, en als het werkte, was het goed. Als het niet werkte, zeiden ze niets.
Met daVinci-LLM doen ze het tegenovergestelde:

  • Ze delen alles: de code, de data, de fouten die ze maakten, en de resultaten.
  • Ze zeggen: "Kijk, als je dit deed, werkte het niet. Als je dat deed, werkte het wel."
  • Ze bewijzen dat je niet per se een miljard euro nodig hebt om een topmodel te maken. Als je slim bent met je data en je strategie goed afstemt op hoe het model leert, kun je met een klein model (3B) presteren als een gigantisch model (7B).

Samenvattend

Deze paper is als een open kookboek van de beste chef-koks ter wereld. In plaats van alleen het eindgerecht te serveren, geven ze je het recept, vertellen ze welke ingrediënten ze hebben weggegooid, en uitleggen ze waarom ze de oven op een bepaalde temperatuur zetten.

Het boodschappenlijstje is: Kwaliteit van data > Aantal data.
En de boodschap aan de wereld is: Laten we stoppen met gissen en beginnen met wetenschap. Door alles openbaar te maken, kunnen anderen op hun schouders staan en nog betere AI's bouwen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →