← Nieuwste papers
💬 NLP

Index SLM Technical Report

Bilibili introduceert Index-1.9B, een serie open kleine taalmodellen met een 1,9 miljard parameters tellend fundament getraind op 2,8 biljoen tokens met een gespecialiseerd Warmup-Stable-Decay-schema en een Norm-Head-laag, die competitieve prestaties behaalt op standaard benchmarks en varianten bevat voor pure pre-training, chat-alignment en karaktergebaseerd rollenspel.

Oorspronkelijke auteurs: Lusheng Zhang, Shien He, Tianxing Yan, Mengran Yu, Ziang Cui, Kai Zhao, Xiaojing Liu, Tianjiao Li

Gepubliceerd 2026-07-14
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Lusheng Zhang, Shien He, Tianxing Yan, Mengran Yu, Ziang Cui, Kai Zhao, Xiaojing Liu, Tianjiao Li

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een piepklein, superintelligent robotbrein bouwt dat in je broekzak past. De meeste mensen denken dat grotere hersenen altijd beter zijn, maar een team bij Bilibili besloot te kijken of ze een robot met 1,9 miljard parameters (laten we hem Index-1.9B noemen) konden maken die veel zwaarder meebolt dan zijn gewichtklasse doet vermoeden. Ze hebben niet simpelweg een gigantisch model gekrompen; ze hebben de motor vanaf de grond af aan opnieuw opgebouwd met behulp van 2,8 biljoen woorden aan leesmateriaal, voornamelijk in het Chinees en Engels.

Dit is het verhaal van hoe ze het deden, wat ze ontdekten en de vreemde verrassingen die ze onderweg tegenkwamen.

Het Geheime Recept: Hoe ze het Brein trainden

1. De Leeslijst (Data)
Beschouw de trainingsdata als de bibliotheek van de robot. Ze hebben niet zomaar het hele internet erin gedumpt. Ze hebben het opgeruimd zoals een bibliothecaris een rommelige zolder organiseert. Ze verwijderden duplicaten (ze vonden zelfs een menu met maandnamen dat per ongeluk 156.000 keer was gekopieerd!) en filterden vooroordelen eruit.

  • De Mix: De bibliotheek bestaat voornamelijk uit boeken en webpagina's, maar ze hebben ervoor gezorgd om 6% code en 10% hoogwaardige zaken zoals academische papers en encyclopedieën toe te voegen.
  • De Verrassing: Ze ontdekten dat het lezen van "instructiehandleidingen" (zoals "Schrijf een gedicht" of "Los dit wiskundeprobleem op") tijdens de laatste fase van de training de robot veel slimmer deed lijken op tests. Sterker nog, het toevoegen van slechts 7% van deze instructiedata verhoogde de testscores met ongeveer 7 punten. Ze brachten zelfs twee versies van de robot uit—één met deze extra leesstof en één zonder—zodat iedereen precies kon zien hoeveel het hielp.

2. De Breinstructuur (Architectuur)
Normaal gesproken, wanneer je een vaste hoeveelheid "hersencapaciteit" (parameters) hebt, kun je het brein breed maken (veel neuronen in één laag) of diep (veel lagen op elkaar gestapeld).

  • De Bevinding: Het team probeerde een "diep en smal" ontwerp (36 lagen) versus een "breed en ondiep" ontwerp (9 lagen). De diepe versie won elke keer. Het is alsof je een wolkenkrabber bouwt in plaats van een brede, platte loods; voor deze omvang werkte omhoog gaan beter dan naar buiten gaan.
  • De Stabilisator: Ze voegden ook een speciale "Norm-Head"-laag toe. Stel je voor dat de robot een beetje duizelig wordt wanneer hij probeert het volgende woord te raden omdat sommige woorden zeldzaam zijn. Deze nieuwe laag werkt als een stabilisator, die het brein kalm houdt, zelfs wanneer de robot razendsnel leert.

3. Het Leerschema (De "WSD"-methode)
De meeste robots leren in een constant tempo of vertragen geleidelijk. Index-1.9B gebruikt een "Warmup–Stable–Decay" (WSD) schema.

  • De Strategie: Eerst warmt het op. Daarna leert het op een constante, hoge snelheid (de "Stable"-fase) terwijl het de hele bibliotheek leest. Ten slotte, in de "Decay"-fase, vertraagt het maar schakelt het over naar het lezen van alleen de beste, meest gecureerde boeken (de academische papers en encyclopedieën).
  • Het Resultaat: Deze combinatie van vertragen terwijl het hoogwaardige data leest, gaf het de grootste boost in prestaties.

De Vreemde Verrassing: De "Surge"

Dit is het deel dat zelfs de auteurs nog niet volledig kunnen verklaren.
Tijdens de "Stable"-fase, toen de robot op een constante snelheid las, gebeurde er iets vreemds. Tussen de 1,0 en 1,2 biljoen tokens van het lezen, schoten de testscores van de robot plotseling omhoog. Het ging van gemiddeld naar het overtreffen van een aantal 7B-modellen, zonder dat de leersnelheid of het type data veranderde.

  • De Zekerheid: Het paper geeft toe dat dit een mysterie is. Ze suggereren dat misschien de hoogwaardige data in combinatie met de snelle leersnelheid op dat moment precies goed klikte, maar ze hebben niet bewezen waarom precies. Het is alsof een student plotseling alles begrijpt na het lezen van een specifiek hoofdstuk, ook al heeft de leraar de les niet veranderd.

De Verschillende Versies van de Robot

Het team stopte niet bij één model. Ze brachten een hele familie uit:

  • Index-1.9B-Base: Het ruwe, slimme brein, klaar voor alles.
  • Index-1.9B-Pure: Een controleversie die nooit instructiehandleidingen heeft gelezen. Dit bewijst dat de "slimme" scores van het hoofdmodel echt voortkomen uit dat extra lezen.
  • Index-1.9B-Chat: Het Base-model dat geleerd heeft om prettig met mensen te praten, met behulp van een techniek genaamd "Direct Preference Optimization" (DPO). Dit is alsof je de robot niet alleen leert om te antwoorden, maar om goed te antwoorden door het voorbeelden te tonen van goede versus slechte gesprekken.
  • Index-1.9B-Character: Een versie die rollenspellen kan doen. Het gebruikt een "retrieval"-truc, waarbij het eerdere gesprekken met een specifief personage opzoekt om in zijn rol te blijven. Het is zo goed in dit dat het hoger scoort dan veel veel grotere modellen op rollenspel-tests.

Wat het Kan (en Niet Kan)

De Winsten:

  • Slimheid: Op standaardtests voor wiskunde, redeneren en algemene kennis scoort Index-1.9B gemiddeld 64,92. Dit is competitief met, en verslaat soms, modellen die vele malen groter zijn. Specifiek overtreft het het Llama-2-13B-model op de gemiddelde score, hoewel het niet elke benchmark tegenover elke grotere model wint.
  • Taal: Het is geweldig in Chinees en Engels. Daarnaast bereikt de tokenizer die ze voor het model hebben gebouwd de sterkste compressieratio's voor Japans en Koreaans onder de tokenizers die ze vergeleken, wat het efficiënt maakt voor deze talen.
  • Rollenspel: Het kan personages uitspelen met een hoge consistentie en staat 9e op een belangrijke leaderboard, waarmee het veel 7B tot 14B modellen verslaat.

De Limieten:

  • Wiskunde en Code: Hoewel het behoorlijk is, geven de auteurs toe dat dit nog steeds gebieden zijn voor verbetering. Het is nog geen wiskundig genie.
  • Feiten: Omdat het klein is, kan het nog steeds feiten verzinnen of complexe instructies verkeerd begrijpen.
  • Het Mysterie: Die plotselinge prestatieverbetering tijdens de training? Ze weten nog steeds niet precies waarom het gebeurde.

De Kern van het Verhaal

Het paper laat zien dat je geen massief, duur brein nodig hebt om slim te zijn. Als je een kleine robot de juiste mix van hoogwaardige boeken voert, hem leert om diep in plaats van breed te lezen, en een speciale stabilisator voor zijn brein geeft, kan hij concurreren met reuzen. Ze bewezen ook dat "instructiedata" (leren hoe je bevelen opvolgt) een enorme cheatcode is voor testscores, en ze brachten het bewijs vrij zodat niemand de feiten kan verbergen.

Het is een klein model met een grote persoonlijkheid, een paar open vragen en een heleboel potentieel.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →