← Nieuwste papers
💻 computer science

RightNow-Arabic-0.5B-Turbo: An Open Sub-1B Arabic Language Model via Vocabulary Injection and Edge-First Deployment

Dit artikel introduceert RightNow-Arabic-0.5B-Turbo, een open-source taalmodel met 518 miljoen parameters dat is gespecialiseerd in het Arabisch, is gebouwd op Qwen2.5-0.5B door middel van vocabulaire-injectie en uitgebreide fine-tuning, en dat state-of-the-art prestaties behaalt onder modellen met minder dan 1 miljard parameters terwijl het efficiënte implementatie op de rand mogelijk maakt door kwantisatie tot onder de 400 MB.

Oorspronkelijke auteurs: Jaber Jaber, Osama Jaber

Gepubliceerd 2026-05-29
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jaber Jaber, Osama Jaber

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een zeer slimme, meertalige robotassistent voor met de naam Qwen. Hij is klein en snel, past gemakkelijk op een laptop of zelfs op een telefoon, maar behandelt Arabisch als slechts één van de 100 talen die hij een beetje kent. Hij is niet vloeiend; hij stottert en moet Arabische woorden in vele kleine, onhandige stukjes breken om ze te begrijpen.

Aan de andere kant van het spectrum staan reuzen Arabische robots (zoals Jais of SILMA). Deze zijn ongelooflijk vloeiend en deskundig, maar ze zijn zo groot en zwaar dat ze alleen kunnen draaien in enorme, dure datacenters. Je kunt ze niet in je zak stoppen.

RightNow-Arabic-0.5B-Turbo is de "Goudlokje"-oplossing: een kleine robot die perfect Arabisch spreekt, speciaal ontworpen om in je zak te passen.

Hier is hoe de auteurs het bouwden, met behulp van eenvoudige analogieën:

1. De Woordenschatchirurgie (De robot een nieuw woordenboek geven)

Het oorspronkelijke woordenboek van de robot was te klein voor het Arabisch. Het moest Arabische woorden in kleine fragmenten hakken, waardoor het traag en inefficiënt werd.

  • De oplossing: Het team voerde "woordenschatchirurgie" uit. Ze namen het bestaande woordenboek van de robot en injecteerden 27.000 nieuwe Arabische woorden direct daarin.
  • Het resultaat: In plaats van 2,18 kleine stukjes nodig te hebben om één Arabisch woord te beschrijven, heeft de robot nu slechts 1,80 stukjes nodig. Het is alsof je overstapt van een robot die elke letter van een woord uitspelt naar een robot die hele woorden direct herkent. Dit maakt de robot 17% sneller bij het spreken van Arabisch.

2. De Trainingskampen (De robot leren)

Het team gaf de robot niet alleen een nieuw woordenboek; ze stuurden hem door drie intensieve trainingskampen:

  • Kamp 1: De Bibliotheek (Verdere vooropleiding): Ze voerden de robot 504 miljoen Arabische zinnen uit Wikipedia. Dit was alsof ze de robot een crashcursus gaven in het lezen van Arabische kranten en boeken, zodat hij het ritme en de flow van de taal kon leren.
  • Kamp 2: Het Klaslokaal (Supervised Fine-Tuning): Ze leerden de robot hoe hij een behulpzame assistent moest zijn. Ze toonden hem 129.000 voorbeelden van vragen en antwoorden. Cruciaal was dat ze de robot vertelden: "Maak je geen zorgen over het vraaggedeelte; focus gewoon op het leren hoe je het antwoord schrijft." Dit maakte hem veel beter in het volgen van instructies.
  • Kamp 3: De Debatsclub (Direct Preference Optimization): Ze toonden de robot paren antwoorden (één goed, één slecht) en vroegen hem om de winnaar te kiezen. Omdat de robot echter zo klein is, hielp deze stap op zichzelf niet veel. De "voorkeurs"gegevens waren wat ruisachtig, alsof je probeert een peuter te leren fijnkunst te beoordelen.

3. De "Gewichtsoep" (Het geheime ingrediënt)

Hier komt het slimme deel. Omdat de training in de "Debatsclub" niet perfect werkte, koos het team niet gewoon de uiteindelijke robot. In plaats daarvan namen ze drie verschillende versies van de robot (die na de Bibliotheek, die na het Klaslokaal en die na de Debatsclub) en mengden ze samen.

  • De Analogie: Stel je voor dat je soep maakt. Je neemt een kop van de "Bibliotheek"-robot, een kop van de "Klaslokaal"-robot en een halve kop van de "Debatsclub"-robot, en mengt ze.
  • Het resultaat: Deze "soep" creëerde een uiteindelijke robot die slimmer en beter in balans was dan welke enkele versie ook op zichzelf.

4. Het Eindproduct: Klein maar Krachtig

Het resultaat is een model met 518 miljoen parameters (klein in vergelijking met de 7B- of 9B-reuzen).

  • Grootte: Wanneer gecomprimeerd (gequantizeerd) om op een telefoon te passen, neemt het slechts 398 MB ruimte in beslag. Dat is kleiner dan een film in hoge definitie.
  • Snelheid: Op een krachtige computerchip kan het tekst genereren met 635 woorden per seconde. Dat is alsof een mens met bliksemsnelheid typt.
  • Prestaties:
    • Het verslaat andere kleine robots (zoals de originele Qwen) in het begrijpen van Arabisch.
    • Het staat gelijk aan een robot drie keer zo groot (Falcon-H1-1.5B) bij taken voor gezond verstand.
    • Het herstelt 67% van de intelligentie van de enorme 9B-robot (SILMA), ondanks dat het 18 keer kleiner is.

Wat het Niet Kan (De Beperkingen)

Het artikel is eerlijk over wat deze kleine robot niet kan:

  • Kennisplafond: Het kent niet evenveel feiten als de reuzenrobots. Als je complexe trivia-vragen stelt (zoals een moeilijke quiz), zal het verliezen van de 7B- of 9B-modellen. Het is een specialist in taal, geen encyclopedie van feiten.
  • Dialecten: Het spreekt "Modern Standaard Arabisch" (de formele taal die wordt gebruikt in nieuws en boeken). Als je tegen hem spreekt in Egyptische, Golf- of Levantijnse dialecten, zal hij je begrijpen maar in formeel Arabisch antwoorden. Het heeft de straattaal nog niet geleerd.

De Conclusie

De auteurs bouwden de kleinste open-source, op Arabisch gespecialiseerde robot die daadwerkelijk goed werkt. Ze bewezen dat je geen supercomputer nodig hebt om een vloeiende Arabische assistent te laten draaien; je hebt alleen het juiste woordenschat, de juiste trainingsmix en een beetje "soep"-magie nodig. Alle code, gewichten en recepten zijn nu open voor iedereen om te gebruiken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →