← Nieuwste papers
💻 computer science

NEDOQwen: Diagnosing and Repairing a Turkish-Centric 0.824B Language Model

Dit artikel introduceert NEDOQwen, een Turks-gecentreerd taalmodel met 824 miljoen parameters, om een goedkope, controleerbare workflow te demonstreren voor het diagnosticeren van discrepanties tussen interne en externe evaluaties en het bereiken van gerichte verbeteringen in benchmarks door middel van fijnafstemming en reparatie, terwijl er tegelijkertijd wordt gewaarschuwd dat dergelijke winst niet gelijkstaat aan brede competentie.

Oorspronkelijke auteurs: Ahmet Rıfat Öztürk, Yağız Ekrem Dalar, Nedim Mutlu Sezer, Feyzi Arda Salihoğlu

Gepubliceerd 2026-07-20
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ahmet Rıfat Öztürk, Yağız Ekrem Dalar, Nedim Mutlu Sezer, Feyzi Arda Salihoğlu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het geheime leven van piepkleine brein-bots

Stel je een wereld voor waarin computers niet alleen Engels spreken, maar proberen duizenden andere talen te leren, van Frans tot Swahili tot Turks. Dit is de grens van Artificiële Intelligentie (AI), specifiek een vakgebied genaamd Natural Language Processing (NLP). Zie deze AI-modellen als gigantische, digitale hersenen die bijna alles op het internet hebben gelezen. Ze leren patronen: als je zegt "De kat zat op de", weten ze dat het volgende woord waarschijnlijk "mat" is.

Maar hier komt het lastige deel: niet alle hersenen zijn gelijk. Sommige zijn enorm, zoals een supercomputer met een bibliotheek van elk ooit geschreven boek. Anderen zijn Small Language Models (SLM's), die als zakformaat notitieboekjes zijn. Ze zijn goedkoper om te bouwen en sneller in gebruik, waardoor ze perfect zijn voor specifieke taken of talen die minder aandacht krijgen dan het Engels. Echter, alleen omdat een model lijkt een taal te leren, betekent niet dat het deze ook echt begrijpt. Het kan de vorm van de woorden aan het onthouden zijn zonder te weten wat ze betekenen, of het kan valsspelen bij toetsen door de meest populaire antwoordletter te raden in plaats van het probleem op te lossen.

Onderzoekers proberen voortdurend uit te vinden hoe ze deze kleine, betaalbare AI-hersenen slimmer en eerlijker kunnen maken, vooral voor talen zoals het Turks, dat een unieke, bouwsteen-achtige grammatica heeft die standaard computerprogramma's in de war kan brengen. De grote vraag is: Kunnen we een klein, worstelend AI-model repareren zodat het zijn taal echt begrijpt, of leert het gewoon te faken?


Het verhaal van NEDOQwen: Een make-over voor een Turkse tutor

Maak kennis met NEDOQwen, een pieklein AI-model met 0,824 miljard parameters dat specifiek is ontworpen om Turks te spreken. Zie het als een student die probeert Turks te leren, maar worstelt met de basis. Een team van onderzoekers van Ethosoft besloot de rol van strenge maar behulpzame tutors op zich te nemen. Ze wilden niet alleen zien of de student een toets kon halen; ze wilden een volledige "diagnose en reparatie" uitvoeren om precies te zien waarom de student faalde en of ze de kernproblemen daadwerkelijk konden oplossen.

De Diagnose: Het gaat niet alleen om de antwoorden

Eerst gaven de onderzoekers NEDOQwen een reeks tests. Ze keken naar twee dingen: hoe goed het instructies volgde in een chat (interne diagnostiek) en hoe goed het meerkeuzevragen beantwoordde over schoolvakken zoals wiskunde en geschiedenis (externe benchmarks).

Hier kwam de verrassing: het model werd beter in chatten! Wanneer de onderzoekers het een "schone" set instructies gaven om van te leren, stopte het met het maken van stomme fouten in gesprekken. Het klonk beleefder en volgde regels beter op. Echter, toen ze overschakelden naar de moeilijke meerkeuzevragen, was het model nog steeds slecht. Het scoorde ongeveer 18,11% op een Turkse wiskunde- en wetenschapstoets (TurkishMMLU-sub) en 21,33% op een algemene kennisstoets (TUMLU-mini). Ter context: een willekeurige gok zou je ongeveer 20% of 25% correct opleveren. Het model versloeg de kansen nauwelijks.

De onderzoekers controleerden ook de "woordenschattool" van het model, een tokenizer genoemd. Dit is het deel van de AI dat zinnen opbreekt in stukjes die het kan begrijpen. Ze ontdekten dat hoewel NEDOQwen specifelijk voor het Turks was ontworpen, de tool eigenlijk slechter was in het opdelen van Turkse woorden dan sommige andere algemene tools. Het liet sommige woorden "onbekend" (UNK) en nam meer stukjes om hetzelfde te zeggen. Het was alsofd je een student een woordenboek gaf dat de helft van de woorden miste en verwarrende definities had.

De Reparatie: Het model leren om te valsspelen (en het daarna te repareren)

Dus probeerde het team het te repareren. Ze gaven het model een speciale "reparatiecursus". Dit ging niet alleen over het aanleren van meer feiten; het ging erom het model te leren hoe het de toets moet afleggen. Ze lieten voorbeelden zien van hoe het de juiste antwoordletter (A, B, C of D) kiest en hoe het zijn reacties moet formatteren.

Ze voerden deze reparatie uit over 600 stappen (een korte leerburst). De resultaten waren interessant:

  • De TurkishMMLU-sub score ging van 18,11% naar 21,00%.
  • De TUMLU-mini score sprong van 21,33% naar 32,22%.

Het leek erop dat het model slimmer werd! Maar de onderzoekers groeven dieper en ontdekten een verborgen truc. Ze realiseerden zich dat het model niet noodzakelijverwijs meer feiten leerde; het leerde te kalibreren. Vóór de reparatie was het model geobsedeerd door de letter C. Het gokte "C" voor 85,9% van zijn antwoorden op één test! Het was in feilen basis een "C-gokker".

Na de reparatie nam de obsessie met "C" af en begon het model vaker "D" te gokken. De onderzoekers voerden een speciale test uit waarbij ze het model alleen leerden hoe het antwoordletters kiest, zonder het nieuwe feiten te leren. Zelfs met alleen dat, gingen de scores omhoog naar 19,56% en 27,00%. Dit bewees dat een groot deel van de verbetering kwam door het model te leren om te stoppen met telkens dezelfde letter te gokken, en niet doordat het plotseling meer wist over de Turkse geschiedenis of wiskunde.

Het Eindoordeel: Een betere student, maar nog steeds geen genie

Het definitieve oordeel is een mix van goed nieuws en een realiteitscheck. De reparatie werkte, maar slechts gedeeltelijk. Het model stopte met een "C-gokker" te zijn en begon zijn gokken te verdelen tussen C en D (respectievelijk ongeveer 47,6% en 51,6%). Het werd beter in het volgen van het format van de toets.

Echter, het model is geen Turks genie. Het faalt nog steeds bij wiskunde, vertaling en het samenvatten van verhalen. Het maakt nog steeds fouten wanneer de vragen net iets anders worden geformuleerd. De onderzoekers benadrukken dat dit geen "state-of-the-art" model is dat klaar is voor de echte wereld. Het is een goedkope, transparante experiment.

Het belangrijkste wat ze ontdekten, is dat een hogere testscore niet altijd betekent dat de AI slimmer is. Soms betekent het gewoon dat de AI heeft geleerd hoe het de toets beter moet maken. Door dit bloot te leggen, creëerde het team een nieuwe "workflow" voor andere onderzoekers: controleer de interne chat, controleer de externe test, controleer de tokenizer en controleer of het model niet gewoon steeds dezelfde letter gokt.

Uiteindelijk is NEDOQwen een les in eerlijkheid. Het laat ons zien dat we voor kleine, niet-Engelse AI-modellen voorzichtig moeten zijn dat we een kleine scoreverbetering niet vieren als een enorme doorbraak. In plaats daarvan moeten we onder de motorkap kijken om te zien of het model daadwerkelijk leert, of alleen maar leert om het spelletje te spelen. De onderzoekers besteedden slechts ongeveer 0,465 GPU-uren (ongeveer 28 minuten computertijd) en een klein beetje geld om deze waarheden te vinden, wat bewijst dat je geen supercomputer nodig hebt om een defecte AI te diagnosticeren — je hebt alleen een goede microscoop en een sceptische blik nodig.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →