Typhoon-S: Minimal Open Post-Training for Sovereign Large Language Models
Het artikel introduceert Typhoon S, een minimaal en open post-training recept dat supervised fine-tuning, on-policy distillatie en kleinschalige RFT met InK-GRPO combineert om aan te tonen dat hoogwaardige, soevereine grote taalmodellen die in staat zijn tot regio-specifieke taken zoals Thaise juridische redenering, kunnen worden ontwikkeld met academische schaal middelen zonder afhankelijk te zijn van massale instructie corpora of complexe reinforcement learning pipelines.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een briljante, wereldklasse student hebt (een Large Language Model) die perfect Engels en Chinees spreekt, maar worstelt met het lokale dialect, de cultuur en de wetten van een specifiek land. Normaal gesproken lossen grote technologiebedrijven dit op door enorme hoeveelheden geld, supercomputers en eindeloze hoeveelheden data in het probleem te gooien. Maar wat als een kleiner team, zoals een universiteit of een nationale overheid, zijn eigen "soevereine" AI wil creëren die de lokale context begrijpt zonder een miljardenbudget nodig te hebben?
Dit artikel introduceert Typhoon-S, een "minimalistisch recept" om deze AI-modellen zowel behulpzame algemene assistenten als experts te maken in lokale, cruciale taken (zoals het Thaise recht), met zeer beperkte middelen.
Zo hebben ze het gedaan, onderverdeeld in twee hoofddelen:
Deel 1: De AI "Aanvaardbaar" Maken (De Algemene Assistent)
Het Doel: Een ruw, slim basismodel transformeren naar een beleefde, behulpzame assistent die instructies kan opvolgen, code kan schrijven en natuurlijk kan chatten in de lokale taal.
Het Probleem: Als je een model alleen nieuwe instructies leert (Supervised Fine-Tuning of SFT), wordt het vaak "broos". Het is als een student die de antwoorden uit het tekstboek heeft uit het hoofd geleerd, maar in paniek raakt wanneer de leraar een iets andere vraag stelt of de taal door elkaar haalt.
De Oplossing: De "Shadowing"-techniek (On-Policy Distillation)
De auteurs gebruikten een tweestaps-proces:
- De Les (SFT): Eerst gaven ze het model een kleine, hoogwaardige mix van Engelse en Thaise instructiedata. Dit was als een crashcursus voor de student.
- Het Schaduwen (OPD): In plaats van alleen de antwoorden te memoriseren, werd het model gevraagd om zijn eigen antwoorden te genereren, waarbij een "leraar"-model (een veel slimmer AI-model) toekeek en in realtime corrigeerde.
- Analogie: Stel je een muziekstudent voor die een liedje speelt. In de oude methode luisterde de student gewoon naar een opname en probeerde die te kopiëren. In deze nieuwe methode speelt de student, en zit er een meester-muzikant naast die tijdens het spelen correcties fluistert. Dit helpt de student om te leren hoe hij moet herstellen van zijn eigen fouten, wat hem veel robuuster en flexibeler maakt.
Het Resultaat: Ze bereikten dit met slechts enkele dagen training op een kleine GPU-cluster (ongeveer de omvang van een universiteitslab). Het resulterende model, Typhoon-S-8B, werd een sterke algemene assistent die kon chatten, coderen en vloeiend tussen Engels en Thais kon schakelen, waarmee het grotere modellen evenaarde.
Deel 2: De AI "Soevereine Capaciteiten" Geven (De Lokale Expert)
Het Doel: Het model leren om complexe, cruciale lokale taken aan te pakken, specifweg Thaise juridische redenering, waarbij het de lokale wetten moet begrijpen en hulpmiddelen (tools) moet gebruiken om antwoorden te vinden.
Het Probleem: Standaard AI-training versterkt vaak alleen wat het model al weet. Als het model een specifieke Thaise wet niet kent, zal standaard training die nieuwe feit niet magisch aanleren. Ook leert standaard training de AI niet hoe hij hulpmiddelen (zoals een zoekmachine) moet gebruiken om informatie te vinden.
De Oplossing: De "Dual-Brain" Training (InK-GRPO)
De auteurs hebben een nieuwe trainingsmethode uitgevonden genaamd Injected Knowledge GRPO (InK-GRPO).
- Het Breinspel: Stel je voor dat de AI een spel speelt waarbij hij een juridische puzzel moet oplossen.
- Brein A (De Speler): Het probeert de puzzel op te lossen met behulp van een beloningssysteem (zoals een score in een videogame) om beter te worden in redeneren.
- Brein B (De Lezer): Terwijl Brein A het spel speelt, leest Brein B stilletjes een stapel Thaise juridische documenten.
- De Magie: Het systeem schakelt willekeurig tussen deze twee modi. Soms speelt de AI het spel; soms leest hij de documenten. Hierdoor kan de AI nieuwe feiten (de wetten) leren, terwijl hij tegelijkertijd leert hoe hij die gebruikt om problemen op te lossen.
De Tool Gebruiker (Agentic RFT):
Ze hebben de AI ook geleerd om hulpmiddelen te gebruiken.
- Analogie: In plaats van te proberen elke wet ter wereld uit het hoofd te leren, leert de AI om te zeggen: "Ik weet die specifieke wet niet, laat me de database doorzoeken," het document te lezen, en dan pas te antwoorden.
- Ze trainden de AI om dit in een lus te doen: Denken -> Zoeken -> Lezen -> Denken -> Antwoorden.
Het Resultaat: De Typhoon-S-4B Legal Agent werd ongelooflijk goed in Thaise juridische redenering. Verrassend genoeg presteerde dit kleine model met 4 miljard parameters, getraind met deze specifieke methode, zelfs beter dan een veel groter, beroemd model (GPT-5) wanneer beiden dezelfde hulpmiddelen kregen om naar antwoorden te zoeken.
De Grote Lijn
Het artikel bewijst dat je geen enorme supercomputer nodig hebt om een krachtige, soevereine AI te bouren.
- Voor Algemeen Gebruik: Een eenvoudige mix van "lessen" en "schaduwen" (SFT + OPD) is voldoende om een model slim en behulpzaam te maken.
- Voor Lokale Expertise: Een slimme mix van "spelletjes spelen" en "tekstboeken lezen" (InK-GRPO) stelt een klein model in staat om nieuwe lokale feiten te leren en hulpmiddelen effectief te gebruiken.
De Kosten: Ze hebben dit alles gedaan met middelen die beschikbaar zijn voor een typisch universiteitslab (enkele dagen training op 4 tot 8 high-end GPU's), wat bewijst dat slim ontwerp belangrijker is dan brute kracht van schaal voor het creëren van soevereine, gelokaliseerde AI.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.