Typhoon-S: Minimal Open Post-Training for Sovereign Large Language Models
Das Papier stellt Typhoon S vor, ein minimales und offenes Post-Training-Rezept, das Supervised Fine-Tuning, On-Policy-Distillation und kleinskaliges RFT mit InK-GRPO kombiniert, um zu demonstrieren, dass hochwertige, souveräne große Sprachmodelle, die in der Lage sind, regionsspezifische Aufgaben wie die thailändische juristische Argumentation zu bewältigen, unter akademischen Ressourcenmaßstäben entwickelt werden können, ohne auf massive Instruktionskorpora oder komplexe Reinforcement-Learning-Pipelines angewiesen zu sein.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie haben einen brillanten, erstklassigen Schüler (ein Large Language Model), der perfektes Englisch und Chinesisch spricht, aber Schwierigkeiten mit dem lokalen Dialekt, der Kultur und den Gesetzen eines bestimmten Landes hat. Normalerweise werfen große Tech-Unternehmen, um dieses Problem zu lösen, Unmengen an Geld, Supercomputern und endlosen Daten auf das Problem. Aber was wäre, wenn ein kleineres Team, wie eine Universität oder eine nationale Regierung, seinen eigenen „souveränen“ KI-Modell entwickeln wollte, das seinen lokalen Kontext versteht, ohne ein Milliarden-Dollar-Budget zu benötigen?
Dieses Paper stellt Typhoon-S vor, ein „minimalistisches Rezept“, um diese KI-Modelle dazu zu bringen, sowohl hilfreiche allgemeine Assistenten als auch Experten für lokale, hochsensiblen Aufgaben (wie das thailändische Recht) zu sein, unter Verwendung sehr begrenzter Ressourcen.
So haben sie es gemacht, unterteilt in zwei Hauptteile:
Teil 1: Die KI „adoptierbar“ machen (Der allgemeine Assistent)
Das Ziel: Ein rohes, intelligentes Basismodell in einen höflichen, hilfreichen Assistenten verwandeln, der Anweisungen befolgen, Code schreiben und natürlich in der lokalen Sprache chatten kann.
Das Problem: Wenn man einem Modell einfach nur neue Anweisungen beibringt (Supervised Fine-Tuning oder SFT), wird es oft „spröde“. Es ist wie ein Schüler, der die Antworten aus dem Lehrbuch auswendig gelernt hat, aber in Panik gerät, wenn der Lehrer eine etwas andere Frage stellt oder die Sprache vermischt.
Die Lösung: Die „Shadowing“-Technik (On-Policy Distillation)
Die Autoren verwendeten einen zweistufigen Prozess:
- Die Lektion (SFT): Zuerst gaben sie dem Modell eine kleine, hochwertige Mischung aus englischen und thailändischen Instruktionsdaten. Dies war wie ein Crashkurs für den Schüler.
- Das Shadowing (OPD): Anstatt dem Modell nur die Antworten auswendig zu lernen, wurde das Modell gebeten, seine eigenen Antworten zu generieren, und ein „Lehrer“-Modell (eine viel intelligentere KI) beobachtete und korrigierte es in Echtzeit.
- Analogie: Stellen Sie sich einen Musikschüler vor, der ein Lied spielt. Auf dem alten Weg hörte er einfach eine Aufnahme und versuchte, sie zu kopieren. In diesem neuen Weg spielt der Schüler, und ein Meistermusiker sitzt neben ihm und flüstert Korrekturen, während der Schüler spielt. Dies hilft dem Schüler zu lernen, wie er aus seinen eigenen Fehlern lernt, was ihn viel robuster und flexibler macht.
Das Ergebnis: Sie erreichten dies mit nur wenigen Tagen Training auf einem kleinen GPU-Cluster (etwa in der Größe eines Universitätslabors). Das resultierende Modell, Typhoon-S-8B, wurde zu einem starken allgemeinen Assistenten, der chatten, coden und nahtlos zwischen Englisch und Thailändisch wechseln konnte, wobei es mit viel größeren Modellen konkurrierte.
Teil 2: Der KI „souveräne Fähigkeiten“ verleihen (Der lokale Experte)
Das Ziel: Das Modell lehren, komplexe, hochsensible lokale Aufgaben zu bewältigen, speziell die thailändische Rechtslogik, bei der es das lokale Recht verstehen und Werkzeuge nutzen muss, um Antworten zu finden.
Das Problem: Standardmäßiges KI-Training verstärkt oft nur das, was das Modell bereits weiß. Wenn das Modell ein spezifisches thailändisches Gesetz nicht kennt, wird das Standardtraining dieses neue Faktum nicht magisch lehren. Außerdem lehrt das Standardtraining die KI nicht, wie sie Werkzeuge (wie eine Suchmaschine) verwendet, um Informationen zu finden.
Die Lösung: Das „Dual-Brain“-Training (InK-GRPO)
Die Autoren erfanden eine neue Trainingsmethode namens Injected Knowledge GRPO (InK-GRPO).
- Das Gehirn-Spiel: Stellen Sie sich vor, die KI spielt ein Spiel, bei dem sie ein rechtliches Rätsel lösen muss.
- Gehirn A (Der Spieler): Es versucht, das Rätsel mithilfe eines Belohnungssystems (wie einem Highscore in einem Videospiel) zu lösen, um besser im logischen Denken zu werden.
- Gehirn B (Der Leser): Während Gehirn A spielt, liest Gehirn B im Hintergrund still und leise einen Stapel thailändischer Rechtsdokumente.
- Die Magie: Das System wechselt zufällig zwischen diesen beiden Modi. Manchmal spielt die KI das Spiel; manchmal liest sie die Dokumente. Dies ermöglicht es der KI, neue Fakten (die Gesetze) zu lernen, während sie gleichzeitig lernt, wie sie diese nutzt, um Probleme zu lösen.
Der Werkzeugnutzer (Agentic RFT):
Sie haben die KI auch darin geschult, Werkzeuge zu benutzen.
- Analogie: Anstatt zu versuchen, jedes Gesetz der Welt auswendig zu lernen, wird die KI darauf trainiert zu sagen: „Ich weiß das spezifische Gesetz nicht, lassen Sie mich in der Datenbank suchen“, das Dokument zu lesen und dann zu antworten.
- Sie trainierten die KI, dies in einer Schleife zu tun: Denken -> Suchen -> Lesen -> Denken -> Antworten.
Das Ergebnis: Der Typhoon-S-4B Legal Agent wurde unglaublich gut im thailändischen Rechtsdenken. Überraschenderweise übertraf dieses kleine 4-Milliarden-Parameter-Modell, das mit dieser spezifischen Methode trainiert wurde, tatsächlich ein viel größeres, berühmtes Modell (GPT-5), wenn beide die gleichen Werkzeuge zur Suche nach Antworten erhielten.
Das große Ganze
Das Paper beweist, dass man keinen massiven Supercomputer braucht, um eine leistungsstarke, souveräne KI zu bauen.
- Für die allgemeine Nutzung: Eine einfache Mischung aus „Lektionen“ und „Shadowing“ (SFT + OPD) reicht aus, um ein Modell intelligent und hilfreich zu machen.
- Für lokale Expertise: Eine kluge Mischung aus „Spielen“ und „Lehrbüchern lesen“ (InK-GRPO) ermöglicht es einem kleinen Modell, neue lokale Fakten zu lernen und Werkzeuge effektiv zu nutzen.
Die Kosten: Sie haben all dies mit Ressourcen erreicht, die in einem typischen Universitätslabor verfügbar sind (einige Tage Training auf 4 bis 8 High-End-GPUs), was beweist, dass kluges Design wichtiger ist als brutale Skalierung, um eine souveräne, lokalisierte KI zu erschaffen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.