ZAYA1-8B Technical Report
Das Papier stellt ZAYA1-8B vor, ein hocheffizientes MoE-Reasoning-Modell mit 8 Milliarden Parametern, das vollständig auf AMD-Infrastruktur trainiert wurde und durch eine spezialisierte vierstufige RL-Kaskade sowie die neuartige Markovische RSA-Testzeit-Rechenmethode State-of-the-Art-Leistung in Mathematik- und Coding-Benchmarks erzielt, wodurch die Lücke zu deutlich größeren Modellen effektiv verringert wird.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Das große Ganze: Ein kleines Gehirn mit Superkraft
Stellen Sie sich einen winzigen, unglaublich intelligenten Schüler namens ZAYA1-8B vor. Dieser Schüler hat ein Gehirn mit nur 700 Millionen aktiven Neuronen (eine sehr kleine Größe für eine KI), ist aber Teil einer größeren „Schule" mit insgesamt 8 Milliarden Neuronen.
Normalerweise benötigt man ein riesiges Gehirn (wie eine massive KI mit Milliarden von Parametern), um schwierige Mathematikaufgaben zu lösen oder komplexen Code zu schreiben. ZAYA1-8B ist besonders, weil es diese schwierigen Probleme trotz seiner geringen Größe genauso gut oder sogar besser lösen kann als viel größere „Genie"-Schüler.
Wie? Durch den Einsatz von drei geheimen Waffen: einer neuen Denkweise, einem speziellen Trainingslager und einer einzigartigen Methode zur Selbstkontrolle.
1. Die Architektur: Ein spezialisiertes Team
Die meisten KI-Modelle sind wie eine einzelne Person, die versucht, alles allein zu erledigen. ZAYA1-8B ist wie ein spezialisiertes Team aufgebaut, das auf einem „Mixture of Experts" (MoE)-Prinzip basiert.
- Das Team: Stellen Sie sich ein Klassenzimmer mit 16 verschiedenen Lehrern (Experten) vor. Wenn eine Frage hereinkommt, entscheidet ein „Router" (der Klassensprecher), welcher Lehrer am besten geeignet ist, sie zu beantworten.
- Der neue Monitor (ZAYA1 Router): In älteren Modellen war der Monitor ein einfacher Regelbefolger. ZAYA1-8B verwendet einen intelligenteren, mehrschichtigen Monitor, der bessere Entscheidungen darüber trifft, wer unterrichten soll, und sicherstellt, dass der richtige Experte die Aufgabe jedes Mal übernimmt.
- Die komprimierte Bibliothek (CCA): Um lange Bücher zu lesen oder lange Geschichten zu erinnern, nutzt das Modell ein „komprimiertes Bibliothekssystem". Anstatt jede einzelne Buchseite im Kopf zu tragen, speichert es eine zusammengefasste, komprimierte Version, die Platz und Energie spart, aber alle wichtigen Details bewahrt. Dies ermöglicht es ihm, sehr lange Gespräche zu bewältigen, ohne müde zu werden.
2. Das Training: Lernen, bevor man spricht
Der Bericht beschreibt einen einzigartigen Trainingsprozess, der diesen Schüler in eine Denkmaschine verwandeln soll.
- Der „Antwort-erhaltende" Schnitt: Lehrer haben oft lange, detaillierte Erklärungen (Denkspuren), die zu lang sind, um auf eine einzige Seite eines Lehrbuchs zu passen. Anstatt die Mitte der Geschichte abzuschneiden (was die Logik zerstören würde), verwendet ZAYA1-8B einen speziellen Trick: Es schneidet das Ende der Erklärung ab, behält aber die endgültige Antwort. Dies lehrt das Modell, wie man plant und denkt, selbst wenn der gesamte Denkprozess zu lang ist, um auf einmal Platz zu finden.
- Das vierstufige Bootcamp: Nach dem Erlernen der Grundlagen durchlief das Modell ein rigoroses „Reinforcement Learning" (RL)-Bootcamp:
- Aufwärmen: Lösen einfacher Rätsel und Mathematikaufgaben, um sich an intensives Denken zu gewöhnen.
- Das Fitnessstudio: Eine benutzerdefinierte Umgebung mit 400 verschiedenen Rätselgeneratoren, die schwieriger werden, je besser das Modell wird.
- Das Hauptereignis: Bewältigung echter Mathematik- und Programmierherausforderungen, einschließlich einer speziellen Phase „Test-Time Compute" (TTC), in der es lernt, mehrere mögliche Antworten zu generieren und die beste auszuwählen.
- Polieren: Eine letzte Phase, um zu lernen, wie man höflich chattet und Anweisungen befolgt, wie ein guter Assistent.
3. Das Geheimrezept: „Markovian RSA" (Das Gruppendenken)
Dies ist der innovativste Teil des Berichts. Normalerweise versucht eine KI, wenn sie ein schwieriges Problem löst, die Antwort in einem langen, kontinuierlichen Strom zu denken. Wenn der Strom zu lang wird, gerät die KI in Verwirrung.
ZAYA1-8B verwendet eine Methode namens Markovian RSA. Stellen Sie sich dies wie ein Staffellauf mit einer Wendung vor:
- Das Rennen: Anstatt dass ein Läufer versucht, den ganzen Marathon zu laufen, schickt das Modell 16 Läufer (Kandidaten) gleichzeitig los.
- Der Wechsel: Jeder Läufer läuft eine kurze, sichere Strecke (ein „Schwanz" von 4.000 Wörtern). Sie tragen nicht die gesamte Geschichte des Rennens; sie geben nur ihre letzten paar Schritte (den Schwanz) an die nächste Runde weiter.
- Die Aggregation: Ein „Trainer" betrachtet die letzten paar Schritte aller 16 Läufer, kombiniert die besten Ideen und schickt sie für eine weitere Runde los.
- Das Ergebnis: Indem der Denkprozess in kleine, handhabbare Stücke zerlegt wird und das Team über den besten Weg abstimmt, kann ZAYA1-8B unglaublich schwierige Mathematikaufgaben lösen (wie die AIME- und HMMT-Wettbewerbe), für die normalerweise viel größere Gehirne benötigt werden.
Die Analogie: Stellen Sie sich vor, Sie versuchen, ein riesiges Puzzle zu lösen.
- Der alte Weg: Eine Person versucht, das gesamte Puzzle gleichzeitig im Kopf zu halten. Sie wird überwältigt.
- Der ZAYA1-8B-Weg: Sie schicken 16 Personen los, um an kleinen Abschnitten zu arbeiten. Sie geben nur ein paar Teile ihres Abschnitts an die nächste Gruppe weiter. Die Gruppe kombiniert diese kleinen Teile, um das gesamte Bild zu erstellen. Es ist schneller, verbraucht weniger Speicher und liefert ein besseres Ergebnis.
4. Die Hardware: Gebaut auf AMD
Das gesamte Modell wurde mit AMD-Chips trainiert (speziell den MI300X-GPUs). Das ist eine große Sache, da es beweist, dass man nicht die teuersten, proprietären Chips benötigt, um erstklassige Denkmodelle zu trainieren. Das Team zeigte, dass mit der richtigen Software- und Hardware-Konfiguration AMD-Chips die schwere Arbeit beim Training einer komplexen KI bewältigen können.
5. Die Ergebnisse: Klein, aber mächtig
Der Bericht behauptet, dass mit diesem Setup:
- ZAYA1-8B (mit nur 0,7 Milliarden aktiven Parametern) DeepSeek-R1 (das 37 Milliarden aktive Parameter hat) bei Mathematik- und Programmiertests schlägt oder gleichzieht.
- Bei der Verwendung der „Markovian RSA"-Gruppen-Denkmethode erzielt es bei schwierigen Mathematikwettbewerben Ergebnisse, die sehr nahe an riesigen, teuren Modellen wie Gemini-2.5 Pro und GPT-5-High liegen.
Zusammenfassung
ZAYA1-8B ist eine kleine, effiziente KI, die beweist, dass man kein riesiges Gehirn braucht, um ein Genie zu sein. Durch die Nutzung einer intelligenten Teamstruktur, einer speziellen Trainingsmethode, die die Antworten sicher bewahrt, und einer „Gruppen-Staffellauf"-Strategie zum Denken, kann es die schwierigsten Mathematik- und Programmierprobleme lösen, während es nur einen Bruchteil der Rechenleistung seiner größeren Konkurrenten verbraucht.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.