← Nieuwste papers
🤖 AI

NebulaExp-8B: An Empirical Post-Training Pipeline via Full-Scale Ablation Research

Dit artikel introduceert NebulaExp, een volledig transparante en reproduceerbare post-training pipeline voor 8B-schaal LLM's die volledige ablatie-studies uitvoert op datacuratie en trainingsstrategieën om zowel algemene instructievolgende als gespecialiseerde redeneercapaciteiten significant te verbeteren door middel van geoptimaliseerde SFT, GRPO reinforcement learning en teacher-gebaseerde distillatie.

Oorspronkelijke auteurs: Qiaobo Hao, Yangqian Wu, Shunyi Wang, Zhongjian Zhang, Ziqun Li, Yayin He, Muqing Li, Chen Zhong

Gepubliceerd 2026-06-26
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Qiaobo Hao, Yangqian Wu, Shunyi Wang, Zhongjian Zhang, Ziqun Li, Yayin He, Muqing Li, Chen Zhong

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, goed onderlegde student hebt (een AI-model met 8 miljard parameters) die zojuist zijn "pre-training" heeft afgerond (het hele internet heeft gelezen). Ze weten veel feiten, maar ze zijn een beetje slordig: ze volgen niet altijd instructies op, ze hebben moeite met complexe wiskundige problemen en hun antwoorden kunnen inconsistent zijn.

Het paper "NebulaExp-8B" is een gedetailleerd rapport over hoe een team bij ZTE deze ruwe student heeft genomen en hen door een rigoureuze, transparante "post-training" bootcamp heeft geleid om hen te transformeren tot een top performer. In plaats van alleen de eindcijfers te laten zien, hebben ze de deuren geopend om precies te laten zien hoe ze het curriculum hebben gebouwd, de huiswerkopdrachten hebben gefilterd en de leraren hebben gekozen.

Hier is het verhaal van hun reis, onderverdeeld in eenvoudige analogieën:

1. Het Probleem: De "Ruisende" Bibliotheek

Het team begon met een enorme stapel huiswerkopdrachten (data) verzameld uit diverse publieke bronnen. Maar deze bibliotheek was een rommeltje:

  • Inconsistente Stijlen: Sommige antwoorden waren geschreven als een formeel essay, andere als een tekstbericht.
  • Foute Antwoorden: Sommige huiswerkopdrachten bevatten onjuiste oplossingen.
  • Gemengde Moeilijkheidsgraad: Het was een chaos van "makkelijke" vragen en "onmogelijke" puzzels zonder duidelijke beoordeling.

De Oplossing: Ze bouwden een Dataverwerkingspijplijn. Denk aan dit als een hightech fabriek die de huiswerkopdrachten sorteert, schoonmaakt en beoordeelt voordat de student ze ooit te zien krijgt.

  • Distillatie: Ze gebruikten een superintelligente "Hoofdmeester" (een enorm AI-model) om alle antwoorden te herschrijven zodat ze consistent en logisch klonken.
  • Filtering: Ze gooiden al het huiswerk weg met foutieve antwoorden, onzin of giftige inhoud.
  • Beoordeling: Ze labelden vragen als "Makkelijk", "Gemiddeld" of "Moeilijk" op basis van hoe vaak de student ze aanvankelijk goed had.

2. De Twee Paden: De "Generalist" versus de "Specialist"

Het team realiseerde zich dat ze de student niet tegelijkertijd perfect aan alles konden trainen zonder dat er verwarring ontstond. Daarom splitsten ze de training in twee duidelijke takken:

Pad A: Het "Instruct" Model (De Beleefde Assistent)

Deze tak richt zich op het opvolgen van regels en het zijn van behulpzaam.

  • De Ontdekking: Ze ontdekten een grappige afruil. Om beter te worden in Wiskunde, moest de student lange, complexe, moeilijke verhalen lezen. Maar om beter te worden in Coderen, had de student korte, precieze, gemakkelijk te volgen instructies nodig. Als je ze alleen moeilijke wiskundeproblemen voerde, werden ze slecht in coderen. Als je ze alleen coderingsopdrachten gaf, werden ze slecht in wiskunde.
  • De Oplossing: Ze creëerden een "gebalanceerd dieet". Ze mengden de data zorgvuldig: een beetje moeilijke wiskunde, een beetje precieze code en veel algemene langere teksten.
  • Het Resultaat: Door deze ingrediënten perfect te mengen, verhoogden ze de gemiddelde testscore van de student aanzienlijk. Ze ontdekten ook dat Reinforcement Learning (RL) — waarbij de student een "beloning" krijgt voor het juiste antwoord — hielp om instructies nog beter op te volgen, hoewel dit zorgvuldige afstemming vereiste om te voorkomen dat de focus te veel op slechts één type probleem kwam te liggen.

Pad B: Het "Reasoning" Model (De Logica-Meester)

Deze tak richt zich op het oplossen van moeilijke puzzels, wiskunde- en wetenschapsproblemen.

  • De Strategie: In plaats van alleen meer data op de student af te gooien, gebruikten ze een Curriculum.
    • Stap 1: Begin met korte, gemakkelijke redeneerketens om de student te leren hoe hij stapsgewijs moet denken.
    • Stap 2: Ga over naar lange, complexe ketens om diepgaand probleemoplossend vermogen te leren.
  • De Ontdekking: Ze ontdekten dat Kwaliteit > Kwantiteit. Een kleinere stapel perfect gefilterde, hoogwaardige huiswerkopdrachten was beter dan een enorme stapel rommelige data. Ze ontdekten ook dat het mengen van Wiskunde, Code en Wetenschapsdata de student hielp om beter te leren dan wanneer ze zich op slechts één vak concentreerden.

3. Het Geheime Wapen: "On-Policy Distillation" (OPD)

Normaal gesproken heb je om een student beter te leren worden een "Verifier" (een strenge beoordelaar) nodig om het werk te controleren en een score te geven (Reward). Dit is moeilijk te doen voor creatief schrijven of open vragen omdat er niet één enkel "goed" antwoord is.

Het team probeerde een nieuwe truc genaamd OPD:

  • De Analogie: Stel je voor dat er, in plaats van een beoordelaar die een score geeft, een Meesterkok (de Leraar) naast de student staat. De student bereidt een gerecht en de Meesterkok zegt niet alleen "Goed" of "Slecht". In plaats daarvan fluistert de Chef: "Je had hier een snufje zout aan toe moeten voegen," of "Zet het vuur hier iets lager."
  • Waarom het cool is: Dit "fluisteren" (het imiteren van het denkproces van de leraar) werkt zelfs wanneer er geen "goed" antwoord te verifiëren is.
  • De Verrassing:
    • Enkele Leraar: Door slechts één leraar-model te gebruiken, verbeterden ze het vermogen van de student om instructies op te volgen beter dan de traditionele "beoordelaar"-methode, terwijl ze 13 keer minder data gebruikten.
    • Multi-Leraar: Ze huurden vier verschillende specialistische leraren in (één voor Wiskunde, één voor Code, één voor Wetenschap, één voor Instructies). Ze smolten hen samen tot één student.
    • De Magie: De student werd niet simpelweg het gemiddelde van de leraren. Op wiskundetoetsen versloeg de student zelfs de beste individuele leraar. Het is alsof een student studeert met een wiskundig genie, een coderingswizard en een wetenschapsgenie, en vervolgens een wiskundeprobleem oplost beter dan het wiskundige genie dat alleen zou kunnen doen. De combinatie van kennis creëerde iets nieuws en sterkers.

4. Belangrijkste Punten (Het "Spiekbriefje")

  • Garbage In, Garbage Out: Het opschonen van de data (het verwijderen van foute antwoorden en slechte stijlen) is de belangrijkste stap. Het is belangrijker dan de fancy trainingsalgoritmen.
  • Eén maat past niet voor iedereen: Wiskunde en Coderen hebben tegenovergestelde soorten trainingsdata nodig. Je moet ze zorgvuldig mengen.
  • Leraren tellen meer dan Grootte: Wanneer je de "fluistermethode" (OPD) gebruikt, is het beter om een leraar te hebben die goed is in het specifieke onderwerp dat je onderwijst, zelfs als dat een kleiner model is, dan een gigantisch model dat overal slechts "oké" in is.
  • Minder is Meer: Je hebt geen miljoenen voorbeelden nodig om te verbeteren. Soms zijn 10.000 hoogwaardige, zorgvuldig gekozen voorbeelden genoeg om een enorme sprong in prestaties te maken.

Samenvatting

Het paper bewijst dat je niet een groter, duurder brein nodig hebt om een slimmere AI te krijgen. In plaats daarvan heb je een beter trainingsrecept nodig: schone data, een gebalanceerde mix van onderwerpen en slimme onderwijsmethoden die de student in staat stellen om te leren van de beste experts zonder dat er voor elke vraag een strikte beoordelaar nodig is. Ze hebben het hele recept getoond zodat iedereen het kan kopiëren en hun eigen slimme AI kan bouwen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →