← Nieuwste papers
💬 NLP

TinyR1-32B-Preview: Boosting Accuracy with Branch-Merge Distillation

Het artikel introduceert TinyR1-32B-Preview, een model met 32 miljard parameters dat is ontwikkeld via een nieuwe Branch-Merge-distillatiebenadering die gespecialiseerde studentmodellen selectief traint en deze samenvoegt om bestaande gedistilleerde tegenhangers op het gebied van wiskunde, programmeren en wetenschap aanzienlijk te overtreffen, terwijl het tegelijkertijd de prestaties van het grotere DeepSeek-R1-leraarmodel evenaart.

Oorspronkelijke auteurs: Lin Sun, Guangxiang Zhao, Xiaoqi Jian, Yuhan Wu, Weihong Lin, Yongfu Zhu, Qilong Shi, Change Jia, Aomufei Yuan, Yuxuan Tian, Linglin Zhang, Jinzhu Wu, Junfeng Ran, Sai-er Hu, Zihan Jiang, Junting Zhou
Gepubliceerd 2026-04-30
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Lin Sun, Guangxiang Zhao, Xiaoqi Jian, Yuhan Wu, Weihong Lin, Yongfu Zhu, Qilong Shi, Change Jia, Aomufei Yuan, Yuxuan Tian, Linglin Zhang, Jinzhu Wu, Junfeng Ran, Sai-er Hu, Zihan Jiang, Junting Zhou, Wenrui Liu, Xusen Xiao, Bin Cui, Tong Yang, Xiangzheng Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: Het Dilemma van de "Alleskunner"

Stel je voor dat je een briljante, wereldklasse-professor (een enorm AI-model) hebt die alles weet: geavanceerde wiskunde, complexe codering en diepe wetenschap. Je wilt een kleinere, goedkopere versie van deze professor maken die je op je eigen laptop kunt draaien.

De gebruikelijke manier om dit te doen, is om de notities van de grote professor te nemen en ze allemaal in één keer in een kleiner notitieboekje te proppen. Het artikel stelt dat dit meestal mislukt. Als je wiskunde-, coderings- en wetenschapsnotities door elkaar in één grote stapel mengt, raakt de student in de war. De wiskundenotities kunnen "vechten" met de coderingsnotities, waardoor de student minder van alles leert. Het is alsof je probeert viool te spelen, calculus op te lossen en een soufflé te koken, allemaal tegelijkertijd, door één gigantisch, door elkaar gehaald boek te lezen. Het resultaat is vaak een student die het overal redelijk doet, maar in niets uitmunt.

De Oplossing: De "Branch and Merge"-Strategie

De auteurs stellen een slimmere manier voor om de kleine student te onderwijzen, die ze Branch-Merge Distillation noemen. Denk hierbij aan een gespecialiseerde trainingskamp gevolgd door een uiteindelijke team-up.

Fase 1: De Branch (Gespecialiseerde Training)

In plaats van alles door elkaar te halen, splitsen ze de kennis van de grote professor op in drie aparte "takken" of gespecialiseerde tutors:

  1. De Wiskundetutor: Geeft alleen wiskundeproblemen.
  2. De Coderingtutor: Geeft alleen programmering.
  3. De Wetenschapstutor: Geeft alleen wetenschappelijke concepten.

Ze trainen drie aparte "expert"-versies van de kleine student. Omdat elke student zich alleen richt op één vak, worden ze echte meesters op dat specifieke gebied zonder in de war te raken door de anderen.

  • Analogie: In plaats van dat één student probeert drie vakken tegelijk te leren, huurt je drie verschillende tutors in. Eén geeft alleen wiskunde, één alleen codering en één alleen wetenschap. Elke student wordt een expert in hun specifieke klas.

Fase 2: De Merge (De Team-up)

Nu heeft het team drie briljante experts, maar ze hebben één enkele student nodig die alle drie kent. Als ze gewoon de hersenen van de drie studenten met elkaar zouden middelen, zouden ze de unieke genialiteit van elk kunnen verliezen.

In plaats daarvan gebruiken ze een slim "samenvoegings"-gereedschap (genaamd Arcee Fusion) om ze te combineren. Dit gereedschap fungeert als een zeer strenge redacteur. Het kijkt naar de drie experts en vraagt: "Verbeterd dit nieuwe stukje kennis van de Wiskundetutor daadwerkelijk het brein van de student, of is het gewoon ruis?"

  • De Regel: Als de Wiskundetutor een briljante, unieke inzichten heeft die de huidige student nog niet heeft, houdt de redacteur het vast. Als het inzicht zwak is of in strijd is met wat de student al weet, verwierpt de redacteur het.
  • Analogie: Stel je hebt drie chefs. De ene maakt het perfecte biefstuk, de ander de perfecte soep en de derde de perfecte taart. Je mengt hun ingrediënten niet zomaar in een blender. In plaats daarvan neem je het beste biefstukrecept, het beste soeprecept en het beste taartrecept en combineer je ze in één meesterkookboek. Je houdt alleen de delen die echt uitstekend zijn.

De Resultaten: Een Super-Student

Het resultaat van dit proces is TinyR1-32B-Preview.

  • Prestaties: Dit kleine model is aanzienlijk beter in Wiskunde, Codering en Wetenschap dan andere kleine modellen die op de "oude manier" zijn getraind (alle data door elkaar mengen).
  • Vergelijking: Het presteert bijna even goed als het gigantische "DeepSeek-R1"-leraar-model, ondanks dat het veel kleiner is.
  • Efficiëntie: Deze methode is ook ongelooflijk snel en goedkoop. Het artikel merkt op dat het samenvoegen van deze modellen slechts 4 uur duurde op krachtige computers, terwijl het opnieuw trainen van een model met gemengde data 740 uur zou hebben gekost. Het is alsof je in 4 uur een meesterchef krijgt in plaats van in 30 dagen.

Waarom Dit Belangrijk Is (Volgens Het Artikel)

Het artikel beweert dat dit een "gratis lunch" is in de wereld van AI. Het lost het probleem van "taakinterferentie" op (waarbij het leren van één ding je vermogen om iets anders te leren schaadt) door het leren eerst te scheiden en vervolgens de beste delen zorgvuldig te combineren.

Wat het artikel NIET beweert:

  • Het beweert niet dat dit model klaar is voor medische diagnose of juridisch advies.
  • Het beweert niet dat deze methode werkt voor elk mogelijk type AI-taak (ze hebben alleen Wiskunde, Codering en Wetenschap getest).
  • Het beweert niet dat het model perfect is; ze geven toe dat er nog werk aan de winkel is voor zaken als het volgen van complexe instructies of veiligheidscontroles.

Kortom, het artikel toont aan dat als je een klein, slim AI-model wilt, je niet moet proberen het alles tegelijk te leren. Leer het één ding per keer, word een expert, en naai die experts vervolgens zorgvuldig aan elkaar.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →