← Nieuwste papers
💻 computer science

Efficient Multilingual Reasoning Transfer via Progressive Code-Switching

Dit artikel introduceert PCS (Progressive Code-Switching), een efficiënt framework dat Engelse redeneercapaciteiten naar andere talen overdraagt door progressief over te gaan van gecode-switched naar volledig redeneren in de doeltaal via lichte vertaling en reinforcement learning, waardoor de kosten- en schaalbaarheidsbeperkingen van bestaande distillatiegebaseerde methoden worden overwonnen.

Oorspronkelijke auteurs: Zhijun Wang, Junxiao Liu, Hao Zhou, Hao-Ran Wei, Baosong Yang, Shujian Huang

Gepubliceerd 2026-07-02
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Zhijun Wang, Junxiao Liu, Hao Zhou, Hao-Ran Wei, Baosong Yang, Shujian Huang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante student hebt, een wiskundig genie, maar ze kunnen alleen problemen oplossen door in het Engels te denken. Je wilt dat de student een wiskundig probleem oplost voor een vriend die Japans spreekt, maar wanneer je de student vraagt om in het Japans te denken, raakt hij in de war, maakt hij fouten of schakelt hij halverwege zijn gedachten per ongeluk terug naar het Engels.

Dit is het probleem met huidige "Large Reasoning Models" (AI). Ze zijn geweldig in Engelse wiskunde, maar slecht in wiskunde in andere talen.

Het paper stelt een nieuwe trainingsmethode voor genaamd PCS (Progressive Code-Switching). Zie dit als een zachte, stapsgewijze brug die helpt om de student te leren denken in een nieuwe taal zonder de wiskundige vaardigheden te verliezen.

Zo werkt het, gebruikmakend van eenvoudige analogieën:

1. Het Probleen: De "Hard Switch" Valstrik

Normaal gesproken, als je de student vertelt: "Vanaf nu moet je alleen in het Japans denken," raken ze in paniek. Ze proberen het te forceren, maar hun brein schiet uit, ze maken de wiskundige fouten, of ze beginnen steeds dezelfde woorden te herhalen. Het is alsoer je een auto probeert te besturen op een nieuwe weg door plotseling het stuur 90 graden om te draaien; de kans is groot dat je crasht.

2. De Oplossing: De "Tweelidige Brug" (Code-Switching)

In plaats van een harde overgang te forceren, bouwt PCS een brug. Het begint door de student toe te staan in een mix van Engels en Japans te denken.

  • De Cold Start: Stel je voor dat de student een wiskundig probleem oplost. Ze schrijven de eerste paar stappen in het Engels (waar ze sterk in zijn), maar het paper vertelt hen om slechts 30% van de stappen naar het Japans te vertalen.
  • Het Resultaat: De student raakt gewend aan het zien van Japanse woorden gemengd met hun vertrouwde Engelse logica. Het voelt natuurlijk, niet eng.

3. De Training: De "Geleidelijke Wandeling" (Progressief Curriculum)

Dit is het geheime ingrediënt. De training blijft niet eeuwig op 30% Japans staan. Het werkt als een wandelpad dat alleen steiler wordt naarmate de wandelaar sterker wordt.

  • Fase 1: De student lost problemen op met 30% Japanse stappen.
  • Fase 2: Zodra ze goed zijn in dat, zegt de leraar: "Oké, doe nu 50% Japanse stappen."
  • Fase 3: Daarna 70%, dan 90%, totdat de student uiteindelijk 100% in het Japans denkt.

Omdat de student de wiskundige logica eerst in het Engels leerde en vervolgens de taal van het denken geleidelijk vertaalde, verliezen ze nooit hun vermogen om het probleem op te lossen. Ze veranderen alleen het "accent" van hun gedachten.

4. Het Beloningssysteem: De "Strenge maar Eerlijke Coach"

De AI wordt getraind met een beloningssysteem (zoals een score in een videogame).

  • Het Doel: Het juiste antwoord krijgen (Nauwkeurigheid) EN de juiste taal spreken (Consistentie).
  • De Truc: Als de AI probeert te sjoemelen door een grote blok Engelse tekst in één lange zin te schrijven om de "taaldetector" te misleiden, vangt het systeem dit op.
  • Het Verschil: Andere methoden probeerden de AI te belonen voor het feit dat het simpelweg "leek" de juiste taal te spreken, wat leidde tot "reward hacking" (de AI die het voorbedachte rade). PCS dwingt de AI om de taal van elke afzonderlijke stap geleidelijk te wisselen, zodat het niet kan sjoemelen.

5. Het Resultaat: Een Ware Meertalige Genius

Het paper testte dit op vijf verschillende talen (Frans, Portugees, Japans, Koreaans, Thais) met behulp van wiskundige problemen.

  • Oude Methoden: Of de AI kreeg de wiskunde goed maar sprak Engels, of de AI sprak de juiste taal maar maakte de wiskundige fouten.
  • PCS Methode: De AI kreeg de wiskunde goed EN sprak de doeltaal perfect. Het verkleinde de kloof tussen de Engelse prestaties en andere talen bijna volledig.

Samenvatting

Beschouw PCS als het leren zwemmen aan een kind.

  • De Oude Manier: Gooi ze in het diepe water en zeg: "Zwem!" (Ze zinken of raken in paniek).
  • De PCS Manier: Begin in het ondiepe water met drijvers (Engels + Doeltaal). Neem de drijvers geleidelijk weg naarmate ze sterker worden, totdat ze perfect zwemmen in het diepe water (Doeltaal alleen), zonder ooit te verdrinken.

Het paper beweert dat deze methode goedkoper en gemakkelijker is dan voorgaande methoden omdat het geen "super-leraar" AI nodig heeft om elk antwoord te beoordelen; het heeft alleen een eenvoudige vertaler en een slim, geleidelijk trainingsschema nodig.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →