← Nieuwste papers
💻 computer science

IRIS: Interleaved Reinforcement with Incremental Staged Curriculum for Cross-Lingual Mathematical Reasoning

Het artikel introduceert IRIS, een nieuw raamwerk dat verweven versterkend leren combineert met een incrementeel gefaseerd curriculum en een nieuwe meertalige dataset (CL-Math) om de cross-linguale wiskundige redeneercapaciteiten aanzienlijk te verbeteren, met name in taalarme Indiase talen.

Oorspronkelijke auteurs: Navya Gupta, Rishitej Reddy Vyalla, Avinash Anand, Chhavi Kirtani, Erik Cambria, Zhengchen Zhang, Zhengkui Wang, Timothy Liu, Aik Beng Ng, Simon See, Rajiv Ratn Shah

Gepubliceerd 2026-04-28
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Navya Gupta, Rishitej Reddy Vyalla, Avinash Anand, Chhavi Kirtani, Erik Cambria, Zhengchen Zhang, Zhengkui Wang, Timothy Liu, Aik Beng Ng, Simon See, Rajiv Ratn Shah

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een student probeert te leren complexe wiskundeproblemen op te lossen. Als je ze gewoon een moeilijk schoolboek voor de voeten gooit en zegt: "Maak het maar op", zullen ze waarschijnlijk vastlopen, willekeurig gokken of opgeven. Dit is precies het probleem waar onderzoekers mee te maken kregen bij AI-modellen die wiskunde proberen te doen, vooral bij het wisselen tussen talen zoals Engels, Hindi en Marathi.

Het artikel introduceert een nieuwe trainingsmethode genaamd IRIS (Interleaved Reinforcement with Incremental Staged Curriculum). Denk aan IRIS als een zeer gestructureerd, tweeledig tutorsysteem dat bedoeld is om een verwarde AI om te toveren tot een zelfverzekerde wiskundig oplosser.

Hier is hoe het werkt, opgesplitst in eenvoudige concepten:

1. Het twee-assen trainingsplan

De auteurs realiseerden zich dat het onderwijzen van wiskunde twee verschillende dingen tegelijk vereist. Ze bouwden een raamwerk met twee "assen" (zoals een X- en Y-as grafiek):

  • De verticale as (De ladder van moeilijkheidsgraad beklimmen):
    Stel je een videospel voor waarin je begint op "Niveau 1" (makkelijke problemen) en pas naar "Niveau 2" gaat zodra je het onder de knie hebt. De meeste AI-trainingen gooien alle niveaus tegelijk op het model. IRIS is anders. Het start de AI met makkelijke wiskundeproblemen, laat het daar goed in worden, en voegt daarna geleidelijk middelzware en moeilijke problemen toe. Dit bouwt een stevige basis voordat het zware werk wordt aangepakt.

  • De horizontale as (Het "Maak het verhaal af"-spel):
    Dit is het slimme deel. Normaal krijgt een AI een probleem en het volledige antwoord te zien. IRIS verandert het spel. Het geeft de AI de vraag en de eerste paar stappen van de oplossing, en zegt dan: "Oké, nu ben je aan je eigen lot overgeleverd. Maak de rest af."

    • Vroege fase: De AI krijgt de meeste stappen en hoeft alleen de laatste twee te schrijven.
    • Latere fase: De AI krijgt alleen de vraag en moet de volledige oplossing vanaf nul schrijven.
      Dit dwingt de AI om te leren hoe het zijn eigen denken moet plannen en voortzetten, in plaats van alleen volledige antwoorden te memoriseren.

2. De "samengestelde beloning" (Het scorebord)

Bij Versterkend Leren krijgt de AI punten (beloningen) voor goed presteren. Normaal krijgt het alleen punten als het eindantwoord correct is. Maar bij wiskunde is een correct antwoord met slechte logica nog steeds slecht.

IRIS gebruikt een samengestelde beloning, wat vergelijkbaar is met een leraar die een student beoordeelt op vier dingen tegelijk:

  1. Heb je het juiste antwoord? (Het belangrijkste deel).
  2. Maakten je stappen zin? (Volgde je een logisch pad dat lijkt op het correcte?).
  3. Hield je de flow gaande? (Zette je door waar de vorige stap ophield, of begon je de nummering opnieuw?).
  4. Is het getal correct opgemaakt? (Heb je een schoon getal uitgegeven?).

Dit zorgt ervoor dat de AI leert hoe het moet denken, niet alleen wat het antwoord is.

3. De "Engelse anker" (Het meertalige geheimzout)

Een van de grootste uitdagingen is het onderwijzen van wiskunde in talen met minder middelen, zoals Hindi of Marathi. Er is niet evenveel hoogwaardige wiskundedata beschikbaar voor deze talen als voor het Engels.

Het artikel ontdekte een fascinerende truc: Gebruik Engels als een "Redeneringsanker".

  • Stel je voor dat het vermogen van de AI om logisch te denken is opgeslagen in het Engels, en het vermogen om Hindi of Marathi te spreken een apart vaardigheid is.
  • Door de AI te trainen op een mix van Engelse en Hindi/Marathi-problemen (zelfs als het maar 20% Engels is), fungeert de Engelse data als een stabiel anker. Het houdt het logische redeneren van de AI scherp en consistent.
  • De AI "verplaatst" vervolgens dit sterke redeneervermogen naar Hindi en Marathi. Zonder dit Engelse anker worstelt de AI om logische consistentie te behouden in de talen met minder middelen, en blijft het vaak vastlopen of geeft het op.

4. De resultaten

De onderzoekers testten dit op een nieuwe dataset die ze hebben gemaakt genaamd CL-Math, die 29.000 wiskundeproblemen bevat met stap-voor-stap oplossingen in het Engels, Hindi en Marathi.

  • Betere wiskundevaardigheden: De met IRIS getrainde modellen losten aanzienlijk meer problemen correct op dan standaardmodellen, vooral bij de moeilijkste vragen.
  • Taalboost: De grootste verbeteringen werden gezien in Hindi en Marathi. De "Engelse Anker"-strategie hielp de AI om in deze talen veel beter te redeneren dan wanneer het alleen op die talen was getraind.
  • Generalisatie: Hoewel ze trainden op hun specifieke dataset, presteerde de AI ook beter op andere standaard wiskundetesten (zoals GSM8K en MATH), wat bewijst dat de methode breed werkt.

Samenvatting

Kortom, IRIS is een trainingsmethode die AI leert wiskunde te doen door:

  1. Te beginnen met makkelijk en steeds moeilijker te worden (Verticaal).
  2. De AI te laten gedeeltelijke oplossingen afmaken (Horizontaal).
  3. Het te beoordelen op zowel het antwoord als de logica (Samengestelde Beloning).
  4. Engels te gebruiken als een "leerwiel" om het te helpen wiskunde te leren in andere talen (Meertalig Anker).

Het resultaat is een slimmere, logischer AI die wiskundeproblemen in meerdere talen kan oplossen, niet door te gokken, maar door de stappen daadwerkelijk te begrijpen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →