Beyond Rejection Sampling: Trajectory Fusion for Scaling Mathematical Reasoning
Dit artikel introduceert TrajFusion, een fine-tuning strategie die het wiskundig redeneren in grote taalmodellen verbetert door onjuiste trajecten adaptief te fuseren met reflectieprompts en correcte oplossingen, waardoor trial-and-error leren wordt gemodelleerd om standaard rejection sampling te overtreffen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een student leert hoe je een zeer moeilijk wiskundig probleem oplost.
De Oude Manier (Rejection Sampling)
Traditioneel werd er bij het trainen van AI-modellen voor wiskunde een methode gebruikt die "Rejection Sampling" wordt genoemd. Denk hierbij aan een strenge leraar die de student alleen de perfecte, correcte oplossing van een probleem laat zien.
Als de leraar tien keer probeert het probleem op te lossen en negen keer fout gaat, gooit hij die negen pogingen weg. Hij houdt alleen de ene keer dat het wel goed ging. De student ziet alleen het uiteindelijke, perfecte antwoord.
- Het Probleem: De student leert wat het antwoord is, maar leert nooit hoe hij moet herstellen wanneer hij een fout maakt. Ze zien de veelvoorkomende valstrikken, de verkeerde afslag of hoe ze een logische fout moeten herstellen niet. Het is alsof je een bestuurder alleen de kaart van een perfect traject laat zien, zonder ooit te laten zien wat er gebeurt als hij een verkeerde afslag neemt of in een doodlopende straat terechtkomt.
De Nieuwe Manier (TrajFusion)
Het artikel introduceert een nieuwe methode genaamd TrajFusion. In plaats van de foutieve pogingen weg te gooien, behoudt deze methode ze en weeft ze in de les.
Stel je voor dat de leraar nu tegen de student zegt:
"Oké, laten we dit proberen te oplossen.
- Eerste poging: Ik heb dit pad geprobeerd, maar ik besefte dat ik hier een fout maakte. (Laat het verkeerde pad zien).
- Reflectie: 'Wacht, dat lijkt niet te kloppen. Laten we het opnieuw proberen.' (Dit is een 'reflectie-prompt').
- Tweede poging: Ik heb een ander pad geprobeerd, maar ik heb een stap overgeslagen. (Toont nog een verkeerd pad).
- Reflectie: 'Hm, ik mis iets. Laten we zorgvuldig nadenken.'
- Laatste poging: Oké, nu heb ik het! Hier is de juiste oplossing."
Hoe het werkt (Het "Fusie"-gedeelte)
De belangrijkste innovatie is dat de AI niet zomaar elk fout antwoord laat zien. Het gebruikt een slimme filter:
- Als de leraar 10 keer achter elkaar dezelfde fout maakt: Dan realiseert het systeem zich dat dit een "doodlopend spoor" is of een simpel misverstand. Het zal dit misschien niet aan de student laten zien omdat het niet erg nuttig is.
- Als de leraar 10 verschillende soorten fouten maakt: Dan zegt het systeem: "Wauw, dit probleem is lastig! Er zijn veel manieren om het fout te doen." Het voegt deze diverse foutieve paden vervolgens samen in de trainingsles.
Dit creëert een "Trial-and-Error" simulatie. De AI leert niet alleen de bestemming, maar ook de reis van het navigeren door verwarring en het corrigeren van zichzelf.
De Resultaten
De onderzoekers hebben dit getest op twee verschillende AI-modellen (LLaMA3 en DeepSeekMath) op veel wiskundige benchmarks, van eenvoudige schoolwiskunde tot moeilijke wedstrijdniveau-problemen.
- Beter in moeilijke zaken: De nieuwe methode werkte het beste op de moeilijkste problemen (zoals Olympiade-wiskunde). Dit zijn de problemen waarbij verdwalen gebruikelijk is, dus leren hoe je je weg terugvindt is cruciaal.
- Efficiënt: Het had geen groter brein of een nieuw type computerchip nodig. Het veranderde simpelweg wat de AI las tijdens de training.
- Schaalbaar: Het werkte goed, of ze nu een kleine hoeveelheid data of een enorme hoeveelheid data gebruikten. Het werkte zelfs toen ze probeerden de AI zeer lange, complexe problemen te leren oplossen die veel informatie tegelijkertijd moeten onthouden.
In het kort
Het artikel betoogt dat fouten waardevolle data zijn. Door te stoppen met de praktijk van het weggooien van onjuiste pogingen en deze in plaats daarvan te veranderen in een gestructureerde "probeer, faal, reflecteer, probeer opnieuw"-les, wordt de AI een veel betere probleemoplosser. De AI leert zijn eigen fouten te herkennen en te corrigeren, precies zoals een mens dat doet bij het leren van een moeilijke vaardigheid.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.