← Nieuwste papers
🤖 machine learning

Less Noise, More Voice: Reinforcement Learning for Reasoning via Instruction Purification

Dit artikel introduceert het Less Noise Sampling Framework (LENS), een methode die de efficiëntie van versterkingslering voor redenering verbetert door storende prompt-tokens te verwijderen en succesvolle rollouts te gebruiken om het model te trainen om interferentie te negeren, wat leidt tot aanzienlijk betere prestaties en snellere convergentie dan bestaande methoden zoals GRPO.

Oorspronkelijke auteurs: Yiju Guo, Tianyi Hu, Zexu Sun, Yankai Lin

Gepubliceerd 2026-04-21
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yiju Guo, Tianyi Hu, Zexu Sun, Yankai Lin

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Kortom: Minder ruis, meer stem – Hoe een slimme "schoonmaakbeurt" AI slimmer maakt

Stel je voor dat je een zeer intelligente, maar nog wat onervaren student (de AI) hebt die moeilijke wiskundepuzzels moet oplossen. Je geeft de student een opdracht, maar de opdracht is vol met kleine, verwarrende details die de student afleiden.

In de wereld van kunstmatige intelligentie noemen we dit RLVR (Reinforcement Learning met Verifieerbare Beloningen). Het idee is simpel: de AI probeert een oplossing, krijgt een "goed" of "fout" signaal, en leert van die feedback. Maar er zit een groot probleem in: vaak faalt de AI niet omdat de puzzel te moeilijk is, maar omdat de opdracht zelf te veel ruis bevat.

De onderzoekers van dit paper hebben ontdekt dat een paar kleine woordjes in de opdracht (die ze "Interferentie Tokens" noemen) de AI volledig in de war kunnen brengen. Het is alsof je iemand vraagt: "Ga naar de winkel, koop melk, en oh ja, vergeet niet dat de buren gisteren ruzie hadden over een blauwe fiets..." Die blauwe fiets heeft niets met de melk te maken, maar het verstoort het denken.

Hier is hoe hun nieuwe methode, LENS, dit oplost, vertaald naar alledaagse taal:

1. Het Probleem: De "Valse Vrienden" in de Opdracht

De AI probeert duizenden keren een oplossing te vinden. Vaak lukt het niet. De onderzoekers keken precies naar waarom het misging. Ze ontdekten dat in veel gevallen, als je gewoon die ene of twee verwarrende woordjes uit de opdracht zou halen, de AI het probleem direct zou oplossen.

Het is alsof je een spoorzoeker bent die een verdwaalde hond zoekt. Als de hond een hoed op heeft die hem verblindt, zoekt hij de verkeerde kant op. Haal je de hoed eraf, dan ziet hij de weg direct.

2. De Oplossing: LENS (Less Noise Sampling Framework)

De onderzoekers hebben een slimme tweestapsmethode bedacht, die we kunnen vergelijken met een tutor die eerst de opdracht scherpstelt voordat de leerling gaat oefenen.

Stap 1: De "Schoonmaakbeurt" (Purification)
Wanneer de AI faalt op een opdracht, kijkt LENS naar de tekst en vraagt zich af: "Welke woorden zorgen voor de meeste verwarring?"

  • Ze gebruiken een meetlat (de "Interferentie Score") om te zien welke woorden de AI het meest afleiden van de referentie (wat de AI normaal zou doen).
  • Ze halen die verwarrende woorden eruit.
  • Het resultaat: De AI krijgt nu een "schone" versie van de opdracht. Omdat de ruis weg is, lukt het oplossen van de puzzel veel vaker.

Stap 2: Het Leren van de "Schone" naar de "Vuil" Versie
Dit is het slimme deel. Je zou denken: "Oké, we gebruiken alleen de schone versies." Maar nee, in de echte wereld zijn opdrachten vaak rommelig.

  • LENS gebruikt de succesvolle oplossingen van de schone versie als een voorbeeld.
  • Het zegt tegen de AI: "Kijk, toen we die verwarrende woorden weghaalden, lukte het. Nu ga je leren hoe je diezelfde oplossing kunt vinden, zelfs als die verwarrende woorden er weer bij staan."
  • De AI leert zo om de "ruis" te negeren en zich te focussen op de kern van het probleem. Het is alsof je een student leert om te werken in een lawaaierige klaslokaal, door eerst te oefenen in een stille kamer en dan geleidelijk het volume op te draaien.

3. Waarom is dit zo geweldig?

Vroeger probeerden onderzoekers het probleem op te lossen door de AI meer te laten proberen (meer rekenkracht) of door de moeilijkste opdrachten helemaal te verwijderen.

  • Meer proberen is duur en traag (alsof je 10 keer harder roepen tegen de hond die de hoed op heeft).
  • Moeilijke opdrachten weggooien betekent dat de AI nooit leert om die moeilijke dingen op te lossen.

LENS doet het anders:

  • Snelheid: De AI leert sneller omdat de signalen duidelijker zijn. De paper laat zien dat het 1,6 keer sneller convergeert (dus sneller "slim" wordt).
  • Beter resultaat: De AI scoort gemiddeld 3,88% beter op wiskundepuzzels en 1,83% beter op algemene redeneringstaken.
  • Robuustheid: De AI wordt niet alleen beter in wiskunde, maar leert ook om in de echte wereld (met alle rommel en afleiding) goed te presteren.

Samenvattend in één beeld

Stel je voor dat je een radio hebt die vol zit met statische ruis.

  • De oude methode was: "Draai het volume harder, misschien hoor je de zanger wel." (Dit kost veel energie en klinkt nog steeds slecht).
  • De nieuwe methode (LENS) is: "Laat eerst een technicus de storing in de kabels repareren (de verwarrende woorden verwijderen), zodat je een kristalhelder signaal krijgt. Gebruik dat heldere signaal om de radio te kalibreren, zodat hij later ook zonder die reparatie het signaal kan versterken."

Conclusie:
Dit onderzoek laat zien dat we niet altijd harder hoeven te werken (meer rekenkracht), maar dat we soms slimmer moeten kijken naar waar de storing zit. Door een paar kleine "verwarrende woorden" in de instructies te verwijderen en de AI te leren om die te negeren, kunnen we veel slimmere en efficiëntere AI-modellen bouwen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →