← Nieuwste papers
🤖 machine learning

Do Not Waste Your Rollouts: Recycling Search Experience for Efficient Test-Time Scaling

Dit artikel introduceert Recycling Search Experience (RSE), een trainingsvrije strategie die schaling tijdens het testen verbetert door middel van distillatie en hergebruik van tussentijdse inzichten uit mislukte en geslaagde rollouts om computatie-redundantie te elimineren en de redeneer-efficiëntie bij complexe taken te verhogen.

Oorspronkelijke auteurs: Xinglin Wang, Jiayi Shi, Shaoxiong Feng, Peiwen Yuan, Yiwei Li, Yueqi Zhang, Chuyi Tan, Ji Zhang, Boyuan Pan, Yao Hu, Kan Li

Gepubliceerd 2026-05-06
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xinglin Wang, Jiayi Shi, Shaoxiong Feng, Peiwen Yuan, Yiwei Li, Yueqi Zhang, Chuyi Tan, Ji Zhang, Boyuan Pan, Yao Hu, Kan Li

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: De "Amnesie" van AI

Stel je voor dat je probeert een zeer moeilijk doolhof op te lossen. Je stuurt 100 verschillende verkenners (dit zijn de "rollouts" of pogingen van de AI) om de uitgang te vinden.

  • De Oude Manier (Huidige AI-zoekopdrachten): Elke verkenners begint vanaf het begin, botst tegen een muur, draait om en probeert een ander pad. Als ze op een doodlopende weg belanden, geven ze op. De volgende verkenners begint opnieuw, botst tegen dezelfde muur en komt op dezelfde doodlopende weg uit. Ze vinden misschien zelfs een afkorting die de eerste verkenners al had ontdekt, maar ze moeten het opnieuw van nul af herontdekken.
  • De Verspilling: De AI verspilt enorme hoeveelheden energie (rekenkracht) door feiten die het al weet opnieuw af te leiden en paden opnieuw te bewandelen waarvan het al weet dat ze nergens toe leiden. Het is alsof een student een toets maakt, faalt, en vervolgens precies dezelfde toets opnieuw maakt zonder naar zijn eerdere fouten of aantekeningen te kijken.

De Oplossing: "Recycling Search Experience" (RSE)

De auteurs stellen een nieuwe strategie voor die Recycling Search Experience (RSE) heet. Denk hierbij aan het geven van een gedeeld, levend kaart aan de verkenners dat na elke ronde van verkenning wordt bijgewerkt.

In plaats van elke poging als een wegwerpexperiment te behandelen, behandelt RSE de zoektocht als een cumulatieve teaminspanning. Hier is hoe het werkt in drie eenvoudige stappen:

1. De "Distillatie" (Aantekeningen Maken)

Nadat een groep verkenners hun ronde heeft voltooid, gooit de AI niet zomaar hun ruwe, rommelige logs weg. In plaats daarvan treedt het op als een slimme redacteur die door het chaos leest en twee specifieke lijsten schrijft:

  • De "Goed Nieuws" Lijst (Positieve Ervaring): "Hé, we hebben ontdekt dat linksaf slaan bij de fontein een doodlopende weg is, maar rechtdoor gaan leidt naar een brug." Dit zijn geverifieerde feiten en afkortingen.
  • De "Slecht Nieuws" Lijst (Negatieve Ervaring): "Ga niet de donkere tunnel in; die leidt naar een put." Dit zijn bekende doodlopende wegen en logische valkuilen om te vermijden.

2. De "Gedeelde Bank" (Het Geheugen)

Deze lijsten worden opgeslagen in een Gedeelde Ervaringsbank. Dit is geen enorme, rommelige stapel papier; het is een gecureerde, georganiseerde database. De AI gebruikt een "deduplicatie"-filter om ervoor te zorgen dat het niet twee keer dezelfde notitie schrijft (bijvoorbeeld, het zal "Ga niet linksaf" niet tien keer opschrijven; het houdt slechts één duidelijke waarschuwing).

3. De "Gestuurde Zoektocht" (De Kaart Gebruiken)

Wanneer de volgende groep verkenners begint, beginnen ze niet vanaf nul. Ze krijgen deze Gedeelde Bank overhandigd.

  • Als ze een "Goed Nieuws"-notitie zien, kunnen ze de lange wandeling naar de brug overslaan en er direct naartoe gaan (de arbeid afkorten).
  • Als ze een "Slecht Nieuws"-notitie zien, draaien ze onmiddellijk weg van de donkere tunnel (de doodlopende wegen uitdunnen).

Waarom Dit Een Game Changer Is

Het artikel beweert dat deze methode veel efficiënter is dan de oude manieren.

  • Analogie: Stel je voor dat je probeert een specifieke naald in een hooiberg te vinden.
    • Oude Manier: Je stuurt 100 mensen om blind te graven. Ze graven allemaal dezelfde plekken, missen de naald en raken uitgeput.
    • RSE-Manier: De eerste 10 mensen graven, vinden aarde die niet de naald is, en markeren die plekken. De volgende 10 mensen krijgen te horen: "Graaf hier niet." Ze vinden ook een plek die misschien de naald is en markeren die. De volgende groep slaat de slechte plekken over en concentreert zich op de veelbelovende.
  • Het Resultaat: Je vindt het antwoord sneller en met minder energie omdat je geen tijd verspilt aan fouten die je al hebt gemaakt.

Wat Het Artikel Eigenlijk Vond

De onderzoekers testten dit op zeer moeilijke wiskundeproblemen (zoals die in hoogwaardige wedstrijden zoals de IMO of HMMT), programmeeruitdagingen en complexe planningsopdrachten (zoals het plannen van een meerdaagse reis).

  • Bessere Resultaten: De AI die RSE gebruikte, behaalde hogere scores dan andere methoden die gewoon probeerden "harder na te denken" of "meer pogingen te doen" zonder notities te delen.
  • Werkt op Moeilijke Problemen: Het was vooral goed in het oplossen van de moeilijkste problemen waar andere methoden vastzaten of opgaven.
  • Geen Extra Training: Het beste deel is dat de AI niet opnieuw getraind hoefde te worden. Het veranderde alleen hoe het tijdens de test naar antwoorden zocht, gebruikmakend van zijn eigen interne vermogen om zijn werk te bekritiseren.

De Conclusie

Het artikel stelt dat intelligentie niet alleen gaat om harder proberen; het gaat om onthouden wat je hebt geleerd. Door "wegwerp"-pogingen om te zetten in een "cumulatief" geheugen, stopt de AI met het verspillen van energie aan doodlopende wegen en redundante ontdekkingen, waardoor het slimmer en efficiënter wordt zonder dat er grotere hardware nodig is.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →