← Nieuwste papers
📊 statistics

More Bang for the Buck: Improving the Inference of Large Language Models at a Fixed Budget using Reset and Discard (ReD)

Dit artikel introduceert Reset-and-Discard (ReD), een querystrategie die de dekking van unieke vragen die door grote taalmodellen worden opgelost optimaliseert binnen een vast budget door de afnemende meeropbrengsten van traditionele pass@k-sampling te verzachten via een op de machtswet gebaseerde allocatie.

Oorspronkelijke auteurs: Sagi Meir, Tommer D. Keidar, Noam Levi, Shlomi Reuveni, Barak Hirshberg

Gepubliceerd 2026-06-09
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Sagi Meir, Tommer D. Keidar, Noam Levi, Shlomi Reuveni, Barak Hirshberg

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Plaatje: Het "Raadspel"-probleem

Stel je voor dat je een grote zak met raadsels (vragen) hebt en een beperkte hoeveelheid geld om gokjes (pogingen) te kopen van een slimme maar soms koppige vriend (een Large Language Model of LLM). Je doel is niet alleen om één echt moeilijk raadsel op te lossen; je doel is om zo veel mogelijk verschillende raadsels op te lossen voordat je door je geld heen bent.

Het paper behandelt een veelvoorkomende fout die mensen maken tijdens dit spel.

De Oude Manier: "De Koppige Gokkker" (Solve-to-Completion)

Momenteel gebruiken de meeste mensen een strategie die de auteurs "Solve-to-Completion" noemen.

  • Hoe het werkt: Je kiest Raadsel #1. Je vraagt je vriend om een antwoord. Als hij het fout heeft, vraag je het opnieuw. En opnieuw. En opnieuw. Je blijft Raadsel #1 vragen totdat hij het eindelijk goed heeft. Pas dan ga je over naar Raadsel #2.
  • Het Probleem: Sommige raadsels zijn gewoon echt, echt moeilijk. Je vriend kan misschien 50 pogingen nodig hebben voor Raadsel #1. Tegen de tijd dat hij Raadsel #1 eindelijk heeft opgelost, heb je al 50 pogingen verspild. Je hebt dan nul pogingen meer over voor de Raadsels #2 tot en met #100. Je hebt één moeilijk ding opgelost, maar je hebt de 99 makkelijke dingen gemist.
  • Het Resultaat: Naarmate je meer geld uitgeeft, groeit het aantal nieuwe opgeloste raadsels steeds langzamer. Het is als proberen een emmer te vullen met een lekkende tuinslang; hoe harder je duwt, hoe minder water er daadwerkelijk in komt.

De Nieuwe Manier: "De Breedlerig Verkennende" (Reset-and-Discard / ReD)

De auteurs stellen een nieuwe strategie voor genaamd Reset-and-Discard (ReD).

  • Hoe het werkt:
    1. Je kiest Raadsel #1 en vraagt je vriend één keer om een antwoord.
    2. Als hij het goed heeft, vier je dat, gooi je het raadsel weg (Discard) en ga je naar Raadsel #2.
    3. Als hij het fout heeft, blijf je niet doorvragen. Je stopt onmiddellijk, legt dat raadsel even opzij en gaat door naar Raadsel #2.
    4. Je loopt de hele lijst met raadsels door en vraagt elk raadsel precies één keer (of een paar keer).
    5. Zodra je de hele lijst hebt doorlopen, ga je terug naar het begin en probeer je de raadsels die nog steeds niet zijn opgelost.
  • De Analogie: Stel je voor dat je een brandweerman bent die veel kleine brandjes probeert te blussen. In plaats van voor één koppig brandje te staan en water op dat ene brandje te spuiten totdat het uit is (terwijl je de andere brandjes in de buurt negeert die ook uitbreiden), spuit je een beetje water op elk brandje. Als een brandje uitgaat, laat je het met rust. Als het nog steeds brandt, kom je er later op terug.
  • Het Resultaat: Je lost een enorm aantal raadsels heel snel op. Zelfs als je de moeilijkste raadsels niet meteen oplost, los je alle makkelijke en gemiddelde raadsels eerst op. Dit geeft je veel meer "bang for your buck" (meer waar voor je geld).

De Wetenschap Achter de Magie

Het paper gebruikt wiskunde om te bewijzen waarom dit zo goed werkt.

  1. De Wet van de Macht (Power Law): De auteurs merkten op dat voor deze AI-modellen de kans op het oplossen van een probleem volgens een specifiek wiskundig patroon afneemt (een "power law"). Kort gezegd: hoe moeilijker het probleem, hoe exponentieel moeilijker het wordt om het op te lossen.
  2. De "Verminderde Meeropbrengst"-valstrik: Onder de oude "Koppige Gokker"-methode betekent deze wiskunde dat je, naarmate je meer geld uitgeeft, steeds minder nieuwe opgeloste problemen krijgt.
  3. De Oplossing: De "Reset-and-Discard"-methode doorbreekt deze valstrik. De wiskunde laat zien dat door na elke poging (of een paar pogingen) te resetten, je die trage, afnemende groei verandert in constante, lineaire groei. Je krijgt een constante stroom van opgeloste problemen, ongeacht hoeveel pogingen je doet.

Belangrijkste Bevindingen uit de Experimenten

De auteurs hebben dit getest op echte AI-modellen (zoals Llama en GPT) met drie soorten uitdagingen:

  • Coderen: Het schrijven van computerprogramma's.
  • Wiskunde: Het oplossen van wiskundige woordproblemen.
  • Redeneren: Het beantwoorden van complexe meerkeuzevragen.

Wat ze ontdekten:

  • Meer Oplossingen: Met hetzelfde budget lost ReD aanzienlijk meer unieke problemen op dan de oude methode.
  • Goedkoper: Om een specifiek doel te bereiken (zoals het oplossen van 80% van de problemen), vereiste ReD minder pogingen, minder computer tokens en minder echt geld.
  • Werkt met Imperfecte Controleurs: Zelfs als het systeem dat de antwoorden controleert fouten maakt (soms "fout" zegt terwijl het goed is, of andersom), wint ReD het nog steeds.
  • De Toekomst Voorspellen: De auteurs lieten ook zien dat je door ReD te gebruiken, je daadwerkelijk kunt achterhalen hoe slim de AI is (de "power-law exponent") zonder dat je duizenden dure tests hoeft uit te voeren. Het is alsoer dat je de snelheid van een auto kunt raden door hem slechts een paar seconden te zien rijden, in plaats van een volledige race te timen.

De Kern van het Verhaal

Als je een vast budget hebt om een AI een lijst met problemen te laten oplossen, blijf dan niet hameren op de moeilijke gevallen. Probeer in plaats daarvan elk probleem één keer, gooi de opgeloste raadsels weg, en kom terug bij de raadsels die je hebt gemist. Deze "Reset-and-Discard"-strategie laat je veel meer problemen oplossen voor dezelfde prijs, waardoor een traag, frustrerend proces verandert in een efficiënte, hogesnelheidsmachine.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →