← Nieuwste papers
💬 NLP

Bandit-Based Prompt Design Strategy Selection Improves Prompt Optimizers

Dit artikel introduceert OPTS, een framework voor prompt-optimalisatie dat de prestaties van bestaande optimalisatoren zoals EvoPrompt verbetert door expliciete, op bandit-gebaseerde mechanismen (specifiek Thompson sampling) te implementeren om effectief prompt-ontwerpstrategieën te selecteren en toe te passen, waardoor het methoden die vertrouwen op impliciete strategie-selectie overtreft.

Oorspronkelijke auteurs: Rin Ashizawa, Yoichi Hirose, Nozomu Yoshinari, Kento Uchida, Shinichi Shirakawa

Gepubliceerd 2026-06-18
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Rin Ashizawa, Yoichi Hirose, Nozomu Yoshinari, Kento Uchida, Shinichi Shirakawa

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme maar soms koppige robot (een Large Language Model) probeert te leren hoe hij een moeilijke puzzel moet oplossen. Je geeft de robot instructies, die "prompts" worden genoemd. Als de instructies vaag zijn, raakt de robot in de war. Als ze perfect zijn, lost de robot de puzzel direct op.

Lange tijd hebben mensen geprobeerd om deze perfecte instructies handmatig te schrijven, of hebben ze computerprogramma's gebruikt om de instructies automatisch bij te sturen totdat ze beter werken. Dit wordt Prompt Optimization genoemd.

Echter, er is een probleem: deze automatische programma's creëren vaak instructies die weliswaar functioneel zijn, maar die het "geheime ingrediënt" missen dat menselijke experts gebruiken. Ze missen bewezen trucjes zoals "denk stap voor stap" of "gedraag je als een expert".

Het Probleem: Het Slechte Gokspelletje van de Robot

Onlangs probeerde een tool genaamd APET dit op te lossen. Het gaf de robot een menu van "ontwerpstrategieën" (zoals een menu met kooktechnieken: voeg zout toe, hak fijn, laat zachtjes pruttelen). De robot zou naar het menu moeten kijken en beslissen welke trucjes hij gaat gebruiken voor de specifieke puzzel.

Maar het artikel betoogt dat de robot vragen om deze keuze te maken, hetzelfde is als een vermoeide chef vragen te raden welk specerij de soep die is aangebrand kan redden. De robot raadt vaak fout, en kiest strategieën die de instructies eigenlijk slechter maken. Het is een impliciete keuze (de robot "voelt" gewoon aan dat hij een trucje moet gebruiken), en daar is hij niet goed in.

De Oplossing: OPTS (De Slimme Sommelier)

De auteurs van dit artikel introduceren een nieuwe methode genaamd OPTS (Optimizing Prompts with sTrategy Selection).

In plaats van de robot te laten raden, werkt OPTS als een slimme sommelier (een wijnexpert) of een casinomanager die een spel van kansen runt. Zo werkt het, gebruikmakend van een eenvoudige analogie:

Stel je voor dat je een rij gokautomaten hebt (de onderzoekers noemen deze "armen").

  • Machine 1: Voegt "Denk stap voor stap" toe aan de instructies.
  • Machine 2: Vertelt de robot: "Lees de vraag opnieuw."
  • Machine 3: Vertelt de robot: "Gedraag je als een wiskundige expert."
  • Machine K+1: Doet niets (houdt de instructies precies zoals ze zijn).

In de oude methode (APET) zou de robot simpelweg een hendel willekeurig overhalen of op basis van een onderbuikgevoel.

In de nieuwe OPসের methode gebruikt het systeem een wiskundige strategie genaamd Thompson Sampling. Denk aan dit als een slimme gokker die een scorekaart bijhoudt:

  1. Het probeert een machine (een strategie).
  2. Als de robot de puzzel beter oplost, geeft het systeem die machine een "duim omhoog" en maakt het deze waarschijnlijker om de volgende keer gekozen te worden.
  3. Als de robot faalt, geeft het systeem die machine een "duim omlaag" en stopt het met het kiezen van die machine.
  4. Cruciaal is dat het ook een "Niets doen"-machine bijhoudt. Als alle trucjes de boel slechter maken, leert het systeem om de instructies gewoon met rust te laten.

Wat Ze Vonden

De onderzoekers hebben dit getest op twee verschillende robots (LLM's) met een reeks zeer moeilijke logica- en redeneerpuzzels (genaamd BIG-Bench Hard).

  • Het Resultaat: Door deze "slimme gokkers"-aanpak te gebruiken om de juiste strategie te kiezen, creëerde het systeem veel betere instructies dan de robots zelf zouden kunnen doen.
  • De Kampioen: De Thompson Sampling-methode (de slimme gokker) was de duidelijke winnaar. Het verbeterde de prestaties van de prompt optimizer met wel 50% op sommige taken.
  • De Vergelijking: De oude methode (APET), waarbij de robot gokte, presteerde zelfs slechter dan wanneer men simpelweg strategieën willekeurig zou kiezen. Dit bewijst dat de robot slecht is in het raden welke trucjes hij moet gebruiken, maar dat hij heel goed is in het opvolgen van instructies als wij hem vertellen welke truc hij moet gebruiken.

De Kernboodschap

Dit artikel beweert niet dat het alle AI-problemen heeft opgelost of dat het al klaar is voor medische diagnoses. Het laat simpelweg zien dat wanneer we AI proberen te leren hoe ze beter kunnen communiceren, we de AI niet moeten laten raden welke onderwijsmethode ze moeten gebruiken. In plaats daarvan moeten we een slim, op data gebaseerd systeem gebruiken (zoals Thompson Sampling) om de beste onderwijstrucjes expliciet te kiezen, net zoals een coach die de juiste tactiek kiest voor een specifieke wedstrijdsituatie.

De code voor deze "slimme coach" is nu beschikbaar voor anderen om te gebruiken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →