← Nieuwste papers
🤖 AI

Embedding by Elicitation: Dynamic Representations for Bayesian Optimization of System Prompts

Het artikel introduceert ReElicit, een Bayesiaanse optimalisatieframework dat gebruikmaakt van grote taalmodellen om dynamisch adaptieve, interpreteerbare feature-embeddings te eliciteren uit geaggregeerde feedback, waardoor een efficiënte optimalisatie van variabele lengte systeemprompts mogelijk wordt zonder labels per voorbeeld.

Oorspronkelijke auteurs: Zhiyuan Jerry Lin, Benjamin Letham, Samuel Dooley, Maximilian Balandat, Eytan Bakshy

Gepubliceerd 2026-05-20
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zhiyuan Jerry Lin, Benjamin Letham, Samuel Dooley, Maximilian Balandat, Eytan Bakshy

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een zeer getalenteerde, maar licht koppige robot te leren vragen te beantwoorden. Je kunt niet direct met de robot praten om te zeggen: "Je hebt dit specifieke wiskundeprobleem verkeerd opgelost omdat je vergeten bent om de eenheid over te dragen." In plaats daarvan krijg je aan het einde van een lange dag slechts één getal: "Vandaag heeft de robot 85% van de vragen goed beantwoord."

Dit is het probleem dat het artikel aanpakt: Hoe verbeter je de instructies van een robot (een "systeemprompt") wanneer je alleen een vaag, algeheel cijfer krijgt en geen gedetailleerd rapport?

De auteurs, van Meta, stellen een nieuwe methode voor genaamd ReElicit. Hieronder wordt uitgelegd hoe dit werkt, opgesplitst in eenvoudige concepten:

1. Het Probleem: Het "Black Box"-Dilemma

Meestal, wanneer je een machine learning-model afstelt, heb je veel data. Je weet precies welke antwoorden goed waren en welke fout. Maar in de echte wereld (zoals een klantenservicebot) weet je misschien alleen dat "de klanttevredenheid deze week met 2% is gestegen".

Proberen de perfecte instructies te raden door zomaar woorden te veranderen en te hopen op het beste, is als proberen een specifieke naald in een hooiberg te vinden door willekeurige naalden ernaartoe te gooien. Het is te traag en inefficiënt.

2. De Oplossing: De "Vertaler"-robot

De auteurs realiseerden zich dat ze, in plaats van door miljoenen mogelijke zinnen te zoeken, een "slim" Groot Taalmodel (LLM) konden vragen om te fungeren als een vertaler.

Hier is de analogie:

  • Het Doel: Je wilt het perfecte cake-recept vinden, maar je krijgt na het bakken alleen een smaakcijfer (bijvoorbeeld "8/10"). Je kunt de ingrediënten niet individueel proeven.
  • De Oude Manier: Je raadt gewoon willekeurig nieuwe recepten.
  • De ReElicit-Manier: Je vraagt een meesterkok (het LLM) om naar je eerdere recepten en hun cijfers te kijken. De kok zegt: "Ik denk dat het geheim niet het meel of de suiker is; het is de balans tussen vanille en bakpoeder."

De kok maakt vervolgens een eenvoudige kaart (een "kenruimte") met slechts twee of drie assen:

  1. Hoeveel vanille? (0 tot 1)
  2. Hoeveel bakpoeder? (0 tot 1)

Nu zoek je niet langer door oneindige recepten, maar zoek je alleen naar de perfecte plek op deze kleine, eenvoudige kaart.

3. Het Proces: Een Drie-Stappen Dans

Het artikel beschrijft een lus waarin de computer drie dingen herhaaldelijk doet:

  1. Elicit (Vraag de Kok): Het systeem kijkt naar de prompts die het heeft geprobeerd en hun cijfers. Het vraagt het LLM: "Wat zijn de 2 of 3 belangrijkste 'ingrediënten' (semantische kenmerken) die een prompt goed maken voor deze specifieke taak?" Het LLM bedenkt deze kenmerken onderweg (bijvoorbeeld "helderheid van redenering" of "gebruik van voorbeelden").
  2. Optimize (De Navigator): Het systeem gebruikt een wiskundig hulpmiddel genaamd Bayesiaanse Optimalisatie. Denk hierbij aan een slimme navigator die naar de kaart kijkt en zegt: "We hebben de plek waar 'helderheid' hoog is en 'voorbeelden' gemiddeld zijn, nog niet geprobeerd. Laten we daarheen gaan." Het kiest een doelpunt op de kaart.
  3. Realize (De Bakker): Het systeem vraagt het LLM opnieuw: "Oké, schrijf een prompt die precies dat doelpunt op onze kaart raakt." Het LLM schrijft de nieuwe instructies. Het systeem test ze, krijgt een nieuw cijfer en de lus begint opnieuw.

4. Waarom Het Speciaal Is: "Re-eliciteren"

Het slimme deel is dat de "kaart" niet statisch is. Naarmate het systeem meer prompts probeert en meer cijfers krijgt, vraagt het het LLM om de kaart opnieuw te tekenen.

  • Misschien dacht het LLM in het begin dat "lengte" belangrijk was.
  • Maar na 10 pogingen realiseert het LLM zich: "Eigenlijk maakt lengte niet uit; het gaat erom hoe de instructies zijn gestructureerd."
  • Dus, het LLM werkt de kaart bij om dit nieuwe inzicht te weerspiegelen. Hierdoor kan het systeem zich aanpassen naarmate het leert.

5. De Resultaten

De auteurs hebben dit getest op 10 verschillende moeilijke taken (zoals het oplossen van wiskundeproblemen of het identificeren van sarcasme). Ze gaven ReElicit een zeer krappe budget: het mocht in totaal slechts 30 verschillende prompts testen.

  • De Wedstrijd: Ze vergeleken ReElicit met andere methoden die gewoon prompts raden, ze evolueren als bacteriën, of ze één voor één bekritiseren.
  • De Winnaar: ReElicit vond consequent de beste prompts. Het was beter in het vinden van de "naald in de hooiberg" omdat het stopte met willekeurig raden en begon met navigeren op een slimme, evoluerende kaart.

Samenvatting

Kortom, ReElicit is een methode die een AI gebruikt om zijn eigen taal te bedenken om te beschrijven wat een prompt goed maakt. In plaats van te zoeken door de rommelige, oneindige wereld van tekst, vertaalt het het probleem naar een eenvoudige, schone kaart, vindt het de beste plek op die kaart, en vertaalt die plek vervolgens terug naar een perfecte set instructies. Het doet dit door voortdurend zijn eigen kaart bij te werken naarmate het leert van nieuwe resultaten.

Het artikel beweert dat dit de meest effectieve manier is om AI-instructies af te stellen wanneer je alleen een enkel, algeheel cijfer hebt om je te leiden, in plaats van een gedetailleerde lijst met fouten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →