← Nieuwste papers
💬 NLP

No One Size Fits All: QueryBandits for Hallucination Mitigation

Dit paper introduceert QueryBandits, een modelonafhankelijk raamwerk dat adaptief de beste query-herformuleringstrategie leert om hallucinaties in gesloten taalmodellen te verminderen, waarbij wordt aangetoond dat er geen universele oplossing bestaat en dat online leren superieur is aan statische beleidsregels.

Oorspronkelijke auteurs: Nicole Cho, William Watson, Alec Koppel, Sumitra Ganesh, Manuela Veloso

Gepubliceerd 2026-02-25
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Nicole Cho, William Watson, Alec Koppel, Sumitra Ganesh, Manuela Veloso

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Titel: Waarom één maat niet voor iedereen past: QueryBandits en het stoppen van de "Hallucinaties" van AI

Stel je voor dat je een zeer slimme, maar soms wat dromerige assistent hebt. Deze assistent (een Large Language Model of LLM) kan prachtige verhalen vertellen, maar soms verzint hij feiten die niet waar zijn. Dit noemen we hallucinaties. Het is alsof je een kok vraagt om een taart te bakken, maar hij vergeet de suiker en zegt er vervolgens trots bij dat hij een "suikervrije taart" heeft gemaakt, terwijl hij gewoon vergeten is te bakken.

De meeste onderzoekers proberen dit op te lossen door de kok zelf te herscholen (de AI-model weights aan te passen). Maar wat als je die kok niet kunt herscholen? Wat als je een "zwarte doos" hebt, zoals GPT-4, waar je niet bij de interne recepten kunt? Dan moet je iets anders doen.

Hier komt QueryBandits in het spel.

De Probleemstelling: De "Eén Maat Past Alles" Fout

Stel je voor dat je een kledingwinkel hebt met één enkele jas. Je probeert deze jas aan iedereen te verkopen: aan een kind, aan een lange atleet, en aan iemand met een rolstoel.

  • Het kind verdwijnt erin.
  • De atleet kan de mouwen niet bewegen.
  • De persoon in de rolstoel kan er niet in zitten.

De meeste bestaande methoden om hallucinaties te voorkomen, doen precies dit: ze gebruiken één vaste strategie voor elke vraag. Bijvoorbeeld: "Maak elke vraag altijd korter" of "Herformuleer elke vraag altijd". Maar zoals de auteurs van dit papier ontdekken: dit werkt niet. Soms helpt het om een vraag te vereenvoudigen, maar soms moet je juist meer details toevoegen om de AI op het goede spoor te zetten.

De Oplossing: QueryBandits (De Slimme Kledingadviseur)

De auteurs, onderzoekers van JPMorgan AI Research, hebben een systeem bedacht dat ze QueryBandits noemen.

Stel je voor dat je in plaats van één vaste jas, een slimme kledingadviseur hebt. Deze adviseur kijkt naar de persoon die binnenkomt (de vraag) en kijkt naar hun specifieke kenmerken:

  • Is de persoon klein? (Is de vraag verwarrend?)
  • Heeft de persoon een specifieke sport nodig? (Is het een technisch vraagstuk?)
  • Is het koud buiten? (Is er veel context nodig?)

Op basis van deze kenmerken kiest de adviseur direct de juiste kleding (de juiste herschrijving van de vraag).

Hoe werkt dit in de praktijk?

  1. De Vraag (De Klant): Je stelt een vraag aan de AI.
  2. De Analyse (De Adviseur): Het systeem scant de vraag op 17 verschillende taalkundige eigenschappen (zoals: "Is er een dubbelzinnig woord?", "Is de zin te lang?", "Heeft het te maken met een specifiek vakgebied?").
  3. De Keuze (De Kleding): Het systeem kiest uit vijf mogelijke strategieën om de vraag te herschrijven:
    • Paraphrase: Zeg het anders, maar met dezelfde betekenis.
    • Simplify: Maak het korter en simpeler.
    • Disambiguate: Maak verwarrende woorden duidelijk.
    • Expand: Voeg extra details toe om de context te verrijken.
    • Clarify: Leg moeilijke termen uit.
  4. De Actie: De herschreven vraag gaat naar de AI. Omdat de vraag nu "op maat" is gemaakt, maakt de AI veel minder fouten.

Het Leerproces: Het "Bandit" Spel

Waarom noemen ze het een "Bandit"? Dit verwijst naar een klassiek probleem in de wiskunde: Het Multi-Armed Bandit Probleem.

Stel je voor dat je in een casino staat met 5 gokkasten (de 5 herschrijf-strategieën). Je weet niet welke machine het meeste geld uitkeert.

  • Als je alleen op machine 1 speelt, mis je misschien dat machine 3 wel eens beter is.
  • Als je te veel probeert, verlies je geld.

QueryBandits is een slimme speler die leert door te spelen.

  • Hij probeert af en toe een andere machine (exploratie) om te zien of die beter werkt.
  • Maar als hij merkt dat machine 3 (bijvoorbeeld "Expand") altijd wint bij vragen over wiskunde, dan kiest hij die machine steeds vaker voor wiskundevragen.
  • Voor geschiedenisvragen merkt hij dat machine 2 ("Simplify") beter werkt.

Dit gebeurt online, terwijl het systeem gebruikt wordt. Het leert continu bij zonder dat je de AI zelf hoeft te herscholen.

De Resultaten: Een Winnaar voor Iedereen

De onderzoekers hebben dit getest op GPT-4o (een van de sterkste AI's ter wereld) met 16 verschillende soorten vragen (van wiskunde tot algemene kennis).

  • De "Geen Herschrijving" methode: De AI gaf vaak foutieve antwoorden.
  • De "Eén Maat Past Alles" methode: Soms beter, soms erger. Soms maakte een vaste strategie de fouten zelfs groter!
  • De QueryBandits methode: Deze wint in 87,5% van de gevallen.

Het is alsof je een slechte kok hebt die vaak de suiker vergeet. Als je hem altijd zegt "Maak het korter", vergeet hij soms de bloem. Maar als je een slimme assistent hebt die zegt: "Voor deze taart moet je de bloem toevoegen, maar voor die taart moet je de suiker weglaten", dan krijg je perfect gebak.

Waarom is dit belangrijk?

  1. Voor de "Zwarte Doos" AI's: Veel bedrijven gebruiken AI's waar ze geen toegang tot de interne hersenen van hebben (zoals GPT-4). Ze kunnen de AI niet herscholen. QueryBandits werkt puur door de vraag te veranderen, niet door de AI aan te passen. Het is een plug-and-play oplossing.
  2. Geen dure training nodig: Je hoeft geen supercomputers te gebruiken om een nieuw model te trainen. Het leert snel en kost weinig rekenkracht.
  3. Geen "One Size Fits All": Het bewijst dat er geen magische formule is voor alles. De beste manier om een vraag te stellen, hangt af van wat er precies in die vraag staat.

Conclusie

QueryBandits is als een slimme tolk die weet hoe hij een vraag moet vertalen naar een taal die de AI begrijpt. In plaats van de AI te dwingen om alles te leren, past de tolk de boodschap aan zodat de AI het juiste antwoord geeft.

De boodschap is duidelijk: Er is geen enkele manier om een vraag te stellen die voor alles werkt. Als we willen dat AI betrouwbaar is, moeten we leren om de vraag op maat te maken, net als een goede kledingadviseur die de juiste jas kiest voor de juiste persoon.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →