← Nieuwste papers
🤖 machine learning

To Answer or to Abstain: Mitigating Search-Agent Hallucinations via Abstention-Aware Reinforcement Learning

Dit artikel introduceert Abstention-Aware Reinforcement Learning (AWA-RL), een nieuw trainingsparadigma dat onthoudingsbeloningen dynamisch vormgeeft om hallucinaties van zoekagenten te beperken door modellen aan te moedigen te onthouden van het beantwoorden wanneer de ophaalprocedure faalt, waardoor de precisie en betrouwbaarheid aanzienlijk worden verbeterd met minimale opoffering van de ruwe nauwkeurigheid.

Oorspronkelijke auteurs: Fengji Zhang, Tianyu Fan, Yuxiang Zheng, Xinyao Niu, Chengen Huang, Jacky Keung, Bei Chen

Gepubliceerd 2026-07-14
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Fengji Zhang, Tianyu Fan, Yuxiang Zheng, Xinyao Niu, Chengen Huang, Jacky Keung, Bei Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een super-slimme robotvriend hebt die ervan houdt om je vragen te beantwoorden. Je vraagt hem: "Wat is de hoofdstad van Frankrijk?" en hij zegt: "Parijs!" Geweldig. Maar dan vraag je hem: "Wat is het geheime recept voor de onzichtbare soep van de Keizer?" en in plaats van te zeggen: "Ik weet het niet," verzint de robot vol vertrouwen een verhaal over "ghost-chili en maanstof." Hij probeert niet gemeen te zijn; hij is gewoon te graag wilwillig. In de wereld van AI noemen we dit een hallucinatie, en dat is een groot probleem wanneer de robot de bedoeling heeft om op het internet naar echte feiten te zoeken.

Lange tijd probeerden wetenschappers dit op te lossen door de robot te leren het web te doorzoeken. Ze gebruikten een trainingsmethode genaamd Reinforcement Learning (RL), wat lijkt op een videogame waarin de robot punten krijgt voor het vinden van het juiste antwoord. Maar hier is de crux: het spel gaf alleen punten voor het krijgen van het antwoord. Het gaf geen punten voor het weten wanneer je moet stoppen. Dus, wanneer de robot het antwoord niet kon vinden, bleef hij maar gokken en verzon hij feiten om die punten te scoren. Het was als een student die, in plaats van zijn hand op te steken om te zeggen "Ik weet het niet", gewoon het antwoord gokt tijdens een toets om niet gênant over te komen.

De auteurs van dit artikel, Fengji Zhang en zijn team, zeggen: "Wacht eens even! We moeten de robot leren om te zeggen 'Ik weet het niet' als hij vastloopt." Maar ze realiseerden zich ook dat het simpelweg vertellen van de robot dat hij "Ik weet het niet" moet zeggen, niet genoeg is. Als je de robot te hard straft voor gokken, kan hij bang worden en zelfs de gemakkelijke vragen stoppen met beantwoorden. Dat heet "lazy refusal" (luie weigering), en dat is net zo erg als dingen verzinnen.

Dus bedachten ze een nieuwe trainingsmethode genaam AWA-RL (Abstention-Aware Reinforcement Learning). Denk aan een zeer slimme coach die de robot ziet spelen. In plaats van een vaste regel zoals "Als je niet 100% zeker bent, geef dan geen antwoord," kijkt de coach naar de specifieke vraag.

  • De "moed"-factor: De coach heeft een speciale draaiknop genaamd de "moed"-factor (vertegenwoordigd door de Griekse letter gamma, γ\gamma). Deze draaiknop regelt hoe dapper de robot moet zijn.
    • Als de draaiknop hoog staat, is de robot super dapper en probeert hij alles te beantwoorden, zelfs als hij het niet zeker weet.
    • Als de draaiknop laag staat, is de robot super voorzichtig en zegt hij bij bijna alles "Ik weet het niet."
    • De magie van AWA-RL is dat de coach de beloning van de robot dynamisch aanpast op basis van hoe moeilijk de vraag is en hoe de robot er op dat moment voor staat. Als de robot het goed doet, moedigt de coach hem aan om het te proberen. Als de robot te veel begint te gokken, trekt de coach hem voorzichtig terug.

Het team testte dit op drie lastige puzzelspellen (datasets genaamd HotpotQA, 2WikiMultiHopQA en MuSiQue) waarbij de robot door Wikipedia moest zoeken om antwoorden te vinden. Ze vergeleken hun nieuwe methode met de oude manieren:

  1. Het simpelweg mengen van "Ik weet het niet"-voorbeelden: Dit werkte niet goed. De robot raakte ofwel in de war, of begon zelfs bij gemakkelijke vragen "Ik weet het niet" te zeggen.
  2. Het geven van een vaste "straf" voor gokken: Dit was als het gebruiken van een sloophamer om een noot te kraken. Als de straf te zwaar was, stopte de robot met het beantwoorden van alles (99,9% weigering!). Als de straf te licht was, bleef de robot dingen verzinnen.

Wat hebben ze gevonden?
De AWA-RL-methode was een gamechanger. Door die dynamische "moed"-draaiknop te gebruiken, ontdekten ze een "sweet spot" (rond een moed-factor van 0,20) waar de robot veel betrouwbaarder werd.

  • Het verhoogde de Precisie van de robot (hoe vaak hij het goed had wanneer hij wel antwoord gaf) met wel 10,3%.
  • Het verbeterde hun nieuwe score, genaamd RA-F1 (die een balans vindt tussen behulpzaamheid en eerlijkheid), met 2,9% tot 5,2%, afhankelijk van de opstelling.
  • Het beste deel? De robot verloor niet veel van zijn algemene vermogen om vragen te beantwoorden. Hij stopte alleen met het verzinnen van feiten wanneer hij vastliep.

Het artikel laat zien dat deze methode heel goed werkt in deze specifieke tests, maar de auteurs zijn voorzichtig in hun opmerking dat ze nog niet elke soort robot of elke soort vraag hebben getest. Ze merken ook op dat de "moed"-draaiknop voor nu door mensen moet worden afgesteld, hoewel ze hopen dit in de toekomst automatisch te kunnen maken.

Kortom, AWA-RL leert de AI om een zelfverzekerde expert te zijn die zijn grenzen kent, in plaats van een alleswetende die dingen verzint. Het is een stap richting AI-agenten die niet alleen slim zijn, maar ook betrouwbaar.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →