← Nieuwste papers
💬 NLP

Clarify, Abstain or Answer? Strategising in Conversation with Belief-Augmented Generation

Dit artikel stelt Belief-Augmented Generation (BAG) voor, een raamwerk dat gebruikmaakt van de eigen overtuigingsstatus van een LLM, afgeleid uit meerdere gesampelde antwoorden, om autonoom te beslissen of er in ambiguïteitvolle gesprekken moet worden geantwoord, verduidelijking moet worden gevraagd of moet worden afgezien, waardoor de nauwkeurigheid en de trouw aan de strategie worden verbeterd ten opzichte van standaard prompting.

Oorspronkelijke auteurs: Joris Baan, Wilker Aziz, Barbara Plank, Raquel Fernández

Gepubliceerd 2026-05-26
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Joris Baan, Wilker Aziz, Barbara Plank, Raquel Fernández

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Kernprobleem: De "Oververzekerde" AI

Stel je voor dat je een groot taalmodel (LLM) een lastige vraag stelt, zoals: "Wie zong het vrouwelijke deel op 'Gimme Shelter'?"

Als je een standaard AI vraagt, kiest deze meestal gewoon één antwoord en zegt het met volledige zekerheid, zelfs als het raadt. Het kan zeggen: "Het was Merry Clayton", zonder te beseffen dat als je de live tour-versie bedoelde, het antwoord eigenlijk "Lisa Fischer" is. De AI weet niet dat ze het niet zeker weet; ze doet gewoon alsof ze alles weet.

De onderzoekers ontdekten dat deze modellen zelden zeggen: "Ik weet niet zeker welke je bedoelt" of "Ik weet het antwoord niet". Ze raden gewoon.

De Oplossing: "Belief-Augmented Generation" (BAG)

De auteurs stellen een nieuwe methode voor die Belief-Augmented Generation (BAG) heet. Zie dit als het geven van een "denkkamer" aan de AI voordat ze spreekt.

In plaats van direct één antwoord te genereren, wordt de AI gevraagd eerst 10 verschillende mogelijke antwoorden op dezelfde vraag te genereren. Vervolgens kijkt ze naar deze lijst van 10 antwoorden (wat het artikel haar "Belief State" noemt) en vraagt ze zichzelf af: "Wat vertellen deze 10 antwoorden me over hoe zeker ik ben?"

Op basis van wat ze in die lijst ziet, kiest de AI een van de drie strategieën:

  1. Direct Antwoorden: Als alle 10 antwoorden in de basis hetzelfde zijn (bijvoorbeeld: alle 10 zeggen "Merry Clayton"), weet de AI dat ze zeker is. Ze geeft een direct antwoord.
    • Analogie: Het is als een jury waar 10 juryleden het allemaal eens zijn over het vonnis. De voorzitter kondigt gewoon het resultaat aan.
  2. Verduidelijken: Als de 10 antwoorden in twee duidelijke groepen zijn gesplitst (bijvoorbeeld: 5 zeggen "Merry Clayton" en 5 zeggen "Lisa Fischer"), beseft de AI dat de vraag dubbelzinnig is. In plaats van te raden, vraagt ze de gebruiker om verduidelijking.
    • Analogie: Het is als een ober die aan tafel hoort dat men "Het special" wil, maar twee verschillende specials op het menu ziet. In plaats van te raden, vraagt de ober: "Bedoelde u het biefstuk of de vis?"
  3. Afzien (Zeggen "Ik weet het niet"): Als de 10 antwoorden overal tegenaan liggen en elkaar wild tegenspreken (bijvoorbeeld: één zegt "Merry Clayton", een ander zegt "The Beatles", weer een ander zegt "Een robot"), beseft de AI dat ze de feiten niet kent. Ze weigert beleefd om te antwoorden.
    • Analogie: Het is als een detective die 10 verschillende verdachten vindt zonder enig bewijs dat een van hen met de misdaad te maken heeft. De detective geeft toe: "Ik kan dit nog niet oplossen", in plaats van een willekeurige persoon te arresteren.

Hoe Ze Het Testten

De onderzoekers testten dit op een dataset van "Dubbelzinnige Vragen" (vragen die meerdere betekenissen kunnen hebben). Ze vergeleken:

  • Standaard AI: Geeft gewoon direct antwoord.
  • Alleen-Prompt AI: Krijgt de opdracht om "voorzichtig" te zijn, maar ziet haar eigen lijst met gissingen niet.
  • BAG AI: Ziet haar eigen lijst van 10 gissingen en redeneert erover na.

De Resultaten

  • Betere Nauwkeurigheid: De BAG-methode verbeterde de nauwkeurigheid van de antwoorden bij zes verschillende AI-modellen.
  • Slimmere Keuzes: De BAG AI was veel beter in het weten wanneer ze een vraag moest stellen en wanneer ze moest toegeven dat ze het niet wist. De standaard AI vroeg bijna nooit om hulp of gaf onwetendheid toe.
  • Betrouwbaarheid: De keuzes van de BAG AI kwamen veel beter overeen met haar interne "zekerheid" (de diversiteit van haar 10 gissingen) dan bij de andere methoden. Als ze verward was, deed ze verward; als ze zeker was, deed ze zeker.

Het Nadeel

Hoewel het systeem goed werkt, is het voor de AI nog steeds moeilijk om perfect het verschil te zien tussen:

  • Echte Dubbelzinnigheid: "Ik weet niet of je de film of het boek bedoelt." (Behoefte aan Verduidelijking).
  • Hallucinaties: "Ik verzin feiten omdat ik het niet weet." (Behoefte aan Afzien).

Soms denkt de AI dat een vraag dubbelzinnig is, terwijl ze eigenlijk gewoon dingen verzonnen, of andersom. Maar over het algemeen maakt het geven van de AI de kans om "naar haar eigen werk te kijken" voordat ze spreekt, haar een veel eerlijkere en behulpzamere gesprekspartner.

Samenvatting

Het artikel introduceert een manier om AI-modellen minder oververzekerde te maken. Door ze te dwingen eerst meerdere antwoorden te genereren en vervolgens de verschillen te analyseren, leren de modellen om te Verduidelijken als ze verward zijn, Af te zien als ze niets weten, en Antwoorden alleen als ze zeker zijn. Dit maakt ze beter in het hanteren van lastige, real-world vragen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →