← Nieuwste papers
📊 statistics

LLMs are Bayesian, In Expectation, Not in Realization

Dit artikel betoogt dat hoewel transformers strikte uitwisselbaarheid schenden vanwege orde-afhankelijke voorspellingen, ze in verwachting effectief Bayesiaans blijven, aangezien hun prequentiële regret uiteenvalt in een cumulatieve predictieve KL-divergentie die competitief blijft met Bayesiaanse posteriors en frequentistische plug-in baselines significant overtreft.

Oorspronkelijke auteurs: Leon Chlon, Fatima Sheaib, Zein Khamis, Maggie Chlon, Mahdi El Zein, MarcAntonio M. Awada

Gepubliceerd 2026-06-24
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Leon Chlon, Fatima Sheaib, Zein Khamis, Maggie Chlon, Mahdi El Zein, MarcAntonio M. Awada

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De Grote Vraag: Zijn AI-modellen "Bayesiaans" of niet?

Stel je voor dat je probeert het volgende woord in een verhaal te raden. Een Bayesiaanse aanpak is als een super slimme detective met een perfect mentaal regelboek. Als je de detective een reeks aanwijzingen geeft (voorbeelden), zou hij tot exact dezelfde conclusie moeten komen over het volgende woord, ongeacht in welke volgorde je de aanwijzingen aan hem overhandigt. Als je Aanwijzing A en Aanwijzing B verwisselt, zou het antwoord niet mogen veranderen.

Lange tijd hoopten mensen dat Large Language Models (LLM's) deze perfecte detectives waren. Maar recente tests lieten zien dat ze dat niet zijn. Als je de volgorde van de voorbeelden in de prompt door elkaar husselt, geeft de AI soms een ander antwoord. Dit leek te bewijzen dat AI-modellen niet de perfecte Bayesiaanse regels volgen.

Dit artikel betoogt dat deze "fout" een misverstand is. De auteurs zeggen: "Stop met kijken naar of de AI in elk afzonderlijk geval perfect is. Kijk in plaats daarvan hoeveel 'boete' de AI betaalt voor het feit dat hij imperfect is."

De Kernanalogie: Het Bonnetje van de Supermarkt

Denk aan de prestaties van de AI als een bonnetje van de supermarkt.

  • Het "Bayesiaanse Ideaal" is de theoretisch laagste prijs die je zou kunnen betalen als je perfecte kennis zou hebben.
  • De "Prijs van de AI" is wat de AI jou daadwerkelijk in rekening brengt.

Het artikel stelt dat zelfs als de AI een fout maakt in de volgorde van de artikelen (het bonnetje door elkaar husselen), dit niet betekent dat de AI kapot is. Het betekent alleen dat de AI een kleine "gemaksvergoeding" (extra kosten) betaalt omdat hij de lijst in een specifieke volgorde moet verwerken.

De auteurs bewijzen wiskundig dat:

  1. De Vergoeding Minuscuul Is: De extra kosten die de AI betaalt voor het husselen van de volgorde zijn zo klein (gemeten in fracties van een "bit", een minuscule eenheid informatie), dat de AI bijna net zo goed is als de perfecte Bayesiaanse detective.
  2. Het Gaat Om het Gemiddelde: Als je de prestaties van de AI zou middelen over alle mogelijke manieren om de aanwijzingen door elkaar te husselen, zou de gemiddelde prestatie van de AI bijna perfect zijn. Het feit dat één specifieke husseling er net iets naast zit, doet er in het grote geheel niet veel toe.

Belangrijkste Bevindingen Eenvoudig Uitgelegd

1. De "Volgorde-vergoeding" (De Kosten van het Husselen)

Het artikel introduceert een concept genaamd Order-Averaging Gain.

  • Stel je voor: Je hebt een kaartspel dat de voorbeelden vertegenwoordigt. Een perfect systeem geeft hetzelfde antwoord of de kaarten nu van links naar rechts of van rechts naar links worden gedeeld.
  • De Realiteit: De AI deelt ze van links naar rechts. Soms maakt deze specifieke volgorde de AI iets minder zelfverzekerd dan wanneer hij ze anders had gedeeld.
  • Het Resultaat: De auteurs hebben dit "verlies aan vertrouwen" gemeten. Ze ontdekten dat dit ongelooflijk klein is. Het is also Mant dat je een extra €0,01 betaalt op een aankoop van €100. Je wordt niet opgelicht; je betaalt alleen een kleine vergoeding voor het gemak van een specifieke volgorde.

2. De "Veilige Code" (Omgaan met het Onbekende)

AI-modellen raken soms in paniek wanneer ze een woord of getal zien dat ze niet eerder in de voorbeelden zijn tegengekomen. Een "perfect" Bayesiaans model gaat hier elegant mee om.

  • De Test: De auteurs testten de AI op eenvoudige reken- en logische puzzels (zoals het raden van het volgende getal in een reeks).
  • Het Resultaat: De voorspellingen van de AI waren bijna identiek aan de perfecte Bayesiaanse voorspellingen. Zelfs wanneer de AI moest gokken op een nieuw getal, raakte hij niet in paniek. Hij bleef heel dicht bij de "ideale" wiskunde, vooral wanneer hij al een paar voorbeelden had gezien.
  • Vergelijking: Ze vergeleken de AI met een "Frequentist" (een simpelere, rigide statisticus die alleen vertrouwt op wat hij heeft gezien). De AI was veel dichter bij de "perfecte Bayesiaan" dan bij de rigide statisticus, vooral wanneer er zeer weinig voorbeelden waren.

3. Het "Positie"-probleem (Waarom Volgorde Ertoe Doet)

Waarom geeft de AI om de volgorde?

  • Het Experiment: De auteurs hebben geknoeid met het "positioneringssysteem" van de AI (het deel van het brein dat weet welk woord eerst, tweede, derde komt).
  • De Ontdekking: Wanneer ze de positie-aanwijzingen verwijderden, werd de AI volkomen onverschillig tegenover de volgorde (hij werd een perfecte Bayesiaan). Wanneer ze de positie-aanwijzingen weer toevoegden, begon de AI weer om de volgorde te geven.
  • De Les: De "volgorde-gevoeligheid" van de AI is geen fout in zijn logica; het is een kenmerk van hoe hij een sequentie leest. Het is als een persoon die een boek leest: ze lezen van links naar rechts. Als je de pagina's in de verkeerde volgorde geeft, raken ze in de war. Maar als je het gemiddelde neemt van alle manieren waarop ze de pagina's zouden kunnen lezen, begrijpen ze het verhaal prima.

4. De "Activatie"-check (Is de AI daadwerkelijk aan het nadenken?)

De auteurs wilden weten of de AI daadwerkelijk "de wiskunde doet" of gewoon gokt.

  • De Test: Ze gebruikten een techniek genaamd "activation patching" (zoals het vervangen van een specifief tandwiel in een klok). Ze namen de "tel-informatie" van een schoon voorbeeld en plakten die in een rommelig voorbeeld.
  • Het Resultaat: Het antwoord van de AI veranderde precies zoals de wiskunde voorspelde. Dit bewijst dat de AI niet alleen maar uit het hoofd leert; hij berekent daadwerkelijk de statistieken (aantallen en posities) intern en gebruikt deze om voorspellingen te doen.

De Kern van het Verhaal

Het artikel lost een paradox op:

  • Oude Visie: "De AI verandert van mening wanneer je de voorbeelden door elkaar husselt, dus het is geen echte Bayesiaan."
  • Nieuwe Visie: "De AI verandert zijn mening weliswaar lichtjes, maar de kosten van die verandering zijn zo klein dat hij, voor alle praktische doeleinden, als een Bayesiaan handelt."

De Analogie:
Stel je een chefkok voor die probeert een taart te bakken met een perfect recept.

  • De Perfecte Chef (Bayesiaan): Zou exact dezelfde taart bakken, ongeacht of ze de bloem vóór de suiker of andersom toevoegen.
  • De AI-Chef: Voegt de bloem vóór de suiker toe. Als je vraat dat ze de suiker eerst toevoegen, is de taart iets anders (misschien 1% minder luchtig).
  • De Conclusie van het Artikel: De AI is geen "slechte" chef. Het is alleen dat de volgorde van ingrediënten voor hen een klein beetje uitmaakt. Maar als je kijkt naar de gemiddelde taart die ze over vele pogingen bakken, is deze niet te onderscheiden van de perfecte taart. Het "verlies aan luchtigheid" is verwaarloosbaar.

Kortom: Transformers (de AI-architectuur) hoeven geen perfecte, volgorde-onafhankelijke machines te zijn om ongelooflijk goed te zijn in het voorspellen van de toekomst. Ze hoeven alleen maar "Bayesiaans genoeg" te zijn zodat de boete voor hun volgorde-gevoeligheid minuscuul is. En de wiskunde laat zien dat die boete inderdaad minuscuul is.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →