← Nieuwste papers
📊 statistics

Total Variation Distance Estimation in Autoregressive Models

Dit artikel presenteert efficiënte algoritmen voor het schatten van de totale variatieafstand tussen twee autoregressieve distributies van lengte nn onder sample-, logit- en noisy logit-accesmodellen, wat significante verbeteringen biedt ten opzichte van eerdere methoden en praktisch nut demonstreert bij het kwantificeren van distributionele verschillen tussen moderne LLM-inferentie-engines.

Oorspronkelijke auteurs: Eric Price, Kevin Tian, Zhiyang Xun, Yusong Zhu

Gepubliceerd 2026-07-23
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Eric Price, Kevin Tian, Zhiyang Xun, Yusong Zhu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De Onzichtbare Verschillen Tussen AI-Tweelingen

Stel je voor dat je twee identieke tweelingen hebt. Ze zijn opgegroeid in exact hetzelfde huis, eten hetzelfde voedsel en hebben hetzelfde DNA. Als je hen een vraag stelt, verwacht je dat ze exact hetzelfde antwoord geven, woord voor woord. In de wereld van Kunstmatige Intelligentie, specififiek Large Language Models (LLM's), is het "DNA" de gewichten van het model—de wiskundige hersenkracht die opgeslagen is in een bestand. Maar in de echte wereld is het niet zo simpel. Net zoals tweelingen anders kunnen reageren afhankelijk van of ze moe zijn, honger hebben, of met een vriend praten, kunnen AI-modellen verschillende resultaten produceren afhankelijk van de computerhardware waarop ze draaien, hoeveel vragen ze tegelijkertijd beantwoorden, of zelfs door minuscule, onzichtbare foutjes in de softwarecode.

Om te meten hoe verschillend twee dingen zijn, gebruiken wetenschappers vaak een instrument genaamd "Total Variation Distance" (TV). Denk hierbij aan een "mismatch-meter". Als je twee zakken met knikkers hebt en je haalt uit elke zak één knikker, dan vertelt de TV-afstand je de maximale kans dat de twee knikkers een andere kleur hebben. Het is een perfecte score voor "hoe waarschijnlijk is het dat deze twee dingen het oneens zijn?". Dit is anders dan andere instrumenten die proberen te meten "hoe verrast" een model is, wat volledig kan vastlopen als de modellen het over zelfs één enkel woord oneens zijn. De grote vraag die onderzoekers stellen is: als twee bedrijven beweren exact hetzelfde AI-model te draaien, geven ze jou dan werkelijk dezelfde ervaring, of zijn er verborgen verschillen aanwezig in de code?

De Missie van het Papier: De Geesten in de Machine Vangen

Dit artikel, getiteld "Total Variation Distance Estimation in Autoregressive Models", is een detectiveverhaal over het vinden van die verborgen verschillen. De auteurs, een team van de University of Texas at Austin, realiseerden zich dat hoewel twee AI-engines op papier identiek lijken, de manier waarop ze daadwerkelijk tekst genereren uit elkaar kan lopen door zaken als "batching" (het tegelijkertijd beantwoorden van veel vragen) of "quantization" (het vereenvoudigen van getallen om ruimte te besparen). Ze wilden een betrouwbare manier ontwikkelen om de Total Variation Distance tussen twee AI-engines te meten om te zien hoe sterk ze van mening verschillen.

De auteurs ontdekten dat het meten van deze afstand lastig is omdat AI-modellen niet alleen antwoorden uitspugen; ze bouwen ze woord voor woord op, als een kettingreactie. Als je alleen het uiteindelijke antwoord krijgt te zien (zoals een sample), is dat alsof je probeet de plot van een film te raden door alleen de laatste scène te bekijken. Om dit op te lossen, ontwikkelden ze drie verschillende "superkrachten" of manieren om onder de motorkap te kijken, en ze ontdekten dat hoe meer je kunt zien, hoe gemakkelijker de taak wordt.

1. De "Sample" Superkracht (De Blinddoek-Gok)
De meest basale manier om een AI te controleren is door een vraag te stellen en te kijken wat het zegt. Dit wordt "sample access" genoemd. De auteurs ontdekten dat als je alleen dit zicht hebt, je een enorm groot aantal vragen aan de AI moet stellen om een goede meting te krijgen. Specifiek groeit het aantal vragen dat je nodig hebt met het kwadraat van de lengte van het verhaal (n2n^2) en de grootte van de "actieve" lijst van de vocabulaire (KK). Het is als het proberen in kaart te brengen van een enorm bos door een enkele pad te bewandelen; je moet het pad heel vaak bewandelen om zeker te weten dat je een verborgen open plek niet hebt gemist. Hun methode verbetert op eerdere pogingen en maakt het sneller, maar het vereist nog steeds een massaal aantal queries.

2. De "Logit" Superkracht (De Röntgenvisie)
Veel AI-systemen tonen ook hun "logits", de ruwe getallen die het model gebruikt om te beslissen welk woord volgt, voordat ze worden omgezet in een definitieve keuze. Dit is als het zien van het interne denkproces van de AI. De auteurs toonden aan dat als je toegang hebt tot deze getallen, de taak ongelooflijk makkelijk wordt. Je hebt slechts een aantal queries nodig dat lineair groeit met de lengte van het verhaal (nn). Het is een enorme sprong voorwaarts—alsof je overschakelt van wandelen door het bos naar vliegen over het bos in een helikopter. Ze bewezen dat dit de absoluut snelste manier is; je kunt het niet sneller doen dan dit.

3. De "Noisy Logit" Superkracht (Het Beslagen Venster)
Hier wordt het echt interessant. In de echte wereld zijn die "logit"-getallen niet altijd perfect. Soms is de computer druk, of is de software een klein beetje buggy, en komen de getallen een beetje wazig of "ruizig" terug. De auteurs realiseerden zich dat als je deze ruis behandelt als een bekende hoeveelheid (zoals weten hoe beslagen je raam is), je nog steeds een geweldige meting kunt krijgen. Ze creëerden een methode die de "blindfolded" en "X-ray" benaderingen vloeiend combineert. Als de ruis laag is, handel je alsof je röntgenvisie hebt. Als de ruis hoog is, handel je meer als wanneer je een blinddoek draagt. Dit is het meest praktische instrument omdat het werkt, zelfs wanneer de AI niet perfect functioneert.

Het Aan het Testen: De Real-World Showdown

Om te bewijzen dat hun methoden werken, bleven de auteurs niet alleen in het lab. Ze zetten een real-world experiment op waarbij ze twee populaire AI-engines vergeleken, vllm en sglang, die exact hetzelfde model (Qwen3-0.6B) draaien. Ze wilden zien of deze twee engines, die bedoeld zijn om identiek te zijn, daadwerkelijk dezelfde tekst produceerden.

Ze ontdekten dat de engines wel van mening verschilden. De Total Variation Distance tussen hen was ongeveer 0,586 voor een verhaal van 500 woorden. Dit getal vertegenwoordigt het maximale verschil in waarschijnlijkheid tussen de twee engines voor elke mogelijke uitkomst. In praktische termen betekent dit dat als je een specifieke test zou uitvoeren om de twee engines van elkaar te onderscheiden, de beste mogelijke test ongeveer 59% van de tijd zou slagen. Het is een maatstaf voor hoe onderscheidbaar de twee engines zijn, in plaats van een directe waarschijnlijkheid dat een willekeurige zin gegenereerd door de een anders zal zijn dan de ander.

De studie onthulde ook waarom ze van mening verschilden. Soms koos de ene engine een woord dat de andere engine als onmogelijk beschouwde (een "support mismatch"), wat de afstand deed pieken. Andere keren kozen ze dezelfde woorden maar gaven ze ze een iets andere waarschijnlijkheid. De auteurs merkten ook op dat de "ruis" in het systeem veranderde afhankelijk van hoe de engines waren geconfigureerd. Bijvoorbeeld, als je de engines vroeg om 256 vragen tegelijkertijd te beantwoorden, nam de ruis toe, waardoor de metingen vager werden. Maar hun nieuwe "multilevel" methode was slim genoeg om hiermee om te gaan. Door dezelfde vraag vele malen te stellen en de resultaten te middelen, konden ze de ruis wegfilteren en de ware afstand vinden.

De Conclusie

Het papier concludeert dat we nu betrouwbaar kunnen meten hoe verschillend twee AI-engines zijn, zelfs wanneer ze op verschillende hardware draaien of verschillende softwaretrucs gebruiken. Ze bewezen dat het moeilijk is als je alleen de uiteindelijke antwoorden ziet, maar dat het veel gemakkelijker wordt als je een inkijkje krijgt in de interne getallen. Het belangrijkste is dat ze hebben aangetoond dat zelfs wanneer die getallen een beetje ruizig zijn, we nog steeds een accuraat beeld kunnen krijgen door gebruik te maken van hun nieuwe statistische trucs.

Dit is van belang omdat naarmate AI gebruikelijker wordt, bedrijven moeten weten of hun "goedkope" versie van een model daadwerkelijk hetzelfde is als de "dure" versie, of dat een nieuwe, snellere software-update stiekem de manier waarop de AI zich gedraagt verandert. De auteurs hebben de liniaal geleverd om deze onzichtbare verschillen te meten, wat ervoor zorgt dat wanneer we zeggen dat twee AI's hetzelfde zijn, ze dat ook echt zijn. Hun code is nu beschikbaar voor iedereen om te gebruiken, waardoor deze complexe wiskunde wordt omgezet in een praktisch hulpmiddel voor de toekomst van AI.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →