← Nieuwste papers
🤖 AI

LLMbench: A Comparative Close Reading Workbench for Large Language Models

Dit artikel introduceert LLMbench, een browsergebaseerd werkstation voor de digitale geesteswetenschappen dat de hermeneutische analyse van LLM-outputs mogelijk maakt door log-probabiliteitsdata te visualiseren en zo de onderliggende kansverdeling en tegenwerkelijke geschiedenis van gegenereerde tekst bloot te leggen.

Oorspronkelijke auteurs: David M. Berry

Gepubliceerd 2026-04-20
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: David M. Berry

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je twee schrijvers hebt die precies hetzelfde verhaal moeten vertellen over een onderwerp. De ene schrijver is een mens, de andere is een kunstmatige intelligentie (een AI). Als je hun verhalen naast elkaar leest, zie je wat ze hebben geschreven. Maar wat je niet ziet, is het proces dat erachter zit: de twijfel, de keuzes die ze niet hebben gemaakt, en de duizenden andere zinnen die ze hadden kunnen schrijven.

Dit artikel introduceert LLMbench, een digitaal gereedschap dat precies dat onzichtbare proces zichtbaar maakt. Het is geen rekenmachine om te zeggen welke AI "beter" is (zoals een cijfer op een rapport), maar een vergrotingsglas voor de manier waarop AI denkt.

Hier is hoe het werkt, vertaald naar alledaagse beelden:

1. Het Probleem: De "Magische" Schrijver

Normaal gesproken kijken we naar het eindresultaat van een AI als een vaststaand feit. "Dit is wat de computer schreef." Maar voor een AI is een zin geen vaste muur; het is meer als een wolk van mogelijkheden. Op het moment dat de AI een woord kiest, heeft hij eigenlijk een dobbelsteen gegooid tussen honderden opties. Soms is hij heel zeker van zijn zaak (hij kiest het enige juiste woord), en soms twijfelt hij enorm (hij kiest willekeurig tussen vijf bijna gelijke woorden).

Bestaande tools kijken alleen naar het eindresultaat. LLMbench kijkt naar de dobbelspelletjes die de AI heeft gespeeld.

2. De Oplossing: Een "Kijkvenster" in de AI

LLMbench is een webtool die twee AI-antwoorden naast elkaar zet. Maar het voegt vier speciale "brillen" toe om de tekst te lezen:

  • De "Twijfel-kaart" (Probabilities):
    Stel je voor dat je een tekst leest, maar de woorden die de AI met twijfel heeft gekozen, gloeien rood op. Woorden waar hij zeker van was, zijn wit.
    • Analogie: Het is alsof je een spoor volgt in het bos. Waar de AI zeker was, is het pad breed en duidelijk. Waar hij twijfelde, zie je dat hij eerst naar links keek, dan naar rechts, en toen maar een pad uitkoos. De tool laat zien hoe "wankel" dat pad was op dat moment.
  • Het "Wat-als"-Spel (Stochastic Variation):
    Je kunt dezelfde vraag aan dezelfde AI stellen, maar dan met een knopje dat de "willekeur" verhoogt.
    • Analogie: Het is alsof je dezelfde schrijver vijf keer dezelfde opdracht geeft. Soms schrijft hij een heel verhaal, soms een kort versje. LLMbench toont deze variaties naast elkaar, zodat je ziet hoe fragiel of stabiel de AI is.
  • De "Stem"-Analyse (Tone):
    De tool kleurt woorden in die aangeven hoe zeker de AI klinkt. Woorden als "misschien" of "zeker" krijgen een andere kleur.
    • Analogie: Het is als een stemmeter die aangeeft of de AI klinkt als een voorzichtig bibliothecaris of als een zelfverzekerde legerleider, zelfs als ze over hetzelfde onderwerp praten.
  • De "Structuur"-Blik (Structure):
    Het breekt de tekst op in zinnen en laat zien waar de AI pauzes maakt of waar hij argumenten koppelt.

3. Het Grote Inzicht: De "Geschiedenis van de Niet-Gekozen Wegen"

Het meest fascinerende deel van LLMbench is dat het je laat zien wat de AI niet heeft geschreven.

Stel je voor dat je een pad door een bos loopt. Je ziet alleen het pad dat je hebt bewandeld. LLMbench laat je echter ook de duizenden andere paden zien die er waren, maar die je niet hebt gekozen.

  • Soms kiest de AI een woord met 50% kans. Dat betekent dat er een ander woord was dat net zo goed had gekund. Als dat andere woord was gekozen, had de hele zin misschien een heel andere betekenis gehad.
  • De tool laat zien: "Hier, op dit exacte moment, had de AI net zo goed een heel ander verhaal kunnen vertellen."

4. Waarom is dit belangrijk?

Vroeger zagen we AI als een zwarte doos die antwoorden gaf. Nu, met LLMbench, kunnen we de mechaniek zien.

  • Het helpt onderzoekers te begrijpen dat AI-teksten niet "waar" of "onwaar" zijn in de menselijke zin, maar statistische kansen.
  • Het maakt de "menselijke" kant van de machine zichtbaar: de momenten van onzekerheid, de keuzes die gemaakt moeten worden, en de manier waarop verschillende AI-modellen (zoals Gemini en GPT) totaal verschillende routes kiezen voor hetzelfde doel.

Samenvattend

LLMbench is geen scorebord om te zeggen wie de beste speler is. Het is een reisleider die je meeneemt op een wandeling door de denkwereld van een AI. Het laat je zien dat elk woord dat de AI schrijft, het resultaat is van een keuze uit een wolk van andere mogelijkheden. Het maakt de "magie" van de AI ontrafelen en laat zien dat de betekenis van een tekst niet alleen in de woorden zelf zit, maar ook in de wolk van woorden die voorbij zijn gegaan.

Zoals de auteur zegt: "De betekenis van een tekst ligt niet achter de tekst (verborgen in cijfers), maar voor de tekst (zichtbaar in de keuzes die gemaakt zijn)."

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →