← Nieuwste papers
🔢 mathematics

The LZ78 Source

Dit artikel karakteriseert een familie van bronprocessen gegenereerd door de LZ78-compressor, die bijna stationair en ergodisch zijn maar een unieke 'Jensen-gat' vertonen in hun eindige-staat compressibiliteit, en gebruikt deze bronnen om de prestaties van sequentiële probabilistische modellen, inclusief transformers voor in-context learning, te evalueren op niet-stationaire data.

Oorspronkelijke auteurs: Naomi Sagan, Amir Dembo, Matthew Ho, Tsachy Weissman

Gepubliceerd 2026-04-20
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Naomi Sagan, Amir Dembo, Matthew Ho, Tsachy Weissman

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De LZ78 Bron: Een Reis door een Onvoorspelbaar Bos

Stel je voor dat je een verhaal schrijft, maar niet met vaste regels. Je gebruikt een slimme, oude techniek uit de informatiewetenschap genaamd LZ78 (een soort van "slimme compressie" die vaak wordt gebruikt om bestanden kleiner te maken). In dit paper onderzoeken de auteurs wat er gebeurt als je deze techniek niet gebruikt om bestanden te verkleinen, maar om een nieuw, willekeurig verhaal te genereren. Ze noemen dit de "LZ78 Bron".

Het klinkt misschien saai, maar dit verhaal heeft een heel bijzonder karakter dat het uniek maakt voor het testen van moderne kunstmatige intelligentie (zoals de AI die dit antwoord voor je schrijft).

Hier zijn de belangrijkste ontdekkingen, vertaald naar alledaagse taal:

1. De "Bos-metafoor": Hoe het verhaal groeit

Stel je een gigantisch bos voor met bomen.

  • De Stammen (De Knopen): Elke keer als je een nieuw woord in je verhaal schrijft, loop je door dit bos. Als je een woord tegenkomt dat je nog nooit hebt gebruikt, plant je een nieuwe boomtak.
  • De Regels (De Kans): Bij elke boomtak hangt een briefje met daarop een getal (bijvoorbeeld 0,8). Dit getal zegt: "Er is een 80% kans dat het volgende woord 'ja' is, en 20% kans dat het 'nee' is."
  • Het Proces: Je begint bij de hoofdstam. Je kijkt naar het briefje, trekt een lot (ja of nee), schrijft het op, en loopt dan naar de volgende tak. Als je een nieuwe tak tegenkomt, krijg je een nieuw briefje met een willekeurig getal.

Dit proces zorgt voor een verhaal dat niet statisch is. Het verandert continu. Het is alsof de schrijver van het verhaal elke seconde een nieuwe regel bedenkt, gebaseerd op wat er net is gebeurd.

2. De "Jaren van Verwarring": Waarom AI dit moeilijk vindt

De auteurs ontdekten iets verrassends over dit verhaal:

  • De "Echte" Complexiteit (Entropie): Het verhaal is eigenlijk vrij simpel in zijn basis. Het heeft een bepaalde hoeveelheid "verwarring" of onvoorspelbaarheid. Laten we zeggen dat de "echte" moeilijkheidsgraad 5 is.
  • De "Schijnbare" Complexiteit (De Jensen-gap): Als je echter probeert dit verhaal te voorspellen met een simpele machine (die alleen kijkt naar de laatste paar woorden), lijkt het verhaal veel moeilijker. De machine denkt: "Oh, dit is heel complex!" en raadt de moeilijkheidsgraad op 8.

Dit verschil tussen wat het verhaal echt is (5) en wat een simpele machine denkt dat het is (8), noemen de auteurs de "Jensen-gap".

  • De Metafoor: Stel je voor dat je door een labyrint loopt. Een slimme vogel (de echte bron) ziet de hele route en weet precies waar hij heen moet. Een muis (een simpele AI) kijkt alleen naar de muur direct voor zijn neus. De muis denkt dat het labyrint een doolhof is, terwijl de vogel weet dat er een rechte lijn is. De muis raakt in paniek en denkt dat het veel moeilijker is dan het is.

3. De Test voor Moderne AI (Transformers)

Waarom is dit belangrijk? Omdat we nu weten dat deze "LZ78 Bron" een perfecte testbaan is voor moderne AI-modellen (zoals de Transformers die achter ChatGPT zitten).

  • Het Probleem: Veel AI-modellen zijn getraind op simpele patronen (zoals "na 'de' komt vaak een zelfstandig naamwoord"). Maar de LZ78 Bron heeft patronen die steeds langer worden naarmate het verhaal langer wordt. Het is alsof je een taal leert waar de grammaticaregels veranderen naarmate je meer woorden kent.
  • De Uitdaging: De auteurs hebben AI-modellen getraind op dit soort "LZ78-verhalen". Ze wilden zien of de AI kon leren om in context te denken. Dat betekent: "Kijk naar wat er net is gebeurd in dit gesprek, en pas daarop je voorspelling aan, zonder dat ik je opnieuw heb getraind."

De Resultaten:

  • Kleine AI's: Zeer kleine modellen (met weinig "hersenen") faalden. Ze bleven steken in simpele patronen en konden de lange-termijn relaties niet zien.
  • Grote AI's: Modellen met meer lagen (diep leren) deden het beter. Ze konden het verhaal beter voorspellen dan traditionele methoden. Maar zelfs de beste modellen konden de "Jensen-gap" niet volledig overbruggen. Ze bleven iets meer fouten maken dan de theoretische limiet zou toelaten.
  • Genoom-Daten: Het meest fascinerende was dat deze AI's, die getraind waren op willekeurige "LZ78-verhalen", ook goed bleken te presteren op echt menselijk DNA. Dit suggereert dat ze geen simpele regels hebben geleerd, maar een fundamenteel vermogen om complexe, onvoorspelbare patronen te doorgronden.

4. De Conclusie in Eén Zin

De auteurs hebben een nieuwe, zeer lastige "testbaan" ontworpen (de LZ78 Bron) die laat zien dat moderne AI's goed zijn in het leren van complexe patronen, maar dat ze nog steeds worstelen met de diepste lagen van onvoorspelbaarheid die in de natuur voorkomen.

Kortom:
Ze hebben een manier bedacht om een verhaal te maken dat continu verandert. Ze hebben getest of slimme computers dit verhaal kunnen begrijpen. Het antwoord is: "Ja, ze zijn slim, maar ze zijn nog niet perfect, en dit is precies de reden waarom." Dit helpt wetenschappers om de volgende generatie AI nog slimmer te maken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →