An Information-Theoretic Approach to Identifying Formulaic Clusters in Textual Data
Dit artikel presenteert een informatietheoretisch algoritme dat gebruikmaakt van gewogen zelfinformatieverdelingen om formuleuze clusters en stilistische lagen in hoogdimensionale tekstuele data te identificeren, waarmee de effectiviteit ervan wordt aangetoond bij het kwantitatief analyseren van compositionele patronen binnen de multi-auteurschap van de Hebreeuwse Bijbel.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een detective bent die een mysterie probeert op te lossen in een enorme, eeuwenoude bibliotheek. Deze bibliotheek bevat niet alleen willekeurige verhalen; het is een collectie teksten die door honderden verschillende mensen gedurende duizenden jaren zijn geschreven, bewerkt en gekopieerd. Sommige delen zijn geschreven door een enkele auteur met een unieke stem, terwijl andere delen zijn samengesteld uit verschillende bronnen, als een lappendeken. De uitdaging is: hoe bepaal je welk lapje bij welke kleermaker hoort zonder de kleermakers zelf te vragen? Je kunt niet alleen naar de woorden kijken, want sommige schrijvers gebruiken misschien dezelfde woorden om verschillende redenen. Je hebt een manier nodig om de "ritmiek" of de "voorspelbaarheid" van het schrijven te meten.
Hier komt een tak van de wetenschap genaend Informatietheorie om de hoek kijken. Zie dit als een manier om te meten hoe verrast je bent wanneer je het volgende woord in een zin leest. Als je een verhaal leest waarin alles kan gebeuren, ben je constant verrast; de informatiewaarde is hoog, en het schrijven voelt "los" of "creatief" aan. Maar als je een recept of een juridisch contract leest, weet je precies welk woord volgt. "Voeg één kop..." wordt bijna altijd gevolgd door "bloem". Die voorspelbaarheid betekent dat de informatiewaarde laag is omdat het patroon rigide en repetitief is. In dit artikel gebruiken de auteurs dit concept van "verrassing" (of het gebrek daaraan) om verborgen patronen in oude teksten te vinden. Ze willen zien of ze automatisch de "recept-achtige" secties van een boek kunnen onderscheiden van de "verhaal-achtige" secties, enkel door te meten hoe voorspelbaar de woorden zijn.
Het Nieuwe Gereedschap van de Detective
De auteurs, Gideon Yoffe, Yair Segev en Barak Sober, hebben een nieuwe digitale vergrootglas gebouwd. Ze noemen het een unsupervised information-theoretic approach. Laten we dat ontleden: "Unsupervised" (ongesuperviseerd) betekent dat de computer geen leraar nodig heeft om hem te vertellen waar hij naar moet zoeken; hij ontdekt het zelf. "Information-theoretic" (informatietheoretisch) betekent dat het wiskunde gebruikt om voorspelbaarheid te meten.
Hun hoofdgedachte is simpel maar krachtig: Formulaïsche tekst is voorspelbaar. Wanneer een schrijver een rigide structuur gebruikt, zoals een lijst met voorouders of een reeks religieuze wetten, herhalen ze dezelfde zinnen keer op keer. Omdat deze zinnen zo vaak voorkomen, worden ze zeer voorspelbaar. In de taal van de informatietheorie hebben voorspelbare zaken een lage zelfinformatie (lage verrassing). Onvoorspelbaar, creatief vertellen heeft een hoge zelfinformatie (hoge verrassing).
Het team heeft een algoritme ontwikkeld dat door een tekst scant en op zoek gaat naar stukken tekst die ongewoon voorspelbaar zijn. Het raadt niet alleen; het berekent een score voor elk deel van de tekst op basis van hoe "verrast" een waarschijnlijkheidsmodel zou zijn door de woorden die het ziet. Als een sectie vol staat met repetitieve, formulaïsche zinnen, is het model helemaal niet verrast en blijft de score laag. Als de sectie een wild, creatief narratief is, gaat de score omhoog. Door de secties met een lage score bij elkaar te groeperen, kan het algoritme de "formulaïsche clusters" isoleren—de delen van de tekst die aanvoelen alsof ze door een andere hand of voor een ander doel zijn geschreven.
Het Gereedschap Testen op Oude Teksten
Om te zien of hun nieuwe tool daadwerkelijk werkt, hebben de auteurs de Hebreeuwse Bijbel getest, specifiek de eerste drie boeken: Genesis, Exodus en Leviticus. Deze boeken zijn onder geleerden beroemd vanwege hun "composiete" karakter, wat betekent dat ze naar verwachting zijn samengesteld uit verschillende bronnen die in elkaar zijn geweven. Een van de meest bediscussieerde vragen is hoe men de Priesterlijke bron (P) kan scheiden—die bekend staat als zeer gestructureerd, juridisch en repetitief—van de meer narratieve delen van de tekst.
De onderzoekers keken niet alleen naar de woorden; ze keken naar de structuur van de woorden. Ze braken de tekst af in kleine stukjes (zoals zinnen of verzen) en telden hoe vaak bepaalde patronen voorkwamen. Vervolgens draaiden ze hun algoritme om te zien of het er van nature in slaagde de tekst in twee groepen te verdelen: één groep die zeer repetitief was (lage verrassing) en één die meer gevarieerd was (hoge verrassing).
Dit is wat zij vonden:
- In Genesis: Ze keken naar het verschil tussen de lange, saaie lijsten van stambomen (genealogieën) en de spannende verhalen van Abraham en Izak. Het algoritme identificeerde de genealogieën succesvol als de zeer voorspelbare, formulaïsche cluster. Dit is logisch, omdat familielijsten een strikt, repetitief patroon volgen, terwijl verhalen meer vloeiend zijn.
- In Exodus: Ze testten de scheiding tussen de Priesterlijke (P) secties (die wetten bevatten over het bouwen van de Tabernakel en religieuze rituelen) en de niet-Priesterlijke narratieve secties. Het algoritme scheidde deze twee lagen betrouwbaar, wat overeenkomt met wat traditionele geleerden al lang geloven. De Priesterlijke delen kwamen naar voren als de "lage verrassingszone" omdat ze vol staan met repetitieve instructies.
- In Leviticus: Dit was de lastigste test. Leviticus zit vol wetten, maar geleerden debatteren of het twee verschillende lagen bevat: de Priesterlijke bron (P) en een latere "Heiligheidscode" (H). Beide zijn repetitief, maar ze hebben subtiele verschillen. De auteurs ontdekten dat hun methode de twee van elkaar kon onderscheiden, maar alleen wanneer ze de tekst door de juiste "lens" bekeken. Afhankelijk van hoe ze de stukken tekst analyseerden, benadrukte het algoritme soms de Priesterlijke regels als de meest repetitieve, en soms de Heiligheidscode. Dit suggereert dat beide formulaïsch zijn, maar dat ze verschillende soorten patronen volgen die op verschillende schalen zichtbaar worden.
Hoe Zeker Zijn Ze?
De auteurs zijn voorzichtig om niet te beweren dat ze het mysterie van de Bijbel eenmaal voor altijd hebben opgelost. In plaats daarvan laten ze zien dat hun methode suggereert hoe men deze verschillen kan kwantificeren.
Ze testten hun algoritme eerst op nep, door de computer gegenereerde data om er zeker van te zijn dat het patronen kon vinden in een gecontroleerde omgeving. In die simulaties presteerde hun methode vaak beter dan standaard clusteringtools (zoals k-means of Gaussian Mixture Models), vooral wanneer de data schaars en hoogdimensionaal was (wat precies is wat oude teksten zijn).
Toen ze het toepasten op de echte Bijbel, waren de resultaten veelbelovend maar genuanceerd. In het boek Exodus kwam hun methode in 68% van de verschillende parameters instellingen die ze probeerden overeen te komen met de classificaties van deskundige geleerden, vergeleken met slechts 30% voor de standaard k-means methode. In Genesis stemde het in 40% van de gevallen overeen, tegenover 14,6% voor k-means. In Leviticus stemde het in 45,5% van de gevallen overeen, tegenover 29,8% voor k-means.
Deze cijfers suggereren dat de informatie-theoretische benadering een sterk instrument is voor het vinden van deze verborgen lagen, maar het is geen toverstaf die elke keer perfect werkt. Het feit dat de resultaten veranderen afhankelijk van hoe je de tekst opdeelt (de grootte van de woordgroepen en het venster van verzen), vertelt ons dat het "formulaïsche" karakter van deze teksten complex is. Het is niet één ding; het is een mix van patronen die op verschillende schalen verschijnen.
Waarom Dit Belangrijk Is
Dit artikel geeft ons niet alleen een nieuwe manier om boeken te sorteren; het biedt een nieuwe manier om naar ze te luisteren. Door wiskunde te gebruiken om "verrassing" te meten, bieden de auteurs een objectieve manier om te zien waar het ritme van een tekst verandert. Als een verhaal plotseling heel voorspelbaar wordt, kan dat een teken zijn dat een andere auteur de pen heeft opgepakt, of dat de tekst is gekopieerd van een sjabloon.
De auteurs concluderen dat deze methode bijzonder nuttig is voor teksten die door de tijd heen zijn bewerkt en gelaagd, zoals de Hebreeuwse Bijbel. Het stelt onderzoekers in staat om de "structurele steigers" van een tekst te zien zonder vooraf te hoeven raden welke woorden belangrijk zijn. Hoewel de methode niet precies bewijst wie wat heeft geschreven, biedt het een kwantitatief kader dat veel van de traditionele theorieën over hoe deze oude boeken zijn samengesteld ondersteunt. Het verandert de kunst van literaire analyse in een wetenschap van patronen, en laat ons zien dat zelfs in de meest complexe verhalen, de vingerafdrukken van structuur en herhaling gevonden kunnen worden als je weet hoe je de verrassing moet meten.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.