← Ultimi articoli
💬 NLP

An Information-Theoretic Approach to Identifying Formulaic Clusters in Textual Data

Questo articolo presenta un algoritmo informativo che utilizza distribuzioni di auto-informazione pesate per identificare cluster formulaici e strati stilistici in dati testuali ad alta dimensionalità, dimostrando la sua efficacia nell'analizzare quantitativamente i modelli compositivi all'interno della Bibbia ebraica multi-autore.

Autori originali: Gideon Yoffe, Yair Segev, Barak Sober

Pubblicato 2026-07-29
📖 7 min di lettura🧠 Approfondimento

Autori originali: Gideon Yoffe, Yair Segev, Barak Sober

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di essere un detective che cerca di risolvere un mistero all'interno di una massiccia, antica biblioteca. Questa biblioteca non è solo piena di storie casuali; è una collezione di testi che sono stati scritti, modificati e copiati da centinaia di persone diverse nel corso di migliaia di anni. Alcune parti sono state scritte da un singolo autore con una voce unica, mentre altre sono state cucite insieme da diverse fonti, come un patchwork di tessuti. La sfida è: come fare per capire a quale sarto appartiene ogni pezzo senza chiedere ai sarti? Non puoi semplicemente guardare le parole perché alcuni scrittori potrebbero usare le stesse parole per motivi diversi. Hai bisogno di un modo per misurare il "ritmo" o la "prevedibilità" della scrittura.

È qui che entra in gioco una branca della scienza chiamata Teoria dell'Informazione. Pensala come un modo per misurare quanto rimani sorpreso quando leggi la parola successiva in una frase. Se stai leggendo una storia dove può succedere di tutto, sei costantemente sorpreso; il contenuto informativo è alto e la scrittura sembra "sciolta" o "creativa". Ma se stai leggendo una ricetta o un contratto legale, sai esattamente quale parola verrà dopo. "Aggiungere una tazza di..." è quasi sempre seguito da "farina". Questa prevedibilità significa che il contenuto informativo è basso perché il modello è rigido e ripetitivo. In questo articolo, gli autori utilizzano questo concetto di "sorpresa" (o mancanza di essa) per trovare modelli nascosti nei testi antichi. Vogliono vedere se riescono a individuare automaticamente le sezioni "tipo ricetta" di un libro rispetto alle sezioni "tipo storia", semplicemente misurando quanto siano prevedibili le parole.

Il nuovo strumento del detective

Gli autori, Gideon Yoffe, Yair Segev e Barak Sober, hanno costruito una nuova lente d'ingrandimento digitale. La chiamano un approccio informazionale-teoretico non supervisionato. Analizziamo questo termine: "Non supervisionato" significa che il computer non ha bisogno di un insegnante che gli dica cosa cercare; lo capisce da solo. "Informazionale-teoretico" significa che usa la matematica per misurare la prevedibilità.

La loro idea principale è semplice ma potente: Il testo formulare è prevedibile. Quando uno scrittore usa una struttura rigida, come un elenco di antenati o un insieme di leggi religiose, ripete le stesse frasi ancora e ancora. Poiché queste frasi appaiono così spesso, diventano molto prevedibili. Nel linguaggio della teoria dell'informazione, le cose prevedibili hanno una bassa auto-informazione (bassa sorpresa). La narrazione creativa e imprevedibile ha un'alta auto-informazione (alta sorpresa).

Il team ha sviluppato un algoritmo che scansiona un testo, cercando blocchi di scrittura che siano insolitamente prevedibili. Non si limita a indovinare; calcola un punteggio per ogni parte del testo basandosi su quanto un modello di probabilità sarebbe "sorpreso" dalle parole che vede. Se una sezione è piena di frasi formulari e ripetitive, il modello non è affatto sorpreso e il punteggio rimane basso. Se la sezione è una narrazione selvaggia e creativa, il punteggio sale. Raggruppando le sezioni a basso punteggio, l'algoritmo può isolare i "cluster formulari": le parti del testo che sembrano essere state scritte da una mano diversa o per uno scopo diverso.

Testare lo strumento su testi antichi

Per vedere se il loro nuovo strumento funziona davvero, gli autori lo hanno testato sulla Bibbia ebraica, specificamente sui primi tre libri: Genesi, Esodo e Levitico. Questi libri sono famosi tra gli studiosi per essere "compositi", ovvero si ritiene siano composti da diverse fonti intrecciate tra loro. Una delle questioni più dibattute è come separare la fonte Sacerdotale (P) — nota per essere molto strutturata, legalista e ripetitiva — dalle altre parti narrative del testo.

I ricercatori non si sono limitati a guardare le parole; hanno guardato la struttura delle parole. Hanno scomposto il testo in piccoli pezzi (come frasi o versetti) e hanno contato quanto spesso apparivano determinati schemi. Hanno poi eseguito il loro algoritmo per vedere se fosse in grado di separare naturalmente il testo in due gruppi: un gruppo altamente ripetitivo (bassa sorpresa) e uno più vario (alta sorpresa).

Ecco cosa hanno scoperto:

  • Nella Genesi: Hanno osservato la differenza tra le lunghe e noiose liste di alberi genealogici (genealogie) e le avvincenti storie di Abramo e Isacco. L'algoritmo ha identificato con successo le genealogie come il cluster formulare altamente prevedibile. Questo ha senso perché le liste familiari seguono un modello rigido e ripetitivo, mentre le storie sono più fluide.
  • Nell'Esodo: Hanno testato la separazione tra le sezioni Sacerdotali (P) (che contengono leggi sulla costruzione del Tabernacolo e rituali religiosi) e le sezioni narrative non sacerdotali. L'algoritmo ha separato in modo affidabile questi due strati, corrispondendo a quanto la tradizione degli studiosi ha a lungo sostenuto. Le parti Sacerdotali sono emerse come la zona a "bassa sorpresa" perché sono piene di istruzioni ripetitive.
  • Nel Levitico: Questo è stato il test più complicato. Il Levitico è pieno di leggi, ma gli studiosi discutono se contenga due diversi strati: la fonte Sacerdotale (P) e un successivo "Codice di Santità" (H). Entrambi sono ripetitivi, ma presentano sottili differenze. Gli autori hanno scoperto che il loro metodo poteva distinguere tra i due, ma solo se guardavano il testo attraverso la "lente" giusta. A seconda di come dimensionavano i blocchi di testo analizzati, l'algoritmo a volte evidenziava le regole Sacerdotali come le più ripetitive, e altre volte evidenziava il Codice di Santità. Ciò suggerisce che entrambi sono formulari, ma seguono tipi di schemi diversi che si manifestano a scale differenti.

Quanto sono sicuri?

Gli autori sono cauti nel non pretendere di aver risolto il mistero della Bibbia una volta per tutte. Invece, mostrano che il loro metodo suggerisce un modo per quantificare queste differenze.

Hanno testato il loro algoritmo su dati finti, generati dal computer, per prima cosa, per assicurarsi che potesse trovare schemi in un ambiente controllato. In queste simulazioni, il loro metodo ha spesso performato meglio degli standard strumenti di clustering (come k-means o i Modelli di Miscela Gaussiana), specialmente quando i dati erano sparsi e ad alta dimensionalità (che è esattamente ciò che sono i testi antichi).

Quando hanno applicato il metodo alla vera Bibbia, i risultati sono stati promettenti ma sfumati. Nel libro dell'Esodo, il loro metodo concordava con le classificazioni degli esperti in un 68% delle diverse impostazioni di parametri provate, rispetto a solo il 30% del metodo k-means standard. Nella Genesi, concordava nel 40% dei casi rispetto al 14,6% di k-means. Nel Levitico, concordava nel 45,5% dei casi rispetto al 29,8% di k-means.

Questi numeri suggeriscono che l'approccio informazionale-teoretico è uno strumento forte per trovare questi strati nascosti, ma non è una bacchetta magica che funziona perfettamente ogni volta. Il fatto che i risultati cambino a seconda di come si "affetta" il testo (la dimensione dei gruppi di parole e la finestra dei versetti) ci dice che la natura "formulare" di questi testi è complessa. Non è una cosa sola; è un mix di schemi che appaiono a diverse scale.

Perché questo è importante

Questo articolo non ci offre solo un nuovo modo per catalogare i libri; ci offre un nuovo modo per ascoltarli. Usando la matematica per misurare la "sorpresa", gli autori forniscono un modo oggettivo per vedere dove cambia il ritmo di un testo. Se una storia diventa improvvisamente molto prevedibile, potrebbe essere il segno che un autore diverso ha preso la penna in mano, o che il testo è stato copiato da un modello.

Gli autori concludono che questo metodo è particolarmente utile per i testi che sono stati editati e stratificati nel tempo, come la Bibbia ebraica. Permette ai ricercatori di vedere l' "impalcatura strutturale" di un testo senza dover indovinare in anticipo quali parole siano importanti. Sebbene il metodo non provi esattamente chi abbia scritto cosa, fornisce un quadro quantitativo che supporta molte delle teorie tradizionali su come questi antichi libri siano stati assemblati. Trasforma l'arte dell'analisi letteraria in una scienza dei modelli, mostrandoci che anche nelle storie più complesse, le impronte digitali della struttura e della ripetizione possono essere trovate, se si sa come misurare la sorpresa.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →