Approaches to Analysing Historical Newspapers Using LLMs
Questo studio combina metodi computazionali scalabili, come il topic modeling e l'analisi del sentiment basata su LLM, con l'analisi critica del discorso per esaminare come le identità collettive e le orientazioni politiche siano state rappresentate nei giornali storici sloveni *Slovenec* e *Slovenski narod* all'inizio del XX secolo.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Immagina di avere due enormi biblioteche piene di vecchi giornali sloveni, scritti all'inizio del 1900. Questi giornali, Slovenec e Slovenski narod, sono come due specchi che riflettono la stessa società, ma da angolazioni completamente diverse: uno è conservatore e legato alla Chiesa, l'altro è liberale e progressista.
Il problema? Sono così vecchi, pieni di errori di scansione (come se fossero stati fotocopiati mille volte) e scritti in una lingua antica, che leggerli uno per uno per capire cosa pensavano della gente sarebbe come cercare di contare i grani di sabbia di una spiaggia a mano.
Gli autori di questo studio hanno usato un super-intelligenza artificiale (chiamata LLM) per fare da "traduttore" e "analista" di massa. Ecco come hanno lavorato, spiegato con delle metafore semplici:
1. La Mappa dei Temi (Il Catalogo del Supermercato)
Prima di tutto, hanno usato un algoritmo chiamato BERTopic per organizzare i milioni di articoli.
- L'analogia: Immagina di avere un supermercato caotico con milioni di prodotti sparsi ovunque. BERTopic è come un robot magico che prende tutti gli articoli, li legge velocemente e li mette in scaffali etichettati: "Cose che succedono in politica", "Notizie sulla salute", "Pubblicità", "Guai con i vicini".
- Il risultato: Hanno scoperto che entrambi i giornali parlavano molto di salute e politica, ma con toni diversi. Slovenec era più preoccupato della religione, mentre Slovenski narod si concentrava di più sulla vita sociale e sul lavoro.
2. L'Analista dei Sentimenti (Il Detective Emotivo)
Qui entra in gioco l'Intelligenza Artificiale principale. Hanno dovuto scegliere il "detective" migliore per capire se, quando si parlava di un gruppo di persone (es. "i tedeschi", "gli austriaci", "i sloveni"), il giornale era felice, arrabbiato o indifferente.
- La sfida: I testi vecchi sono pieni di errori (come parole storte o lettere mancanti). È difficile per un computer capire se una frase è una critica o un complimento.
- La gara: Hanno fatto gareggiare quattro diversi modelli di intelligenza artificiale. Il vincitore è stato GaMS3, un modello specializzato nella lingua slovena.
- Il difetto del detective: Questo detective è bravissimo a dire "Non ho opinioni" (neutrale), ma a volte è un po' pessimista: se non è sicuro, tende a pensare che sia una cosa negativa, e fatica a riconoscere i complimenti veri. È come un nonno che, se non capisce bene cosa dici, assume che tu stia facendo una critica.
3. La Rete di Connessioni (Il Mappa delle Relazioni)
Una volta che l'IA ha letto tutto, hanno creato dei grafici (mappe visive).
- L'analogia: Immagina una mappa delle metropolitane. Le stazioni sono i gruppi di persone (es. "Tedeschi", "Sloveni") e i luoghi (es. "Vienna", "Lubiana"). Le linee che le collegano mostrano quanto spesso appaiono insieme nei giornali.
- La dimensione: La grandezza di ogni stazione sulla mappa indica quanto quel gruppo viene "discusso" con emozioni forti (rabbia o gioia).
- Cosa hanno visto:
- I Tedeschi erano collegati a linee rosse (negative) in entrambi i giornali: c'era molta tensione politica.
- Gli Austriaci erano spesso stazioni grigie (neutrali): venivano menzionati come fatto, senza troppa rabbia.
- I Croati erano spesso collegati con linee verdi (positive) nel giornale conservatore, visti come "fratelli".
4. La Lettura Profonda (L'Esame del Dettaglio)
Infine, gli umani hanno preso le mappe create dall'IA e hanno fatto un "zoom" sui punti più interessanti.
- L'analogia: L'IA ha detto: "Ehi, guarda qui! C'è un sacco di rabbia verso i 'tedeschi' in questa pagina". Gli umani hanno poi letto quel pezzo specifico per capire perché era arrabbiato.
- La scoperta: Hanno visto che i giornali usavano strategie precise per costruire l'identità slovena: dire "Noi siamo bravi" e "Loro (i tedeschi o gli ungheresi) sono i cattivi". Era un modo per tenere unita la nazione in un periodo di grandi cambiamenti.
In Sintesi: Cosa ci insegna?
Questo studio è come un ponte tra due mondi:
- Il mondo dei computer: Che possono leggere milioni di pagine in pochi secondi, ma a volte sbagliano le sfumature.
- Il mondo degli storici: Che capiscono le emozioni umane e il contesto, ma non possono leggere tutto.
Mettendoli insieme, hanno potuto vedere cose che nessuno dei due avrebbe visto da solo: hanno confermato che c'era molta tensione tra sloveni e tedeschi, ma hanno anche scoperto dettagli inaspettati su come i giornali trattavano i gruppi minori o le regioni vicine.
La lezione finale: L'Intelligenza Artificiale non sostituisce lo storico, ma gli dà un "super-potere" per esplorare oceani di dati, permettendogli di trovare le perle nascoste che altrimenti sarebbero rimaste sepolte sotto tonnellate di carta vecchia.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.