Approaches to Analysing Historical Newspapers Using LLMs
Deze studie combineert schaalbare computationele methoden, zoals topic modeling en LLM-gebaseerde sentimentanalyse, met kritische discoursanalyse om de representatie van collectieve identiteiten en politieke oriëntaties in de historische Sloveense kranten *Slovenec* en *Slovenski narod* aan het begin van de twintigste eeuw te onderzoeken.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Titel: De Digitale Tijdreizigers: Hoe AI Oude Kranten Leest en Begrijpt
Stel je voor dat je een enorme bibliotheek binnenstapt, gevuld met miljoenen pagina's oude kranten uit Slovenië, geschreven aan het begin van de 20e eeuw. Deze kranten zijn niet alleen oud, maar ook beschadigd door de tijd: de letters zijn vervaagd, sommige woorden zijn door de scanner (OCR) verkeerd gelezen, en de taal is verouderd. Het is als proberen een gesprek te volgen in een drukke zaal waar iedereen fluistert en de muren echoën.
Dit onderzoek is het verhaal van een team van historici en computerwetenschappers die een nieuwe manier hebben gevonden om deze "flauwe" gesprekken te ontcijferen. Ze gebruiken Grote Taalmodellen (LLMs) – slimme computers die zijn getraind om menselijk taalgebruik te begrijpen – als een soort digitale tijdreizigers.
Hier is hoe ze het deden, vertaald in alledaagse taal:
1. De Twee Kampen: Een Oude Strijd
Het team keek naar twee specifieke kranten: Slovenec en Slovenski narod.
- Slovenec was als een strenge, traditionele priester: katholiek, conservatief en bezorgd om de kerk en de traditie.
- Slovenski narod was als een moderne, vrijzinnige leraar: liberaal, vooruitstrevend en kritisch op de kerk.
Hoewel ze allebei voor de Sloveense onafhankelijkheid pleitten, keken ze naar de wereld door heel verschillende brillen. De kranten waren hun "tijdcapsules" om te zien hoe mensen toen dachten over wie "wij" waren en wie "zij" waren.
2. De Slimme Scanner: De AI als Vertaler
De grootste uitdaging was dat de tekst door de scanners vaak vol foutjes zat (zoals "nem" in plaats van "nemec" voor Duitser). Normale computers zouden hierdoor de draad kwijtraken.
Het team testte vier verschillende "slimme hersenen" (AI-modellen) om te zien welke het beste kon lezen tussen de lijnen. Ze gaven ze de opdracht: "Kijk naar dit specifieke woord (bijvoorbeeld 'Duitsers') in deze zin. Is de schrijver blij, boos of gewoon neutraal?"
De winnaar was een model genaamd GaMS3. Maar zelfs deze winnaar had zijn eigen karaktertrekjes:
- Hij was uitstekend in het herkennen van neutrale zinnen (zoals een feitelijke nieuwsbericht).
- Hij was goed in het zien van boosheid (negatief).
- Hij was een beetje verward als het om blijdschap ging (positief). Hij neigde er vaak toe om blij nieuws als "gewoon" of zelfs "iets minder blij" te zien.
De analogie: Stel je voor dat de AI een detective is die heel goed kan zeggen of een getuige "kalm" of "boos" is, maar soms vergeet dat iemand ook "opgewonden" kan zijn. De onderzoekers wisten dit en pasten hun analyse hierop aan.
3. Het Grote Netwerk: Wie staat met wie?
Na het analyseren van de gevoelens, maakten de onderzoekers een gigantisch digitaal spinnenweb.
- In dit web zijn de mensen (groepen zoals Duitsers, Italianen, Sloveen) en plekken (steden, landen) de knopen.
- De lijnen tussen hen tonen aan hoe vaak ze samen in een artikel voorkomen.
- De dikte van de lijn en de grootte van de knoop laten zien of de tekst over die groep meestal positief, negatief of neutraal was.
Wat zagen ze?
- Duitsers stonden vaak in het web met dikke, donkere lijnen naar de "boosheid"-knop. Dit bevestigt wat historici al wisten: er was veel spanning tussen Slovenen en Duitsers.
- Oostenrijkers stonden vaak in het midden, met dunne, neutrale lijnen. De Sloveense politiek steunde de Oostenrijkse staat, dus daar was minder ruzie over.
- Kroaten werden vaak als "broeders" gezien, met positieve lijnen.
4. De Mix van Methoden: Dichtbij en Ver weg
Het mooie aan dit onderzoek is de combinatie van twee werelden:
- Ver weg lezen (Distant Reading): De computer leest alle kranten in één keer en ziet de grote patronen. Dit is alsof je een vliegtuig neemt om het weerpatroon van een heel continent te zien.
- Dichtbij lezen (Close Reading): De onderzoekers kijken dan naar specifieke stukjes tekst die de computer als interessant heeft gemarkeerd. Dit is alsof je landt en met een vergrootglas door de straten loopt om de details te zien.
Door deze twee te combineren, ontdekten ze niet alleen de grote politieke lijnen, maar ook subtiele strategieën. Bijvoorbeeld: hoe de kranten "de ander" (zoals Duitsers) gebruikten om hun eigen identiteit sterker te maken, of hoe ze in rouwadvertenties (obituaries) juist heel vriendelijk waren over mensen van andere nationaliteiten.
Conclusie: Waarom is dit belangrijk?
Dit onderzoek laat zien dat we AI niet als een magische waarzegger moeten zien, maar als een krachtige hulpmethode.
- Het helpt ons om enorme hoeveelheden oude tekst te begrijpen die voor mensen te veel zouden zijn.
- Het geeft inzicht in hoe nationaliteit en identiteit in het verleden werden vormgegeven.
- Het leert ons dat we altijd kritisch moeten blijven: de AI is slim, maar niet perfect. We moeten haar resultaten interpreteren met onze eigen historische kennis.
Kortom: door slimme computers en menselijke wijsheid te combineren, kunnen we de "geesten" van oude kranten weer tot leven wekken en beter begrijpen hoe onze voorouders dachten over wie ze waren en wie hun buren waren.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.