Approaches to Analysing Historical Newspapers Using LLMs
Cette étude combine modélisation de sujets, analyse de sentiments par LLMs adaptés au slovène et visualisation de graphes d'entités nommées pour analyser la représentation des identités collectives et des orientations politiques dans les journaux historiques slovènes *Slovenec* et *Slovenski narod* au tournant du XXe siècle.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
🗞️🔍 L'Enquête Numérique sur les Journaux du Passé
Imaginez que vous avez devant vous une bibliothèque immense remplie de deux journaux slovènes très anciens, datant du tournant du XXe siècle. L'un, Slovenec, est comme un journal conservateur et religieux (proche de l'Église). L'autre, Slovenski narod, est son opposé : un journal libéral et progressiste.
Ces journaux parlent de tout : de la politique, de la religion, des voisins (Allemands, Italiens, Hongrois) et de ce que signifie être "Slovène". Mais lire des millions de pages à la main, c'est comme essayer de boire l'océan avec une cuillère : c'est impossible !
C'est là que les chercheurs de l'article entrent en jeu. Ils ont utilisé une intelligence artificielle très intelligente (un "Grand Modèle de Langage" ou LLM) pour lire, comprendre et analyser ces journaux à une vitesse fulgurante.
Voici comment ils ont procédé, étape par étape :
1. Le Tri des Thèmes (Le Triage des Courriers) 📦
Imaginez que vous recevez des milliers de lettres. La première chose à faire est de les trier par sujet : "Santé", "Politique", "Météo", "Publicités".
Les chercheurs ont utilisé un outil appelé BERTopic pour faire exactement cela. Ils ont découvert que les deux journaux parlaient des mêmes grands sujets (la santé, les pays voisins, la religion), mais qu'ils les traitaient avec des lunettes très différentes. C'est comme si deux amis regardaient le même match de football : l'un crie "Quelle équipe incroyable !" et l'autre crie "Quelle erreur de l'arbitre !".
2. Le Détective des Sentiments (Le Juge de Paix) ⚖️
C'est la partie la plus fascinante. Les chercheurs voulaient savoir : quand ces journaux parlent-ils des Allemands ou des Slovènes, est-ce avec de la colère, de l'amour ou de l'indifférence ?
Pour cela, ils ont testé quatre "super-intelligences" artificielles différentes. Ils ont dû en choisir une seule pour le gros travail.
- L'analogie : Imaginez que vous engagez quatre traducteurs pour lire un vieux texte écrit avec une machine à écrire abîmée (ce qu'on appelle des erreurs OCR). L'un est excellent pour comprendre les nuances, l'autre se trompe souvent.
- Le résultat : Ils ont choisi un modèle nommé GaMS3. C'est le meilleur détective, mais il a un défaut : il est très prudent. Il est excellent pour dire "C'est neutre" (comme un rapport météo), mais il a un peu de mal à distinguer le "très positif" du "très négatif". Il a tendance à voir plus de critiques (négatif) que d'éloges (positif).
3. La Carte des Relations (Le Réseau de Métro) 🗺️
Ensuite, ils ont créé une carte visuelle géante.
- Les points (nœuds) sont les personnages (les Slovènes, les Allemands, les Autrichiens) et les lieux (Vienne, Trieste, etc.).
- Les lignes relient ceux qui sont mentionnés ensemble dans le même article.
- La taille des points indique si le sentiment est neutre (petit point) ou chargé d'émotion (gros point).
Ce qu'ils ont vu :
- Dans le journal Slovenec, le réseau est très dense et coloré. Les Slovènes y sont souvent liés à des sentiments forts, positifs pour eux-mêmes, mais très négatifs pour les "Allemands" (souvent vus comme des ennemis).
- Dans le journal Slovenski narod, les points sont souvent plus petits et plus neutres. Ils parlent plus de l'administration de l'État et de la gestion du pays.
4. La Révélation Finale (Ce que l'IA nous apprend) 💡
En combinant la puissance de l'ordinateur (qui lit tout) et l'œil critique des historiens (qui comprennent le contexte), voici ce qu'ils ont découvert :
- Le "Nous" contre "Eux" : Les deux journaux construisent l'identité slovène en se opposant à d'autres groupes. Les Allemands sont souvent les "méchants" du scénario, tandis que les Croates sont parfois présentés comme des "frères".
- La neutralité des régions : Quand on parle de régions géographiques (comme "les gens de la Méditerranée"), le ton est presque toujours neutre et descriptif. C'est seulement quand on parle de politique ou de conflits que les sentiments explosent.
- La prudence de l'IA : L'étude nous rappelle une chose importante : l'IA est un outil formidable, mais ce n'est pas un oracle infaillible. Elle peut parfois confondre un compliment avec un commentaire neutre. C'est pour cela qu'il faut toujours que des humains vérifient le travail de la machine.
🎯 En résumé
Cette recherche est comme une loupe magique qui permet de voir des motifs invisibles à l'œil nu dans des montagnes de vieux papiers. Elle nous montre comment, il y a 100 ans, deux journaux slovènes utilisaient les mêmes mots pour raconter deux histoires très différentes sur qui ils étaient et qui étaient leurs ennemis.
C'est une preuve que l'histoire ne se lit pas seulement avec des livres, mais aussi avec des algorithmes qui nous aident à entendre les voix du passé, même quand elles sont couvertes de poussière et d'erreurs de lecture ! 📚✨
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.