Linked Multi-Model Data on Russian Domestic and Foreign Policy Speeches
Dit artikel introduceert een uitgebreide, onderling verbonden multimodale dataset van Russische regeringspeeches die meertalige teksten, afbeeldingen en door experts gevalideerde thematische annotaties combineert om geavanceerd sociaalwetenschappelijk onderzoek en toepassingen van grote taalmodellen in de studie van autoritaire politieke communicatie te faciliteren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je probeert een complexe, hoog-risico conversatie te begrijpen die plaatsvindt binnen een fort. Jarenlang moesten onderzoekers die de Russische regering bestudeerden, naar deze conversatie luisteren via één enkel, krakend radiokanaal (alleen tekst) of kijken naar een paar wazige snapshots (alleen afbeeldingen). Vaak was de tekst alleen in het Russisch beschikbaar, waardoor het voor velen moeilijk te begrijpen was, en de foto's waren zelden verbonden met de specifieke woorden die werden gesproken.
Dit artikel introduceert een massaal, hoog-resolutie "bewakingssysteem" dat het spel verandert. De auteurs hebben een grote, georganiseerde bibliotheek gebouwd met meer dan 35.000 toespraken van de topleiders van Rusland (de president en de minister van Buitenlandse Zaken) van 1999 tot eind 2025.
Hier is hoe ze deze bibliotheek hebben opgebouwd en wat het zo bijzonder maakt, met behulp van eenvoudige analogieën:
1. De Tweelingbibliotheken (Tekst en Vertaling)
Beschouw deze dataset als twee identieke bibliotheken voor elke toespraak: één geschreven in het originele Russisch en één in het Engels.
- De Haken: Dit zijn niet zomaar perfecte vertalingen. Soms zegt de Russische versie het ene, en de Engelse versie iets anders. De auteurs hebben beide versies naast elkaar bewaard. Dit stelt onderzoekers in staat om als detectives te werken, de twee te vergelijken om te zien of de regering haar boodschap anders "toespitst" op haar eigen volk versus de rest van de wereld.
- De Schaal: Ze hebben toespraken verzameld van het Kremlin (het kantoor van de president) en het Ministerie van Buitenlandse Zaken. Het is alsof je het complete script hebt van elke persconferentie, interview en toespraak gegeven door de twee topspelers in de Russische regering gedurende meer dan twee decennia.
2. Het Fotoalbum (Afbeeldingen Gelinkt aan Woorden)
In het verleden, als je een toespraak las, kon je niet eenvoudig de foto's zien die erbij waren geplaatst.
- De Innovatie: De auteurs behandelden elke toespraak als een fotoalbum. Voor elke toespraak pikten ze alle bijbehorende afbeeldingen (foto's van de leider, de locatie, de menigte) en plakten ze aan de tekst.
- Het Resultaat: Je kunt nu de "visuele context" van een toespraak zien. Sprak de leider voor een tank? In een gezellig kantoor? Op een massale rally? De data koppelt de woorden direct aan de afbeeldingen, waardoor een "multimodaal" verslag ontstaat (woorden + afbeeldingen).
3. De Slimme Bibliothecaris (Onderwerpmodellering)
Het lezen van 35.000 toespraken één voor één zou een leven duren. Om dit op te lossen, hebben de auteurs een "Slimme Bibliothecaris" ingehuurd (een AI-systeem genaamd BERTopic).
- Hoe het werkt: De AI las elke toespraak en elke afbeelding, en sorteerde ze vervolgens in thematische mappen. Voor het Kremlin creëerde het 89 verschillende mappen (zoals "Oekraïne", "Economische", "Militair", "Energie"). Voor het Ministerie van Buitenlandse Zaken creëerde het 32 mappen.
- Menselijke Aanraking: Een menselijke expert die Russische politiek kent, controleerde vervolgens het werk van de AI om ervoor te zorgen dat de maplabels logisch waren. Dit zorgt ervoor dat de onderwerpen niet zomaar willekeurige computergibberig zijn, maar daadwerkelijk echte politieke thema's weerspiegelen.
- De Output: Nu kun je, in plaats van een toespraak te lezen om te weten waar het over gaat, direct zien: "Deze toespraak is voor 80% over 'Militaire Veiligheid' en voor 20% over 'Diplomatie'."
4. De GPS-tracker (Locatiegegevens)
Elke toespraak is getagd met waar het plaatsvond.
- De auteurs kopieerden niet alleen de locatienaam; ze gebruikten een "GPS-vertaler" om stadsnamen (zoals "Moskou" of "Sotsji") om te zetten in echte kaartcoördinaten (breedte- en lengtegraad).
- Dit stelt onderzoekers in staat om kaarten te tekenen die precies tonen waar de Russische regering in de loop van de tijd geografisch haar aandacht richt.
5. Het "Perfecte Match"-systeem (Data-integriteit)
De auteurs waren zeer zorgvuldig om ervoor te zorgen dat de data schoon en verbonden is.
- Unieke ID's: Elke toespraak heeft een uniek ID-nummer (zoals een burgerservicenummer). Dit nummer is hetzelfde in het Russische bestand, het Engelse bestand en de map met afbeeldingen. Het is de "lijm" die de hele dataset bij elkaar houdt.
- Volledigheid: Ze controleerden hun werk tegen de originele overheidswebsites. Als de website aangaf dat er 5 foto's waren, zorgden ze ervoor dat ze precies 5 downloadden. Als de website een locatie had, zorgden ze ervoor dat deze werd geregistreerd.
Wat kun je hiermee doen?
Het artikel legt uit dat deze dataset een "testomgeving" is (een zandbak voor experimenten).
- Voor politicologen: Je kunt bestuderen hoe autoritaire regimes hun intenties signaleren, hoe ze hun verhalen aanpassen voor verschillende publieken, of hoe hun prioriteiten verschuiven over 25 jaar.
- Voor computerwetenschappers: Je kunt deze enorme, schone, gelabelde dataset gebruiken om nieuwe AI-modellen te trainen die de Russische taal begrijpen, politieke afbeeldingen analyseren, of testen hoe goed AI multimodale data (tekst + afbeeldingen) verwerkt.
Kortom: Dit artikel heeft niet zomaar wat websites gescraped; het heeft een tijdmachine gebouwd die je in staat stelt de afgelopen 25 jaar Russische politieke communicatie te doorlopen, waarbij je de woorden, de afbeeldingen, de locaties en de thema's allemaal tegelijk ziet, zowel in het Russisch als in het Engels, perfect georganiseerd voor onderzoek.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.