← Nieuwste papers
💬 NLP

Trilingual Topic Modeling of Sri Lankan Parliamentary Debates

Dit artikel presenteert een end-to-end framework dat gebruikmaakt van LLM-gebaseerde tekstextractie en meertalige embedding-clustering om succesvol ongesuperviseerde topic modeling uit te voeren op de drietalige parlementaire debatten van Sri Lanka, waarbij uitdagingen zoals complexe lay-outs en code-mixing worden overwonnen om thematische structuren te identificeren die overeenstemmen met belangrijke nationale gebeurtenissen.

Oorspronkelijke auteurs: Himath Dhanapala, Haren Daishika, Himandhi Kuruppu, Sithija Seneviratne, Ashini Kavindya, Patalee Narasinghe, Sandeepa Weerasekara, Nisansa de Silva, Sandareka Wickramanayake

Gepubliceerd 2026-08-24
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Himath Dhanapala, Haren Daishika, Himandhi Kuruppu, Sithija Seneviratne, Ashini Kavindya, Patalee Narasinghe, Sandeepa Weerasekara, Nisansa de Silva, Sandareka Wickramanayake

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In het uitgestrekte landschap van de moderne informatica streeft een vakgebied dat bekend staat als natuurlijke taalverwerking ernaar om machines te leren hoe ze menselijke spraak kunnen lezen, begrijpen en organiseren. Decennialang heeft dit werk zich zwaar gericht op talen zoals het Engels, waarbij de grammaticale regels relatief eenvoudig zijn en de digitale hulpmiddelen overvloedig aanwezig zijn. De wereld wordt echter gevuld met talen die heel anders functioneren. Sommige, zoals het Singalees en het Tamil, die breed worden gesproken in Sri Lanka, zijn agglutinerend, wat betekent dat ze complexe woorden bouwen door veel kleine betekenisstukjes aan elkaar te rijgen, waardoor het voor standaard computerprogramma's moeilijk is om te herkennen dat twee verschillend uitziende woorden eigenlijk dezelfde stam delen. Bovendien spreken mensen in veel delen van de wereld niet in slechts één taal tegelijk; ze mengen deze vrijelijk binnen een enkele zin, een fenomeen dat bekend staat als codemenging. Wanneer deze linguïstische complexiteiten samenkomen met de rommelige realiteit van officiële overheidsarchieven, die vaak in de vorm van slecht geformatteerde digitale documenten arriveren, is het resultaat een berg tekst waar standaardsoftware simpelweg niet tegenop kan klimmen. Het begrijpen van wat er gezegd wordt in deze verslagen is cruciaal, aangezien zij de sleutels bevatten tot de politieke prioriteiten, economische strijd en sociale zorgen van een natie, maar zij zijn grotendeels afgeschermd gebleven van systematische analyse.

Een team onderzoekers van de Universiteit van Moratuwa in Sri Lanka heeft nu een nieuwe manier gebouwd om deze schatkist aan informatie te ontsluiten. Ze richtten hun aandacht op de Hansards, de officiële transcripten van het Sri Lankese parlement, die duizenden toespraken bevatten die in het Singalees, Tamil en Engels zijn gehouden, vaak gemengd binnen een enkel betoog. Deze documenten zijn berucht moeilijk te verwerken omdat ze bestaan uit gescande PDF's met verwarrende kolommenlay-outs en inconsistente formattering die traditionele leessoftware doorbreken. Om dit op te lossen, gebruikten de onderzoekers eerst een krachtig kunstmatige intelligentie-instrument in staat om deze rommelige documenten te lezen en de werkelijke gesproken woorden te extraheren, waarbij de visuele ruis van de pagina werd genegeerd. Vervolgens voedden ze deze schoongemaakte tekst aan een systeem dat ontworpen is om de betekenis van woorden over verschillende talen heen te begrijpen, in plaats van alleen te tellen hoe vaak ze voorkomen. Door de toespraken in kaart te brengen in een digitale ruimte waar vergelijkbare ideeën dicht bij elkaar liggen, ongeacht de gebruikte taal, waren zij in staat om duizenden individuele toespraken in samenhangende thema's te groeperen.

Het resultaat van deze inspanning is een heldere kaart van het nationale politieke gesprek over bijna een decennium, van 2017 tot 2026. De onderzoekers analyseerden 19.553 toespraken en organiseerden deze succesvol in 30 belangrijke onderwerpen, variërend van energiezekerheid en economische crises tot nationale veiligheid en gezondheidszorg. Wat deze prestatie zo belangrijk maakt, is dat de computer dit deed zonder te worden verteld waarnaar hij moest zoeken; het ontdekte de thema's op eigen kracht. Het systeem vond dat toespraken over de economie dramatisch toenamen tijdens de financiële crisis van 2022 en de daaropvolgende periode van burgerlijke onrust, terwijl discussies over nationale veiligheid piekten na de aanslagen van Pasen in 2019. Cruciaal was dat het model de drie talen behandelde als een enkele, verenigde stroom van gesprek. Een toespraak in het Tamil over een specifiek beleidsvraagstuk werd gegroepeerd met een toespraak in het Singalees over hetzelfde onderwerp, wat bewees dat de onderliggende betekenis belangrijker was dan de taal die werd gebruikt om het uit te drukken.

De onderzoekers testten ook of oudere, meer traditionele methoden voor tekstanalyse deze taak aan konden. Ze ontdekten dat standaard benaderingen, die vertrouwen op het tellen van woordcombinaties, volledig faalden. Deze oudere methoden konden de kloof tussen de verschillende talen niet overbruggen of de complexe woordstructuren van het Singalees en Tamil aan kunnen, wat resulteerde in gefragmenteerde en betekenisloze groepen. In contrast hiermee slaagde de nieuwe benadering, die deep learning gebruikt om context te begrijpen, erin om de structuur van de debatten te identificeren. Het team verkende ook een hybride methode die het diepe begrip van betekenis combineerde met een focus op specifieke trefwoorden om te zien of het de groepen nog scherper kon maken. Hoewel deze methode de grenzen tussen onderwerpen duidelijker maakte, betekende dit ook dat sommige toespraken volledig buiten de groepen vielen, wat wijst op een afruil tussen precisie en dekking.

Uiteindelijk demonstreert dit werk dat het mogelijk is om zin te geven aan complexe, meertalige politieke discours zonder menselijke tussenkomst. Door de diverse talen van Sri Lanka te behandelen als een enkele, rijke dataset, waren de onderzoekers in staat om te onthullen hoe de aandacht van de natie verschuift als reactie op de realiteit van de wereld. De bevindingen tonen aan dat de onderwerpen die in het parlement worden besproken niet willekeurig zijn; ze stijgen en dalen in directe reactie op de uitdagingen van het land, van het beheer van de publieke schuld tot de zorg voor de zieken. Dit nieuwe kader biedt een solide fundament voor toekomstige studies, waardoor onderzoekers en het publiek de evolutie van politieke prioriteiten kunnen volgen met een helderheid die voorheen onmogelijk was, waarmee een chaotisch archief van toespraken wordt omgevormd tot een gestructureerd verhaal van de reis van een natie.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →