← Nieuwste papers
💬 NLP

PSK at SemEval-2026 Task 9: Multilingual Polarization Detection Using Ensemble Gemma Models with Synthetic Data Augmentation

Het PSK-team behaalde met een gemiddelde macro-F1-score van 0,811 de tweede plaats overall in SemEval-2026 Taak 9 door gebruik te maken van een ensemble van LoRA-fine-tuned Gemma 3-modellen, verrijkt met door GPT-4o-mini gegenereerde synthetische data en per-taal drempelafstelling, terwijl het de kritieke belangrijkheid aantoont van generalisatie ten opzichte van architecturen die goed presteerden op ontwikkelingssets maar faalden op de testset.

Oorspronkelijke auteurs: Srikar Kashyap Pulipaka

Gepubliceerd 2026-05-07
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Srikar Kashyap Pulipaka

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een groep van 22 verschillende studenten (die 22 verschillende talen vertegenwoordigen) probeert te leren een "opgewonden discussie" te onderscheiden van een "rustig gesprek" in socialemediaberichten. Dit was de uitdaging voor SemEval-2026 Task 9, en het team PSK (geleid door onafhankelijk onderzoeker Srikar Kashyap Pulipaka) bouwde een systeem om dit op te lossen.

Hier is hoe ze het deden, eenvoudig uitgelegd:

1. Het Doel: De "Hitte" Opmerken

De taak was om socialemediaberichten in 22 talen (van Engels tot Amhaars) te lezen en te beslissen: Is dit bericht gepolariseerd (vol met stereotypen, haat of intolerantie)? Of is het neutraal?

  • De Uitdaging: Sommige talen hadden zeer weinig voorbeelden om van te leren, en "polarisatie" ziet er in elke cultuur anders uit. Het is als iemand proberen te leren een "storm" te herkennen terwijl ze alleen regen hebben gezien in één land.

2. De Leraren: De "Gemma"-Modellen

In plaats van één grote leraar voor iedereen te gebruiken, huurde het team twee specifieke "tutors" in voor elke taal:

  • De 12B Tutor: Een slim, efficiënt model (12 miljard parameters).
  • De 27B Tutor: Een nog slimmer, krachtiger model (27 miljard parameters).
    Ze gebruikten een techniek genaamd LoRA, wat vergelijkbaar is met het geven van deze tutors een klein, gespecialiseerd "spiekbriefje" om de specifieke taal te leren zonder hun hele brein te hoeven herschrijven.

3. De Studiepartner: Synthetische Data

Het team besefte dat sommige studenten niet genoeg oefenopgaven hadden. Dus gebruikten ze een AI (GPT-4o-mini) om nep-oefenopgaven te schrijven (synthetische data).

  • Directe Generatie: De AI schreef nieuwe, nep-argumenten van scratch.
  • Parafraseren: De AI nam echte voorbeelden en herschreef ze in andere woorden (zoals een student die een huiswerkvraag parafraseert).
  • Contrastieve Paren: De AI creëerde "tweeling"-voorbeelden – één gepolariseerd en één rustig – zodat het model het exacte verschil kon zien.
  • De Filter: Ze gooiden deze nep-data niet zomaar ergens in. Ze voerden het door een strenge "kwaliteitscontrole"-filter om duplicaten en onzin te verwijderen, zodat de studenten alleen hoogwaardig materiaal bestudeerden.

4. De Strategie: De "Volumeknop" Afstellen

Na het trainen moesten de modellen een definitieve beslissing nemen. Normaal gesproken zegt AI "Ja" als het meer dan 50% zeker is. Maar het team ontdekte dat voor sommige talen 50% te hoog of te laag was.

  • De Oplossing: Ze behandelden de beslissingsdrempel als een volumeknop. Voor sommige talen draaiden ze de knop naar beneden tot 30% (om meer argumenten te vangen), en voor anderen draaiden ze hem omhoog tot 70% (om valse alarmen te voorkomen). Deze simpele aanpassing verbeterde hun scores met 2–4% zonder extra training.

5. De "Ensemble": Een Panel van Rechters

Voor de uiteindelijke beslissing luisterden ze niet naar slechts één tutor. Ze gebruikten een Ensemble:

  • Ze lieten zowel de 12B- als de 27B-tutor stemmen.
  • Soms middelden ze de stemmen; andere keren gaven ze meer gewicht aan de slimmere tutor.
  • Voor elke taal kozen ze de stemstrategie die het beste werkte op oefentoetsen.

6. De Resultaten: Wie Won?

  • De Winnaar: Het team eindigde 2e overall van de 60 teams.
  • De Score: Ze behaalden een score van 0,811 (een maatstaf voor nauwkeurigheid). Ze behaalden 1e plaats in 3 talen en top-3 in 8 andere.
  • De Verrassing: Ze probeerden andere beroemde AI-modellen te gebruiken (XLM-RoBERTa en Qwen3). Deze modellen deden het geweldig op oefentoetsen, maar crashten op de echte toets, waarbij ze 30–50% van hun nauwkeurigheid verloren.
    • De Les: Het is beter om een model te hebben dat goed generaliseert (het concept van polarisatie leert) dan een model dat alleen de oefenantwoorden uit het hoofd leert. De Gemma-modellen waren de enigen die niet "vergeten" wanneer de toets begon.

7. De Enige Zwakke Plek: Het Italiaanse "Ontbrekende Hoofdstuk"

Het systeem had de meeste moeite met Italiaans. Waarom?

  • De trainingsdata voor Italiaans miste hele categorieën van onderwerpen (zoals "politiek" of "andere" kwesties).
  • Echter, de definitieve toets bevatte veel vragen over die ontbrekende onderwerpen.
  • Het is als studeren voor een wiskundetoets alleen over optellen, maar het eindexamen bevat een groot hoofdstuk over delen. Het model had die specifieke soorten argumenten nooit eerder gezien, dus kon het niet correct raden.

Samenvatting

Het team bouwde een systeem dat gespecialiseerde AI-tutors, door AI gegenereerde oefenopgaven en op maat afgestemde beslissingsregels gebruikt om online discussies in 22 talen op te sporen. Hun geheime wapen was niet alleen het gebruik van de grootste AI, maar het gebruik van degene die het concept van polarisatie daadwerkelijk kon leren zonder de antwoorden uit het hoofd te leren, en vervolgens de regels voor elke specifieke taal fijnafstelde.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →