← Derniers articles
💬 NLP

PSK at SemEval-2026 Task 9: Multilingual Polarization Detection Using Ensemble Gemma Models with Synthetic Data Augmentation

L'équipe PSK a obtenu la 2e place globale à la tâche 9 de SemEval-2026 avec un macro-F1 moyen de 0,811 en utilisant un ensemble de modèles Gemma 3 affinés par LoRA, enrichis par des données synthétiques générées par GPT-4o-mini et un réglage des seuils par langue, tout en démontrant l'importance cruciale de la généralisation par rapport à des architectures qui ont bien performé sur les ensembles de développement mais ont échoué sur l'ensemble de test.

Auteurs originaux : Srikar Kashyap Pulipaka

Publié 2026-05-07
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Srikar Kashyap Pulipaka

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez d'enseigner à un groupe de 22 étudiants différents (représentant 22 langues distinctes) comment repérer une « dispute animée » par rapport à une « conversation calme » dans les publications sur les réseaux sociaux. C'était le défi de la SemEval-2026 Task 9, et l'équipe PSK (dirigée par le chercheur indépendant Srikar Kashyap Pulipaka) a construit un système pour le résoudre.

Voici comment ils ont procédé, expliqué simplement :

1. L'Objectif : Repérer la « Chaleur »

La tâche consistait à lire des publications sur les réseaux sociaux dans 22 langues (de l'anglais à l'amharique) et à décider : ce post est-il polarisé (plein de stéréotypes, de haine ou d'intolérance) ? Ou est-il neutre ?

  • Le Défi : Certaines langues disposaient de très peu d'exemples pour apprendre, et la « polarisation » se manifeste différemment dans chaque culture. C'est comme essayer d'enseigner à quelqu'un de reconnaître une « tempête » alors qu'il n'a vu de la pluie que dans un seul pays.

2. Les Enseignants : Les modèles « Gemma »

Au lieu d'utiliser un seul grand enseignant pour tout le monde, l'équipe a engagé deux « tuteurs » spécifiques pour chaque langue :

  • Le Tuteur 12B : Un modèle intelligent et efficace (12 milliards de paramètres).
  • Le Tuteur 27B : Un modèle encore plus intelligent et puissant (27 milliards de paramètres).
    Ils ont utilisé une technique appelée LoRA, qui revient à donner à ces tuteurs une petite « triche » spécialisée pour apprendre la langue spécifique sans avoir à réécrire l'intégralité de leur cerveau.

3. Le Compagnon d'Étude : Les Données Synthétiques

L'équipe a réalisé que certains étudiants n'avaient pas assez de problèmes d'entraînement. Ils ont donc utilisé une IA (GPT-4o-mini) pour rédiger de faux problèmes d'entraînement (données synthétiques).

  • Génération Directe : L'IA a rédigé de nouveaux faux arguments à partir de zéro.
  • Paraphrase : L'IA a pris de vrais exemples et les a réécrits avec d'autres mots (comme un étudiant reformulant une question de devoir).
  • Paires Contrastives : L'IA a créé des exemples « jumeaux » — l'un polarisé et l'autre calme — afin que le modèle puisse voir la différence exacte.
  • Le Filtre : Ils n'ont pas simplement versé ces données factices en vrac. Ils les ont soumises à un filtre strict de « contrôle qualité » pour éliminer les doublons et les absurdités, garantissant ainsi que les étudiants n'étudiaient que du matériel de haute qualité.

4. La Stratégie : Régler le « Bouton de Volume »

Après l'entraînement, les modèles devaient prendre une décision finale. Habituellement, l'IA dit « Oui » si elle est sûre à plus de 50 %. Mais l'équipe a constaté que pour certaines langues, 50 % était trop élevé ou trop bas.

  • La Solution : Ils ont traité le seuil de décision comme un bouton de volume. Pour certaines langues, ils ont baissé le bouton à 30 % (pour attraper plus d'arguments), et pour d'autres, ils l'ont monté à 70 % (pour éviter les fausses alertes). Ce simple ajustement a amélioré leurs scores de 2 à 4 % sans aucun entraînement supplémentaire.

5. L'« Ensemble » : Un Panel de Juges

Pour la décision finale, ils n'ont pas écouté un seul tuteur. Ils ont utilisé un Ensemble :

  • Ils ont laissé les deux tuteurs 12B et 27B voter.
  • Parfois, ils ont moyenné les votes ; d'autres fois, ils ont accordé plus de poids au tuteur plus intelligent.
  • Pour chaque langue, ils ont choisi la stratégie de vote qui fonctionnait le mieux lors des tests d'entraînement.

6. Les Résultats : Qui a gagné ?

  • Le Vainqueur : L'équipe a terminé 2e au total sur 60 équipes.
  • Le Score : Ils ont obtenu un score de 0,811 (une mesure de précision). Ils ont pris la 1re place dans 3 langues et le top 3 dans 8 autres.
  • La Surprise : Ils ont essayé d'utiliser d'autres modèles d'IA célèbres (XLM-RoBERTa et Qwen3). Ces modèles ont excellé lors des tests d'entraînement mais se sont effondrés lors du vrai test, perdant 30 à 50 % de leur précision.
    • La Leçon : Il vaut mieux avoir un modèle qui généralise bien (apprend le concept de polarisation) qu'un modèle qui se contente de mémoriser les réponses des exercices. Les modèles Gemma étaient les seuls à ne pas « oublier » lorsque le test a commencé.

7. Le Seul Point Faible : Le « Chapitre Manquant » Italien

Le système a eu le plus de mal avec l'italien. Pourquoi ?

  • Les données d'entraînement pour l'italien manquaient de catégories entières de sujets (comme la « politique » ou d'autres problèmes).
  • Cependant, le test final comprenait de nombreuses questions sur ces sujets manquants.
  • C'est comme étudier pour un examen de mathématiques uniquement sur l'addition, mais que l'examen final comprenne une grande section sur la division. Le modèle n'avait jamais vu ces types spécifiques d'arguments auparavant, il ne pouvait donc pas deviner correctement.

Résumé

L'équipe a construit un système qui utilise des tuteurs IA spécialisés, des problèmes d'entraînement générés par IA et des règles de décision personnalisées pour repérer les disputes en ligne dans 22 langues. Leur secret n'était pas seulement d'utiliser la plus grande IA, mais d'utiliser celle qui pouvait réellement apprendre le concept de polarisation sans mémoriser les réponses, puis d'ajuster finement les règles pour chaque langue spécifique.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →