mdok-style at SemEval-2026 Task 10: Finetuning LLMs for Conspiracy Detection
L'article présente le système de style mdok, qui obtient des résultats compétitifs (8e sur 52) dans le défi de détection de conspiration de la tâche 10 de SemEval-2026 en affinant le modèle Qwen3-32B avec augmentation des données et auto-apprentissage pour pallier le manque de données d'entraînement.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayez de repérer un type spécifique de rumeur au sein d'une foule massive et bruyante de personnes discutant sur une plateforme de médias sociaux (Reddit). Certaines personnes partagent simplement des faits, tandis que d'autres propagent de folles théories du complot. Votre tâche consiste à construire un détective robot capable d'écouter un seul commentaire et de crier : « Oui, c'est un complot ! » ou « Non, ce sont juste des propos normaux. »
Ce papier décrit comment l'équipe mdok-style a construit son détective robot pour une compétition appelée SemEval-2026 Task 10. Voici comment ils ont procédé, expliqué simplement :
1. Le Problème : Une Petite Bibliothèque pour un Cerveau Géant
L'équipe avait un gros problème : elle disposait d'un robot très intelligent (un Grand Modèle de Langage appelé Qwen3-32B, comparable à un super-cerveau avec 32 milliards de « neurones »), mais elle ne possédait qu'une toute petite bibliothèque de livres d'entraînement (environ 4 000 exemples de commentaires).
Habituellement, enseigner à un super-cerveau nécessite une bibliothèque massive. Avec si peu d'exemples, le robot risque de se confondre ou de « trop réfléchir ». C'est comme essayer d'enseigner à un chef étoilé comment cuisiner un plat complexe en n'utilisant que trois recettes.
2. La Solution : La « Machine à Copier Magique » et la Boucle « Élève-Maître »
Pour résoudre le problème de la petite bibliothèque, l'équipe a utilisé deux astuces ingénieuses empruntées à leurs travaux précédents sur la détection de textes générés par l'IA.
Astuce A : La Machine à Copier Magique (Augmentation des Données)
Au lieu de simplement copier les commentaires existants, ils ont utilisé une « machine à copier magique » pour créer des versions légèrement différentes des mêmes histoires. Ils ne se sont pas contentés de copier-coller ; ils ont :
- Modifié la casse : Ils ont écrit certains commentaires EN MAJUSCULES et d'autres en minuscules. Ils ont constaté qu'une théorie du complot reste une théorie du complot, qu'elle soit criée ou chuchotée.
- Caché les identités : Ils ont remplacé des noms spécifiques, des adresses e-mail et des numéros de téléphone par des balises génériques comme
[USER]ou[PHONE]. Cela a appris au robot à se concentrer sur l'idée du complot, et non sur des personnes spécifiques. - Échangé les lettres : Ils ont remplacé certaines lettres par des ressemblantes provenant d'autres alphabets (comme remplacer un « a » par un « alpha » grec). C'est comme porter un déguisement. En entraînant le robot à voir à travers ces déguisements, ils ont rendu beaucoup plus difficile la possibilité qu'il soit trompé par des astuces visuelles plus tard.
Ils n'ont pas utilisé toutes ces copies, seulement une petite tranche (10 %) d'entre elles, pour maintenir l'équilibre de l'entraînement.
Astuce B : La Boucle Élève-Maître (Auto-apprentissage)
C'est la partie la plus créative. Comme ils n'avaient pas d'étiquettes pour les données de test (les questions de l'examen final), ils ont laissé le robot s'enseigner lui-même.
- Le Maître : D'abord, ils ont entraîné le robot sur la petite bibliothèque connue.
- L'Examen : Ils ont demandé au robot de deviner les réponses pour les commentaires de test inconnus.
- Le Filtre : Le robot était très confiant pour certaines réponses (par exemple : « Je suis sûr à 99 % que c'est un complot »). L'équipe n'a retenu que ces devinettes ultra-confiantes et les a traitées comme de nouvelles données d'entraînement « référence or ».
- La Re-leçon : Ils ont nourri le robot avec ces nouveaux exemples « or » et l'ont réentraîné. C'est comme un élève qui passe un test d'entraînement, ne conserve que les questions qu'il a eues 100 % justes, puis les étudie à nouveau pour devenir encore plus intelligent.
3. Le Résultat : Un Détective de Haut Niveau
L'équipe a inscrit son robot à la compétition.
- Le Score : Leur robot a obtenu un score de 0,78 (sur une échelle où 1,0 est parfait).
- Le Classement : Sur 52 équipes, ils ont terminé 8ᵉ. Cela les place dans le top 20 % (le 85ᵉ percentile).
Fait intéressant, ils ont constaté qu'un robot beaucoup plus petit et plus simple (un modèle appelé DeBERTa) performait presque aussi bien que leur super-cerveau géant. Cela suggère que, bien que leurs astuces sophistiquées de « machine à copier magique » et d'« auto-apprentissage » aient très bien fonctionné, un outil plus petit et moins coûteux peut parfois faire le travail presque aussi efficacement.
Résumé
L'équipe a pris un modèle d'IA massif et puissant et l'a entraîné à repérer les théories du complot dans les commentaires des médias sociaux. Parce qu'ils ne disposaient pas de suffisamment de données, ils ont utilisé des déguisements (modification des formats de texte) pour créer plus de matériel d'entraînement et ont laissé l'IA s'enseigner elle-même en utilisant ses propres devinettes confiantes. Le résultat fut un système hautement compétitif classé 8ᵉ sur 52, prouvant que des techniques initialement conçues pour détecter les textes générés par l'IA peuvent également être utilisées pour repérer les théories du complot créées par des humains.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.