← Derniers articles
💬 NLP

ToxSyn-PT: A Synthetic Fine-Grained Dataset of Minority-Targeted Toxic Language in Portuguese

Cet article présente ToxSyn-PT, le premier ensemble de données synthétiques à grande échelle en portugais présentant des annotations de discours de haine multi-labels et à granularité fine sur neuf groupes minoritaires avec des contre-exemples non toxiques essentiels, révélant que les modèles entraînés sur des données de réseaux sociaux ne parviennent pas à se généraliser aux contextes spécifiques aux minorités et soulignant les limites des métriques d'évaluation standards.

Auteurs originaux : Iago Alves Brito, Julia Soares Dollis, Fernanda Bufon Farber, Diogo Fernandes, Arlindo R. Galvão Filho

Publié 2026-06-23
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Iago Alves Brito, Julia Soares Dollis, Fernanda Bufon Farber, Diogo Fernandes, Arlindo R. Galvão Filho

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayiez d'apprendre à un robot à repérer un intimidateur dans une cour de récréation. Pendant longtemps, les chercheurs n'ont pu enseigner au robot qu'en utilisant des exemples provenant de cours de récréation anglophones, et même là, ils lui montraient principalement les intimidateurs évidents et criards. Ils lui montraient rarement les intimidateurs subtils et sournois qui cachent leurs paroles méchantes derrière des blagues ou des « simples questions ».

Maintenant, imaginez essayer d'apprendre au robot à comprendre le portugais. Le problème est qu'il n'existe presque aucun bon manuel (jeu de données) en portugais montrant la différence entre une attaque malveillante visant un groupe spécifique de personnes et une conversation normale et amicale sur ces mêmes personnes.

Ce document présente ToxSyn-PT, un tout nouveau et massif « manuel » créé spécifiquement pour résoudre ce problème. Voici comment les auteurs l'ont construit et ce qu'ils ont découvert, expliqué simplement :

1. Le Problème : L'échec du « Taille unique pour tous »

Considérez les jeux de données de discours de haine existants en portugais comme une bibliothèque qui ne contient que des livres sur Twitter. Si vous entraînez votre robot en utilisant uniquement des livres de Twitter, il devient un expert pour repérer les cris colériques et bruyants courants sur les réseaux sociaux.

Cependant, les auteurs ont découvert que lorsqu'ils prenaient ce robot « entraîné sur Twitter » et le plaçaient dans une autre pièce (comme une section de commentaires de presse ou une discussion formelle), il devenait complètement aveugle. Il ne pouvait pas reconnaître le discours de haine là, car le « langage de l'intimidateur » change selon la pièce où l'on se trouve.

  • L'analogie : C'est comme apprendre à un étudiant à reconnaître un « loup » uniquement en regardant des loups dans un zoo. Quand cet étudiant va dans la forêt, il ne reconnaît pas le loup parce qu'il a une apparence différente dans la nature.

2. La Solution : Construire une « Salle de sport de l'entraînement » synthétique

Puisqu'il n'y avait pas assez d'exemples réels de discours de haine en portugais ciblant des groupes spécifiques (comme les personnes noires, les femmes, les personnes LGBTQIA+, les personnes âgées, etc.), les auteurs ont décidé de créer leurs propres exemples en utilisant l'IA.

Ils ont créé une chaîne de montage en quatre étapes (un pipeline) pour générer 53 000 phrases :

  • Étape 1 : La Graine. Ils ont commencé avec une petite collection de haute qualité d'exemples écrits par des humains (à la fois méchants et gentils) concernant deux groupes.
  • Étape 2 : L'Expansion. Ils ont utilisé une IA (GPT-4) pour examiner ces graines et écrire des milliers de nouvelles variations, ciblant neuf différents groupes minoritaires.
  • Étape 3 : La Paraphrase. Ils ont pris ces nouvelles phrases et les ont réécrites dans différents styles. Crucialement, ils n'ont pas seulement écrit des choses méchantes ; ils ont aussi écrit des choses gentilles sur ces mêmes groupes. Cela est vital car cela apprend à l'IA la différence entre haïr un groupe et parler d'un groupe.
  • Étape 4 : L'Enrichissement. Ils ont ajouté des formes de préjugés encore plus complexes et subtiles (comme le « préjugé ambigu » où la haine est cachée dans un double sens) pour rendre l'entraînement plus difficile et plus performant.

Le Résultat : Un jeu de données massif qui est parfaitement équilibré. Il contient des phrases méchantes, des phrases gentilles et des phrases neutres, toutes étiquetées avec précision selon la personne ciblée et le « procédé rhétorique » utilisé (comme le sarcasme ou la victimisation).

3. La Grande Découverte : « Échec Catastrophique »

Les auteurs ont testé leurs nouveaux modèles d'IA contre les anciens. Les résultats sont frappants :

  • Les anciens modèles : Lorsqu'ils ont essayé d'utiliser des modèles entraînés sur les réseaux sociaux généraux pour détecter les discours de haine dans ce nouveau jeu de données spécifique, ils ont échoué lamentablement. Ils ont manqué presque toute la haine.
  • Les nouveaux modèles : Lorsqu'ils ont entraîné des modèles sur ToxSyn-PT, ces modèles étaient excellents pour repérer la haine dans leur propre « salle de sport », mais ils ont également échoué lors des tests sur les anciennes données de réseaux sociaux.

La Métaphore : C'est comme entraîner un nageur pour faire des courses dans une piscine. Il devient un nageur de piscine de classe mondiale. Mais si vous le mettez dans l'océan, il se noie. Inversement, si vous l'entraînez dans l'océan, il ne peut pas nager dans la piscine. L'« eau » (le contexte) est tout simplement trop différente.

Cela prouve que le discours de haine n'est pas une chose unique. Il change en fonction de qui est attaqué et de l'endroit où se déroule la conversation. Les auteurs avertissent également que les « feuilles de score » standards (comme le Macro F1) peuvent être trompeuses ; un robot peut obtenir un score élevé globalement mais échouer complètement dans sa tâche la plus importante : repérer la haine spécifique qu'il était censé trouver.

4. Pourquoi cela importe

Ce document ne prétend pas avoir résolu le problème du discours de haine pour toujours. Au lieu de cela, il fournit le premier « gymnase » de haute qualité pour que l'IA en portugais apprenne à distinguer la haine réelle d'une discussion normale sur les minorités.

  • Avant : Les chercheurs devaient deviner ou utiliser de petits jeux de données déséquilibrés qui manquaient de nuance.
  • Maintenant : Ils disposent d'une ressource massive et équilibrée qui inclut les « bons » exemples nécessaires pour enseigner à l'IA ce qu'elle ne doit pas signaler comme étant de la haine.

Les auteurs ont rendu ce jeu de données public afin que d'autres chercheurs puissent l'utiliser pour construire des systèmes d'IA meilleurs et plus prudents, capables de comprendre les manières subtiles et dangereuses dont le discours de haine cible les communautés vulnérables en portugais.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →