Leveraging LLMs for Context-Aware Implicit Textual and Multimodal Hate Speech Detection
Cet article démontre que l'exploitation des grands modèles de langage pour générer un contexte de fond auxiliaire et son incorporation via la concaténation d'embeddings améliore significativement la détection de la haine implicite dans les contextes textuels et multimodaux, surpassant ainsi les bases de référence sans contexte et les approches existantes de liaison d'entités.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
L'internet est un vaste et bruyant marché de l'expression humaine, où les mots les plus dangereux sont souvent ceux qui ne crient pas. S'il est relativement facile pour un ordinateur de repérer les insultes évidentes ou les menaces directes, un autre type de toxicité se cache à la vue de tous. Il s'agit du discours de haine implicite : une hostilité qui repose sur l'ironie, les codes culturels ou une compréhension partagée du monde pour faire passer son message. Une phrase qui semble inoffensive en soi peut devenir une attaque venimeuse lorsqu'elle est examinée à travers le prisme d'un événement spécifique, d'une référence historique ou d'une plaisanterie interne à une communauté. Pendant des années, des chercheurs ont tenté d'apprendre aux ordinateurs à percevoir ces significations cachées, mais ils se sont heurtés à un problème fondamental : les machines manquent des connaissances de base que les humains tiennent pour acquises. Elles peuvent lire les mots, mais elles ne connaissent pas l'histoire qui se cache derrière eux.
Pour résoudre ce problème, une équipe de chercheurs de la Vrije Universiteit Amsterdam a décidé de donner un tuteur aux modèles informatiques. Ils se sont tournés vers les grands modèles de langage, ces mêmes systèmes d'intelligence artificielle puissants capables de rédiger des essais ou de tenir des conversations, et leur ont demandé de faire quelque chose de spécifique. Au lieu de laisser l'IA agir comme le juge de ce qui est haineux, ils l'ont utilisée comme un vérificateur de faits et un historien. Pour chaque publication sur les réseaux sociaux analysée par le système, l'IA devait générer un court paragraphe de contexte de fond. Si une publication mentionnait un groupe politique obscur ou un mème viral, l'IA expliquait qui ils étaient et ce qu'ils incarnaient, comblant ainsi les lacunes de connaissance du monde qui échapperaient à un programme informatique standard. Les chercheurs ont ensuite testé quatre manières différentes d'injecter cette nouvelle information dans leur système de détection, demandant si le simple fait de coller les faits à côté de la publication suffisait, ou si l'ordinateur devait traiter la publication et les faits séparément pour comprendre l'intention réelle.
Les résultats de cette expérience étaient clairs et mesurables. Lorsque les chercheurs ont testé leur méthode sur un ensemble de données comprenant des milliers de tweets contenant de la haine implicite, le système utilisant le contexte de fond généré par l'IA a obtenu des performances nettement supérieures aux modèles qui ne reposaient que sur le texte brut. L'approche la plus fructueuse impliquait une technique spécifique où l'ordinateur créait une représentation numérique de la publication originale et une représentation distincte de l'histoire de fond générée, puis combinait ces deux pièces d'information distinctes. Cette méthode a amélioré la capacité du système à identifier correctement le contenu haineux jusqu'à trois points de pourcentage par rapport à un système sans aucun contexte. L'amélioration fut encore plus spectaculaire lorsque les chercheurs ont appliqué la même logique à un autre type de contenu : les mèmes internet. Les mèmes combinent images et texte, s'appuyant souvent sur des indices visuels qui sont tout aussi déroutants pour une machine que le langage codé l'est pour un humain. Sur un ensemble de données de mèmes misogynes, le système enrichi par le contexte a amélioré sa précision de près de six points de pourcentage.
Cependant, le chemin vers une meilleure détection n'était pas sans embûches. Les chercheurs ont constaté que le simple ajout de mots à une publication n'aidait pas toujours ; en fait, cela rendait parfois l'ordinateur confus. Lorsque l'IA générait une explication longue et détaillée pour une publication qui était déjà clairement haineuse, l'information supplémentaire diluait parfois le message original, faisant manquer la haine au système. Inversement, lorsque l'IA générait une histoire de fond pour une publication inoffensive, elle inventait parfois des connexions avec des idées haineuses qui n'existaient pas, conduisant le système à signaler faussement du contenu innocent comme dangereux. Cela se produisait parce que l'IA, dans sa volonté d'être utile, surinterprétait parfois une phrase neutre ou un avertissement concernant un groupe comme une approbation de la haine. L'étude a montré que si la fourniture de connaissances de fond est un outil puissant, elle doit être manipulée avec soin. La méthode la plus efficace n'était pas de fusionner la publication et le contexte en un seul bloc de texte, mais de les maintenir distincts jusqu'à la fin de l'analyse, permettant à l'ordinateur de peser le message original par rapport à la nouvelle information sans que l'un n'étouffe l'autre.
Ce travail a également remis en question une hypothèse courante dans le domaine : celle selon laquelle l'intelligence artificielle la plus puissante devrait être celle qui effectue le jugement final. Les chercheurs ont testé si le grand modèle de langage pouvait simplement lire la publication et décider si elle était haineuse, agissant ainsi comme le classificateur lui-même. Bien que l'IA soit très performante pour cela, notamment avec les mèmes visuels, elle n'a pas surpassé le système de détection spécialisé qui utilisait l'IA uniquement pour générer les faits de fond. Cela suggère que la meilleure approche actuelle est un partenariat : utiliser le grand modèle de langage comme une bibliothèque dynamique pour récupérer les faits pertinents, puis utiliser un système plus simple et plus ciblé pour prendre la décision finale basée sur ces faits. Cette approche modulaire permet au système d'apprendre les schémas spécifiques de la haine tout en ayant accès à la vaste connaissance du monde qui rend la haine implicite compréhensible.
En fin de compte, l'étude démontre que le contexte n'est pas seulement un ajout utile à la détection de la haine ; c'est une nécessité pour comprendre le langage subtil et codé de l'internet moderne. En traitant la génération d'informations de fond comme une étape distincte de l'acte de classification, les chercheurs ont créé un système plus précis et plus robuste. Ils ont montré que la clé pour attraper la haine cachée ne réside pas seulement dans la lecture des mots, mais dans la compréhension du monde que ces mots décrivent. Bien que le système ne soit pas parfait et lutte encore avec la frontière ténue entre l'ironie inoffensive et la malveillance réelle, les conclusions offrent une direction claire pour l'avenir. À mesure que l'intelligence artificielle continue d'évoluer, la capacité de générer et d'intégrer un contexte pertinent deviendra probablement la norme pour tout système chargé de protéger les espaces en ligne contre les formes les plus insidieuses de l'expression humaine.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.