Towards Unified Multimodal Misinformation Detection in Social Media: A Benchmark Dataset and Baseline
Cet article présente OmniFake, un ensemble de données de référence à grande échelle combinant la désinformation conçue par l'homme et le contenu généré par l'IA, ainsi que le cadre UMFDet qui utilise une architecture de mélange d'experts sensible aux catégories pour unifier et surpasser les modèles spécialisés dans la détection de divers types de tromperies multimodales sur les réseaux sociaux.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez l'internet comme une immense place de village animée où tout le monde crie des histoires, partage des photos et publie des nouvelles. Dans cette place, il y a deux sortes principales de fauteurs de troubles. Le premier genre est le « Trickster Humain » : une personne qui écrit une fausse histoire ou modifie une photo juste pour attirer l'attention, répandre une rumeur ou mettre les gens en colère. Le second genre est l'« Artiste Robot » : un puissant programme informatique capable de peindre le portrait d'un chien volant ou d'écrire un titre de presse convaincant sur un événement qui n'a jamais eu lieu. Pendant longtemps, les personnes qui tentaient de garder la place du village en sécurité (les chercheurs) ont construit deux gardes du corps différents. Un garde était un expert pour repérer les mensonges humains, et l'autre était un expert pour repérer les faux produits par des robots. Mais dans le monde réel, un message sournois peut provenir d'un humain, d'un robot, ou d'un mélange des deux, et les gardes du corps ne savaient pas lequel appeler. C'était comme avoir un service de pompiers qui ne sait éteindre que les feux de bois et une force de police qui ne sait attraper que des braqueurs de banques ; quand un incendie se déclare dans une banque, aucune des deux équipes ne sait quoi faire. Ce document intervient dans ce chaos pour construire un détective unique et super intelligent capable de gérer n'importe quel type de fausse information, peu importe qui l'a créée.
Les auteurs de ce document, une équipe issue d'universités et d'entreprises technologiques en Chine, ont réalisé que l'ancienne méthode consistant à séparer les « mensonges humains » des « faux générés par l'IA » était trop lente et maladroite pour le monde réel. Ils ont donc créé un nouveau terrain d'entraînement massif appelé OmniFake. Considérez ce jeu de données comme une immense bibliothèque de 98 592 exemples — presque 100 000 publications ! — qui inclut des informations réelles, des rumeurs écrites par des humains et des trucages générés par l'IA. Ils ne se sont pas contentés de les collecter ; ils les ont fabriqués. Ils ont pris de vraies photos et ont utilisé l'IA pour échanger des visages, changer des arrière-plans ou même générer des images entièrement nouvelles de choses qui n'existent pas. Ils ont également pris de vrais titres et ont utilisé l'IA pour les réécrire en histoires trompeuses. Ils ont même mélangé ces techniques pour créer une « Manipulation Mixte », où un message possède une photo réelle mais une histoire fausse, ou une photo fausse avec une histoire réelle. Pour tester la difficulté de l'exercice, ils ont demandé à huit experts humains d'examiner 600 de ces échantillons. Les humains n'ont réussi qu'environ 40 % des cas, prouvant que ces faux sont incroyablement difficiles à déceler.
Pour résoudre cela, l'équipe a construit un nouveau système de détection appelé UMFDet. Au lieu d'embaucher deux gardes séparés, ils ont construit un cerveau intelligent doté d'une « équipe d'experts » à l'intérieur. Imaginez un centre de contrôle qui reçoit un message (une image et un texte) puis demande : « Quel est le meilleur expert pour regarder ceci ? » Le système dispose de trois experts spécialisés : un pour les informations Réelles, un pour les mensonges conçus par l'Humain, et un pour les faux synthétisés par l'IA. C'est ce qu'on appelle un « Mélange d'Experts sensible à la Catégorie » (Category-aware Mixture-of-Experts). Lorsqu'un message arrive, le système l'oriente vers le bon expert. Mais voici la partie astucieuse : ils ont veillé à ce que ces experts ne se trompent pas. Ils ont utilisé une règle d'entraînement spéciale (appelée « Régularisation Discriminante par Expert ») pour forcer l'« Expert Humain » à rester très proche des autres mensonges humains et loin des faux de l'IA, et vice versa. Ils ont également ajouté une vérification de « Cohérence Cross-modale », qui agit comme un vérificateur de faits et demande : « Est-ce que l'image correspond réellement à l'histoire ? » Si le texte dit « un chien volant » mais que l'image montre un chat, ce contrôle signale l'anomalie.
Les résultats montrent que ce nouveau détective est bien meilleur que les anciens spécialistes. Testé sur leur nouvelle bibliothèque de 98 000 échantillons, UMFDet a correctement identifié le type de désinformation environ 82 % du temps en moyenne. C'est un bond important par rapport aux autres méthodes. Par exemple, en examinant la « Manipulation de Texte » (histoires fausses), le nouveau système a amélioré la meilleure méthode précédente de plus de 13 %. Il a également prouvé qu'il pouvait gérer la « Manipulation Mixte » (un mélange de vrai et de faux) mieux que quiconque. L'équipe a même testé son système sur d'autres ensembles de données existants, comme DGM4 et MMFakeBench, et il arrive toujours en tête, battant des modèles spécialisés qui ont été conçus pour un seul type de faux.
Le document suggère qu'en unifiant ces tâches, nous pouvons construire un outil plus pratique et plus puissant pour la sécurité des réseaux sociaux. Les auteurs ne prétendent pas avoir résolu le problème des fausses informations pour toujours, mais ils ont montré que traiter les mensonges humains et les faux de l'IA comme un défi unique et unifié fonctionne bien mieux que de les maintenir séparés. Leur système, ainsi que leur immense nouveau jeu de données, sont désormais disponibles pour que d'autres puissent les utiliser et les améliorer, offrant une étape prometteuse vers une place de village où la vérité est plus facile à trouver, peu importe qui essaie de la cacher.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.