CRED-1: An Open Multi-Signal Domain Credibility Dataset for Automated Pre-Bunking of Online Misinformation
Cet article présente CRED-1, un jeu de données ouvert et reproductible de crédibilité de domaines intégrant plusieurs signaux enrichis, conçu pour permettre le pré-bunking de la désinformation directement sur les appareils clients via des extensions de navigateur respectueuses de la vie privée.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que CRED-1 est un grand dictionnaire de "bad buzz" pour les sites web, conçu pour protéger vos yeux et votre esprit avant même que vous ne lisiez un article.
1. Le Problème : La jungle des fausses nouvelles
Sur internet, c'est comme une immense forêt. Il y a de superbes arbres (les vraies informations), mais aussi des plantes toxiques, des champignons vénéneux et des arbres qui ressemblent à des fruits mais qui sont en plastique (les fausses nouvelles).
Le problème, c'est que les méchants (les désinformateurs) ne portent pas d'étiquette "Toxique" sur leur front. Ils se cachent derrière de beaux sites web.
2. La Solution : CRED-1, le "Detecteur de Poison"
Les auteurs (Alexander Loth et ses collègues) ont créé une liste, qu'ils appellent CRED-1.
Imaginez que c'est une liste noire (ou plutôt une liste de vigilance) tenue par des gardes forestiers très sérieux. Cette liste ne contient que les sites web qui ont déjà été pris la main dans le sac pour raconter des mensonges, des théories du complot ou des blagues mal placées.
Ce qui rend cette liste spéciale :
- Elle est gratuite et transparente : Contrairement à d'autres listes payantes (comme un abonnement VIP pour voir les dangers), celle-ci est ouverte à tout le monde. C'est comme une recette de cuisine partagée sur un forum public : n'importe qui peut vérifier comment elle a été faite.
- Elle est légère : Elle est si petite qu'elle peut tenir dans la poche de votre téléphone ou de votre navigateur internet, sans avoir besoin de se connecter à un serveur lointain. C'est comme avoir un detecteur de métaux personnel : il fonctionne même si vous êtes en avion (sans internet).
3. Comment ont-ils construit cette liste ? (La Recette)
Pour créer ce dictionnaire, ils ont utilisé une méthode en deux étapes, un peu comme un détective qui croise ses sources :
- Étape 1 : La collecte des indices. Ils ont pris deux listes existantes et reconnues (OpenSources.co et Iffy.news). C'est comme si deux experts en fausses nouvelles avaient chacun leur propre carnet de notes, et qu'ils les ont collés ensemble pour ne rien oublier.
- Étape 2 : L'enrichissement (les super-pouvoirs). Ensuite, ils ont ajouté quatre "capteurs" pour vérifier chaque site :
- L'âge du site : Est-ce que le site a 20 ans (comme un vieux journal) ou a-t-il été créé hier matin (comme un site de phishing) ? Résultat surprenant : beaucoup de sites de désinformation sont vieux !
- La popularité : Est-ce que tout le monde le connaît ?
- Les vérifications : Est-ce que des fact-checkers (les "policiers de la vérité") ont déjà écrit des articles disant "Attention, ce site ment" ?
- Le danger technique : Est-ce que le site contient des virus ? (Rares sont les sites de fausses nouvelles qui ont des virus, ils préfèrent vous tromper avec des mots que avec des logiciels malveillants).
4. Le Système de Score : De 0 à 100% de fiabilité
Chaque site reçoit une note de 0,0 à 1,0.
- 0,0 = "Menteur avéré" (Fake, complotiste).
- 0,5 = "Mitigé" (Il dit parfois la vérité, mais il est biaisé).
- 1,0 = "Fiable" (Mais attention : cette liste ne contient presque que des "mauvais" sites !).
L'analogie du restaurant :
Imaginez que vous voulez manger. CRED-1 est une application qui vous dit : "Ce restaurant a une note de 2/10, ne mangez pas là-bas, la nourriture est avariée."
Si le restaurant n'est pas sur la liste, cela ne veut pas dire qu'il est excellent (5/10), cela veut juste dire qu'on ne l'a pas encore vérifié ou qu'il n'est pas encore dans notre base de données.
5. À quoi ça sert dans la vraie vie ? (Le "Pre-bunking")
L'objectif principal est le "Pre-bunking" (le pré-désamorçage).
Au lieu d'attendre que vous lisiez un article faux et que vous vous fâchiez, cette liste permet à votre navigateur de vous dire avant que vous ne cliquiez : "Hé, ce site est suspect, prends garde !"
C'est comme un pare-feu pour votre cerveau. Au lieu de bloquer le site (ce qui peut être censuré), il vous met un panneau "Attention" pour que vous soyez plus vigilant.
En résumé
CRED-1 est un outil simple, gratuit et privé qui aide les gens à distinguer les sites web fiables des sites qui racontent des mensonges. Il utilise des données publiques pour créer une "boussole de vérité" que n'importe qui peut utiliser pour naviguer plus sûrement sur internet.
Les limites à connaître :
- La liste est surtout en anglais (comme beaucoup de choses sur internet).
- Elle ne contient que les sites "méchants" connus. Si un site n'est pas dessus, ce n'est pas forcément un ami, c'est juste un inconnu.
- Les mensonges évoluent vite, donc cette liste devra être mise à jour régulièrement.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.