← Derniers articles
🤖 machine learning

CrediBench: Building Web-Scale Network Datasets for Information Integrity

Cet article présente CrediBench, un ensemble de données multimodales à l'échelle du web comprenant huit mois de données de graphes, de textes et de données temporelles provenant de plus de 40 millions de domaines, ce qui améliore considérablement les performances des modèles de prédiction de la crédibilité en capturant des signaux structurels et dynamiques souvent manqués par les approches existantes au niveau des affirmations.

Auteurs originaux : Emma Kondrup, Sebastian Sabry, Hussein Abdallah, Zachary Yang, Jiaqi Xiong, Kellin Pelrine, James Zhou, Zhijin Guo, Michael M. Bronstein, Jean-François Godbout, Reihaneh Rabbany, Shenyang Huang

Publié 2026-06-23
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Emma Kondrup, Sebastian Sabry, Hussein Abdallah, Zachary Yang, Jiaqi Xiong, Kellin Pelrine, James Zhou, Zhijin Guo, Michael M. Bronstein, Jean-François Godbout, Reihaneh Rabbany, Shenyang Huang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez l'internet comme une ville immense et bouillonnante où chaque site web est un bâtiment. Certains bâtiments sont des bibliothèques honnêtes, d'autres sont des boutiques de ruelle louches, et certains sont de véritables pièges. En ce moment, il devient difficile de les distinguer car des acteurs malveillants construisent des vitrines de magasins très convaincantes, et de nouveaux « bâtiments » apparaissent chaque seconde.

Cet article présente CrediBench, un nouvel outil gigantesque conçu pour nous aider à naviguer dans cette ville et à déterminer quels bâtiments sont dignes de confiance.

Voici la décomposition de ce qu'ils ont fait, en utilisant des analogies simples :

1. Le Problème : Les anciens plans sont trop petits

Auparavant, les chercheurs essayant de repérer les fausses informations ou les sites web dangereux étaient confrontés à deux problèmes principaux :

  • Ils ne regardaient que le « menu » : La plupart des outils se contentaient de lire le texte d'une seule page web (le menu) pour décider si c'est un bon restaurant. Ils ignoraaient qui était le propriétaire ou avec qui il était lié.
  • Les cartes étaient minuscules : Les ensembles de données existants étaient comme la carte d'un seul quartier. Ils n'avaient pas assez de données pour voir toute la ville, surtout comment les connexions entre les bâtiments changent au fil du temps.

2. La Solution : Une carte de ville géante et vivante

Les auteurs ont construit CrediBench, qui est comme une carte haute définition en accéléré (time-lapse) de l'internet entier pendant huit mois.

  • L'Échelle : C'est massif. Cela suit plus de 40 millions de « bâtiments » (domaines) et 1 milliard de « routes » (hyperliens) reliant ces derniers. Pour donner un ordre d'idée, c'est des ordres de grandeur plus grand que n'importe quelle carte de ce type auparavant.
  • Les Trois Couches : Au lieu de simplement regarder le texte, CrediBench examine trois choses à la fois :
    1. Le Texte : Qu'est-ce qui est écrit sur les pages ? (Le menu).
    2. La Structure : Qui lie à qui ? (Les commérages et les alliances de voisinage).
    3. Le Temps : Comment ces connexions changent-elles ? (Une bibliothèque réputée a-t-elle soudainement commencé à lier vers une boutique louche la semaine dernière ?).

3. Le « Score de Crédibilité »

Les chercheurs ont appris aux ordinateurs à agir comme des inspecteurs experts. Ils ont créé deux façons de tester le système :

  • Le « Compteur de Confiance » (Régression) : Au lieu de simplement dire « Bon » ou « Mauvais », le système donne un score de 0 à 1, indiquant à quel point un site est crédible.
  • Le Test « Réussite/Échec » (Classification) : Un simple « Oui, c'est sûr » ou « Non, c'est dangereux ».

Pour entraîner ces inspecteurs, ils n'ont pas seulement deviné. Ils ont rassemblé une liste massive de 662 000 sites web qui avaient déjà été étiquetés par des experts, des foules et des entreprises de sécurité comme étant soit « crédibles », soit « non fiables » (couvrant la désinformation, les logiciels malveillants et le phishing). C'est la plus grande liste de ce genre jamais assemblée.

4. Les Résultats : Le travail d'équipe gagne

L'équipe a mené des expériences pour voir quel « sens » était le plus important : lire le texte, regarder les liens ou observer la chronologie.

  • La Découverte : On ne peut pas se fier à un seul sens. Un modèle qui lit uniquement le texte est correct, mais un modèle qui regarde uniquement les liens est également correct.
  • Le Gagnant : Le Super-Inspecteur qui combine les trois (Texte + Liens + Temps) était le grand champion.
    • Sur la tâche du « Compteur de Confiance », il a réduit les erreurs de façon considérable (passant de 16 % d'erreur à 10 %).
    • Sur le test « Réussite/Échec », il est passé de 56 % de réussite à 85 % de réussite.

5. Pourquoi cela importe

L'article soutient que la désinformation se propage comme un virus à travers les connexions entre les sites web, et non seulement à travers les mots sur une page. En regardant la carte complète de la ville et ses mouvements dans le temps, nous pouvons repérer les « mauvais quartiers » beaucoup plus rapidement.

En bref : Les auteurs ont construit la carte la plus détaillée et la plus vaste du réseau de confiance de l'internet jamais créée. Ils ont prouvé que pour repérer un menteur, il faut lire ce qu'il dit, voir avec qui il traîne et observer comment ses relations changent au fil du temps. Ils ont mis cette carte et ces outils d'entraînement à la disposition de tous, afin que les futurs chercheurs puissent construire de meilleurs « inspecteurs de la ville » pour garder l'internet en sécurité.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →