← Derniers articles
🔬 physics

Estimating Absolute Web Crawl Coverage From Longitudinal Set Intersections

Cet article propose une méthode simple et autonome pour estimer la couverture absolue d'un crawl web en inférant les paramètres d'un modèle d'urne à partir des chevauchements longitudinaux entre des crawls successifs, sans recourir à des données de vérité terrain externes.

Auteurs originaux : Michael Paris, Grigori Paris, Fabian Baumann

Publié 2026-03-17
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Michael Paris, Grigori Paris, Fabian Baumann

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Le Problème : "Combien de poissons avons-nous pêchés ?"

Imaginez que vous êtes un pêcheur très organisé. Vous lancez votre filet dans un lac (le web) pendant six mois. Vous ramenez 100 millions de poissons (des pages web). C'est impressionnant !

Mais vous vous posez une question cruciale : Combien de poissons y a-t-il au total dans ce lac ?

  • Avez-vous pêché 10 % du lac ?
  • Ou 90 % ?
  • Ou est-ce que le lac est si immense que vous n'avez rien pris du tout ?

Le problème, c'est que vous ne pouvez pas voir le fond du lac. Vous ne pouvez pas compter tous les poissons qui n'ont pas été pris. Habituellement, pour savoir cela, il faudrait avoir un autre pêcheur avec un autre filet, ou une carte précise du lac (ce qui n'existe pas pour le web).

La Solution Magique : Le "Jeu de l'Oubli"

C'est là que les auteurs de ce papier (Michael Paris et ses collègues) ont une idée brillante. Ils disent : "Pas besoin d'un autre pêcheur ni d'une carte. Regardez simplement vos propres filets au fil du temps."

Ils ont analysé 15 pêches successives du "Web Académique Allemand" (les sites des universités allemandes) entre 2013 et 2021.

Voici leur méthode, expliquée avec une métaphore de la salle de classe :

1. L'Analogie de la Salle de Classe (Le Modèle de l'Urne)

Imaginez une classe avec N élèves (tous les sites web possibles).

  • À chaque semestre, vous demandez à M élèves de se lever (votre "crawl" ou filet).
  • Mais entre deux semestres, certains élèves quittent la classe (les sites disparaissent) et de nouveaux arrivent (de nouveaux sites sont créés).
  • Vous ne connaissez pas N (le nombre total d'élèves), mais vous savez combien vous avez notés à chaque fois (M).

La question est : Quel pourcentage de la classe totale avez-vous réussi à voir ?

2. Le Secret : Les Chevauchements

Les chercheurs ont comparé les listes d'élèves de chaque semestre.

  • Si vous prenez la liste du semestre 1 et celle du semestre 2, combien d'élèves sont sur les deux listes ?
  • Si vous comparez le semestre 1 avec le semestre 10, combien d'élèves sont encore communs ?

Ils ont découvert une règle mathématique simple (comme une loi de la nature) :

  • Plus le temps passe, moins les élèves sont les mêmes (les sites changent). C'est ce qu'ils appellent la "décroissance".
  • En regardant à quelle vitesse les noms disparaissent des listes, on peut deviner la taille totale de la classe.

C'est comme si vous regardiez une photo de votre famille prise il y a 10 ans et une d'aujourd'hui. Si vous voyez que 30 % des gens ont changé, vous pouvez estimer la taille totale de la famille, même si vous ne connaissez pas tout le monde.

Les Résultats Concrets

En appliquant cette logique aux sites des universités allemandes, ils ont trouvé deux choses fascinantes :

  1. La Couverture (Le pourcentage pêché) : Chaque fois qu'ils ont lancé leur "filet", ils ont réussi à capturer environ 46 % de tout ce qui était pêchable dans le monde académique allemand. C'est énorme ! Presque la moitié.
  2. La Stabilité (La durée de vie) : Les sites web académiques sont assez stables. Environ 73 % des sites restent en place d'une année sur l'autre. Cela signifie qu'un site académique a une "durée de vie" d'environ 2 ans avant de changer ou de disparaître.

Pourquoi est-ce génial ?

Avant cette méthode, pour savoir si votre filet était bon, il fallait :

  • Soit avoir un concurrent (un autre moteur de recherche) pour comparer.
  • Soit avoir une liste parfaite de tous les sites existants (ce qui est impossible).

Maintenant, avec cette méthode, vous n'avez besoin que de vos propres archives. C'est comme si vous pouviez dire : "Je n'ai pas besoin de voir le lac entier pour savoir combien de poissons j'ai pêchés. Je regarde juste combien de poissons j'ai déjà vus qui sont revenus la semaine suivante."

En Résumé

Ce papier nous donne un outil simple et élégant pour mesurer la "complétude" d'une archive web.

  • L'idée : Utiliser le temps et les répétitions pour deviner l'inconnu.
  • L'analogie : C'est comme estimer la taille d'une foule en regardant combien de visages se répètent dans des photos prises à intervalles réguliers.
  • Le résultat : Pour le web académique allemand, on a déjà vu près de la moitié de tout ce qui existe, et les choses changent assez lentement pour qu'on puisse les archiver efficacement.

C'est une victoire pour les archivistes du web : ils peuvent maintenant se dire "Nous faisons un bon travail" sans avoir besoin de connaître la réponse exacte à l'avance.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →