← Últimos artigos
🔬 physics

Estimating Absolute Web Crawl Coverage From Longitudinal Set Intersections

Este artigo propõe um método simples e autônomo para estimar a cobertura absoluta de um crawl da web utilizando apenas dados longitudinais de interseções entre múltiplos arquivamentos, modelados por um processo de urna e inferidos via regressão linear, permitindo quantificar a completude sem necessidade de conjuntos de dados externos.

Autores originais: Michael Paris, Grigori Paris, Fabian Baumann

Publicado 2026-03-17
📖 4 min de leitura☕ Leitura rápida

Autores originais: Michael Paris, Grigori Paris, Fabian Baumann

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é o curador de uma biblioteca gigante que tenta guardar todos os livros de um país. O problema é que essa biblioteca não sabe quantos livros existem no total no país, nem sabe se ela já pegou a maioria deles ou apenas uma pequena fração. Além disso, os livros mudam de lugar, alguns são queimados e outros novos são escritos o tempo todo.

Como saber se sua biblioteca está "completa" sem ter uma lista oficial de todos os livros do país?

Este artigo apresenta uma solução inteligente e elegante para esse problema, usando apenas os registros da própria biblioteca. Vamos explicar como funciona, passo a passo, com analogias do dia a dia.

1. O Problema: A Biblioteca que não sabe o tamanho do mundo

Os pesquisadores do "Web Archive" (um arquivo da internet) fazem "crawls" (varreduras) para salvar páginas da web. Eles sabem exatamente quantas páginas salvaram (digamos, 100 milhões). Mas eles não sabem quantas páginas poderiam ter sido salvas no total.

Sem saber o total, eles não conseguem calcular a porcentagem de cobertura. É como tentar adivinhar quantos peixes existem em um lago enorme, mas você só consegue contar quantos pescou hoje.

2. A Solução: O "Jogo das Bolinhas" (O Modelo Urn)

Os autores propõem uma ideia genial: em vez de tentar contar tudo de uma vez, vamos olhar para como as coisas mudam com o tempo.

Eles usam uma analogia chamada Modelo da Urna (uma urna é um pote onde se colocam bolas):

  • Imagine uma urna gigante cheia de bolas coloridas (cada bola é um link da internet).
  • A cada meio ano, você tira uma amostra de bolas (uma varredura/crawl).
  • Mas, entre uma varredura e outra, a urna muda: algumas bolas antigas somem (links quebrados) e novas bolas aparecem (novos links).
  • A pergunta é: Quanto da urna você consegue ver em cada sorteio?

3. A Mágica: Comparando "Eu de Hoje" com "Eu de Ontem"

A grande sacada do artigo é que você não precisa de uma lista externa. Você só precisa comparar o que você pegou hoje com o que você pegou no mês passado, no ano passado, etc.

  • Se você pegar as mesmas bolas de sempre: Significa que a urna é pequena e você já pegou quase tudo.
  • Se as bolas mudarem muito rápido: Significa que a urna é enorme e as bolas antigas somem rápido.

Os pesquisadores olharam para a "Internet Acadêmica Alemã" (universidades alemãs) por 8 anos. Eles viram que, quanto mais tempo passava entre duas varreduras, menos links elas tinham em comum.

4. A Receita de Bolo (A Matemática Simplificada)

Eles criaram uma fórmula simples baseada nessa lógica:

  1. A Interseção: Eles mediram quantos links apareciam em duas varreduras diferentes.
  2. O Decaimento: Eles viram que essa sobreposição cai de forma previsível com o tempo (como uma bola de neve derretendo).
  3. O Pulo do Gato: Se você estender essa linha de "derretimento" de volta para o tempo zero (quando duas varreduras acontecem ao mesmo tempo), o ponto onde ela começa te diz a cobertura real.

É como se você olhasse para a sombra de um prédio em diferentes horas do dia e, sabendo a posição do sol, conseguisse calcular a altura exata do prédio, mesmo sem ter uma fita métrica.

5. O Resultado: O Que Eles Descobriram?

Aplicando isso à Internet Acadêmica Alemã, eles descobriram:

  • Cobertura: Cada varredura consegue pegar cerca de 46% de toda a internet acadêmica que existe e é acessível. Ou seja, quase metade está sendo salva, mas a outra metade ainda está "fora".
  • Estabilidade: Os links acadêmicos são relativamente estáveis. Cerca de 73% dos links de um ano continuam existindo no ano seguinte (o que significa que 27% somem ou mudam).

6. Por que isso é importante?

Antes, para saber se um arquivo da internet era bom, era preciso:

  • Ter uma lista secreta de todos os sites (o que é impossível).
  • Ou comparar com outro arquivo gigante (o que só dá uma ideia relativa, não absoluta).

Agora, com esse método, qualquer arquivo da internet pode olhar para seus próprios registros passados e dizer: "Ok, eu capturei X% do mundo que eu deveria capturar".

Resumo da Ópera:
Os autores criaram um "termômetro de completude" que usa apenas o histórico da própria biblioteca. Eles provaram que, ao observar o quanto os links se repetem ou desaparecem ao longo do tempo, é possível calcular matematicamente o tamanho total do que foi capturado, sem precisar de nenhum dado externo. É uma forma de medir o tamanho do oceano apenas observando as ondas que batem na praia ao longo dos anos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →