← Nieuwste papers
💬 NLP

Infini-News: Efficiently Queryable Access to 1.3 Billion Processed Common Crawl News Articles

Het artikel introduceert Infini-News, een uitgebreide toolkit en index die meer dan 1,3 miljard Common Crawl-nieuwsartikelen verwerkt met verrijkte metadata en taalherkenning, waardoor onderzoekers het volledige archief efficiënt kunnen doorzoeken op willekeurige tekstpatronen in minder dan een seconde.

Oorspronkelijke auteurs: Ruggero Marino Lazzaroni, Jana Lasser, Kirill Solovev

Gepubliceerd 2026-05-19
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ruggero Marino Lazzaroni, Jana Lasser, Kirill Solovev

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je wilt onderzoeken hoe de wereld in het afgelopen decennium heeft gesproken over grote gebeurtenissen. Je hebt een enorme bibliotheek van nieuwsartikelen nodig.

In het verleden had je twee slechte opties:

  1. De betaalmuur: Ga naar een commercieel nieuwsarchief (zoals een hoogwaardige bibliotheek). Het heeft alles, maar het kost een fortuin, en je mag de boeken niet delen met je vrienden of ze zelfs het gebouw uitdragen.
  2. De ruwe dump: Ga naar de "Common Crawl", een gigantisch, gratis magazijn van het hele internet. Het heeft alles, maar het is een chaotische puinhoop van terabytes aan ruwe HTML-bestanden. Om één artikel te vinden, zou je je eigen bulldozer moeten bouwen, door bergen digitale rommel moeten zeven en maanden moeten besteden aan het schoonmaken van de data voordat je zelfs maar kunt beginnen met lezen.

Infini-News is de oplossing die de auteurs hebben gebouwd om dit op te lossen. Denk hierbij aan een superkrachtige, vooraf schoongemaakte en direct doorzoekbare index voor 's werelds grootste gratis nieuwsarchief.

Hieronder wordt uitgelegd hoe het werkt, opgesplitst in simpele onderdelen:

1. De Grote Schoonmaak (Het "Voorverwerkte Corpus")

De auteurs namen de ruwe, rommelige magazijn (180 terabytes aan data) en voerden het door een geavanceerde schoonmaakmachine.

  • Wat ze deden: Ze verwijderden de advertenties, de "Abonneer Nu"-pop-ups, de navigatiebalken en de gebroken code.
  • Het Resultaat: Ze kwamen uit op 1,35 miljard schone nieuwsartikelen van augustus 2016 tot vandaag. Het is alsof je een hoop ongeordend schrootmetaal omzet in een netjes georganiseerd magazijn met afgewerkte auto's. Je hoeft geen monteur meer te zijn om het te gebruiken; je rijdt gewoon de auto.

2. De Slimme Labels (Metadata-verrijking)

Een hoop van 1,35 miljard artikelen is nog steeds overweldigend. Je moet weten wat je bekijkt. De auteurs voegden drie lagen aan "slimme labels" toe aan elk artikel:

  • Taallabels: Ze gokten niet zomaar de taal; ze gebruikten drie verschillende "detectives" (AI-classificators) om de taal te labelen. Als één detective onzeker is, controleren de anderen het dubbel. Dit dekt meer dan 1.000 talen, van Engels en Spaans tot zeldzame dialecten.
  • Waar het vandaan komt: Ze probeerden uit te vinden uit welk land elk artikel kwam. Ze gebruikten aanwijzingen zoals het website-adres (bijv. .de voor Duitsland), het adres van de uitgever in de footer, en lijsten met bekende nieuwsbronnen. Ze slaagden erin om de herkomst te labelen voor 83% van de artikelen verspreid over 222 landen.
  • Waarom dit belangrijk is: Dit stelt onderzoekers in staat vragen te stellen zoals: "Hoe zag nieuws over de oorlog in Oekraïne eruit in Duitsland versus Brazilië?" zonder elk enkel artikel handmatig te hoeven lezen.

3. De Magische Zoekmachine (Infini-gram Indexen)

Dit is de meest indrukwekkende truc. Normaal gesproken zou het doorzoeken van 1,35 miljard artikelen uren of dagen duren.

  • De Analogie: Stel je voor dat je probeert een specifieke zin te vinden in een bibliotheek met een miljard boeken. Een normale zoekmachine zou elk boek moeten openen, elke pagina moeten lezen en controleren of de woorden overeenkomen. Dat is traag.
  • De Infini-News-truc: Ze bouwden een suffix-array-index. Denk hierbij aan een magische, ultra-gedetailleerde kaart van elk enkel woord en elke frase in de bibliotheek.
  • De Snelheid: Met deze kaart kun je een frase invoeren (zelfs iets vreemds als "klimaatverandering" of een specifieke quote), en het systeem vindt elke instantie ervan in minder dan een seconde.
  • Geen Download Nodig: Je hoeft de hele bibliotheek niet te downloaden om deze te doorzoeken. Je vraagt gewoon de kaart op, krijgt een lijst met "boek-ID's" en downloadt vervolgens alleen de specifieke artikelen die je nodig hebt. Dit bespaart onderzoekers de noodzaak van enorme harde schijven.

Wat Kun Je Er Mee Doen?

Het artikel benadrukt een paar specifieke manieren waarop onderzoekers deze tool kunnen gebruiken:

  • Tijdsreizen: Je kunt volgen hoe een verhaal zich in 10 jaar heeft veranderd (longitudinale analyse).
  • Volg het Gerucht: Je kunt zien hoe een specifiek stuk nieuws of een nepquote zich van de ene krant naar de andere verspreidde (content-syndicatie).
  • Wereldwijde Vergelijking: Je kunt vergelijken hoe verschillende landen hetzelfde evenement hebben behandeld.
  • AI-veiligheid: Je kunt controleren of een nieuwe AI-chatbot is getraind op specifieke nieuwsverhalen door te zoeken naar exacte overeenkomsten.

De Haken en Ogen (Beperkingen)

De auteurs zijn eerlijk over wat deze tool niet kan doen:

  • Het is niet live: Het nieuws komt uit het archief, dus er is een lichte vertraging. Je kunt het niet gebruiken om breaking news te monitoren terwijl het op dit exacte moment gebeurt.
  • Ontbrekende betaalmuren: Het bevat alleen gratis nieuws. Als een krant een artikel achter een "betaalmuur" zet, heeft Infini-News het niet.
  • Het "Robots"-probleem: Rond 2023 begonnen veel nieuwswebsites AI-crawlers te blokkeren. De auteurs merkten een daling op in nieuwe artikelen van bepaalde sites daarna, dus de data is voor zeer recente tijden mogelijk iets minder compleet.
  • Niet perfecte labels: De land- en taallabels zijn zeer goed (ongeveer 89% accuraat), maar ze zijn niet 100% perfect. Van onderzoekers wordt verwacht dat ze dubbelchecken als ze absolute precisie nodig hebben.

De Conclusie

Infini-News is een "retrieval-first"-toolkit. In plaats van onderzoekers te dwingen een bibliotheek ter grootte van een kleine stad te downloaden, geeft het hen een sleutel waarmee ze direct de exacte pagina's vinden die ze nodig hebben en alleen die downloaden. Het verandert een chaotische, ontoegankelijke berg data in een schone, doorzoekbare en gratis bron voor het bestuderen van hoe de wereld communiceert.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →