WCXB: A Multi-Type Web Content Extraction Benchmark
Dit artikel introduceert WCXB, een uitgebreide benchmarkdataset van 2.008 webpagina's over zeven verschillende typen met hoogwaardige annotaties, die is ontworpen om de beperkingen van bestaande benchmarks die uitsluitend artikelen bevatten, te overwinnen en aanzienlijke prestatiekloven in huidige systemen voor het extraheren van webinhoud aan het licht te brengen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je het internet voor als een enorme, chaotische bibliotheek waar elk boek een webpagina is. Sommige pagina's zijn schone, goed geschreven romans (nieuwsartikelen). Anderen zijn rommelige prikborden met post-its overal (forums), catalogi met prijskaartjes en specificaties (producten), of handleidingen met zijbalken en codeblokken (documentatie).
Jarenlang hadden computers die deze pagina's probeerden te lezen een groot blind punt. Ze waren getraind om uitstekend te zijn in het lezen van de "romans", maar verschrikkelijk in het begrijpen van de rommelige catalogi of prikborden. Ze lazen vaak per ongeluk de prijskaartjes, de "In winkelwagen"-knoppen of gebruikersreacties alsof dit het hoofdverhaal was.
Het Probleem: De "Alleen-Nieuws"-Test
De auteur, Murrough Foley, betoogt dat eerdere tests die werden gebruikt om te meten hoe goed computers het web lezen, leken op het afnemen van een rijexamen uitsluitend op lege, rechte snelwegen.
- De Oude Tests: Ze gebruikten kleine datasets (100–800 pagina's) die bijna volledig uit nieuwsartikelen bestonden.
- Het Resultaat: Computers leken op super-savanten, met bijna perfecte cijfers. Maar dit was misleidend. Het vertelde ons niet hoe ze de rest van het internet zouden aanpakken, dat vol zit met complexe, gestructureerde pagina's zoals productlijsten of forums.
De Oplossing: WCXB (De "All-Terrain"-Rijtest)
Foley introduceert een nieuwe benchmark genaamd WCXB (Web Content Extraction Benchmark). Denk hierbij aan een nieuwe, veel zwaardere rijtest die snelwegen omvat, maar ook modderige off-road paden, drukke stadsstraten en bouwzones.
- De Dataset: Het bevat 2.008 webpagina's van meer dan 1.600 verschillende websites.
- De Variatie: In plaats van alleen nieuws, behandelt het 7 verschillende "typen" pagina's:
- Artikelen (Het gemakkelijke snelwegrijden).
- Forums (Rommelige prikborden met gebruikersreacties).
- Producten (Catalogi met verborgen specificaties en prijzen).
- Collecties (Rasters van items met filters).
- Aanbiedingen (Herhalende kaarten met samenvattingen).
- Documentatie (Technische handleidingen met code).
- Servicepagina's (Marketingpagina's met secties overal verspreid).
Hoe Ze Het Maken (Het "Gouden Standaard"-Recept)
Om ervoor te zorgen dat de antwoorden correct waren, vroegen ze niet één persoon om de papieren te beoordelen. Ze gebruikten een vijftraps assemblagelijn:
- AI-Concept: Een slimme AI schreef het eerste concept van wat de "hoofdinhoud" zou moeten zijn.
- Auto-Controle: Scripts controleerden op voor de hand liggende fouten.
- AI-Review: Vier verschillende AI-experts beoordeelden het werk, op zoek naar verschillende soorten fouten.
- Fragmentcontrole: Ze draaiden scripts om ervoor te zorgen dat specifieke vereiste zinnen waren opgenomen en specifieke "afval"-zinnen (zoals advertenties) waren uitgesloten.
- Menselijke Finale: Een menselijke expert beoordeelde het eindproduct om eventuele meningsverschillen te beslechten en de kwaliteit te waarborgen.
De Resultaten: Het "Nieuws" is Opgelost, De Rest is Gebroken
Foley testte 13 verschillende computerprogramma's (11 die oude regels gebruikten, 2 die moderne AI gebruikten) tegen deze nieuwe test. Dit is wat ze ontdekten:
- De Nieuwsartikelen: Iedereen slaagde met vlag en wimpel. De beste programma's scoorden 93% nauwkeurigheid. De auteur concludeert dat het lezen van nieuwsartikelen in wezen een "opgelost probleem" is.
- De Rest van het Web: De scores daalden dramatisch.
- Bij Forums was het gat tussen de beste en slechtste programma's enorm (een verschil van 27 punten).
- Bij Productpagina's kreeg het beste programma slechts ongeveer 67% goed, terwijl anderen worstelden met verborgen gegevens.
- Bij Collecties was de beste score slechts 71%, terwijl de slechtste 41% was.
De Grote Verrassing: Grotere AI Is Geen Wondermiddel
Veel mensen gaan ervan uit dat nieuwere, grotere kunstmatige intelligentiemodellen (Neurale Systemen) automatisch beter zouden zijn in alles.
- De Realiteit: De grote AI-modellen losten het probleem niet op. Sterker nog, ze presteerden vaak slechter dan de eenvoudigere, op regels gebaseerde programma's op niet-nieuwspagina's.
- Waarom? De AI-modellen waren voornamelijk getraind op nieuwsartikelen, dus ze erfden dezelfde bias. Ze zijn geweldig in romans, maar raken nog steeds in de war door de rommelige prikborden en productcatalogi.
Snelheid vs. Slimheid
Het artikel keek ook naar snelheid.
- Op regels gebaseerde programma's: Snel als bliksem (milliseconden per pagina).
- AI-programma's: Traag als een slak (duizenden milliseconden per pagina), waarbij dure grafische kaarten nodig zijn om ze te draaien.
De Conclusie
Het internet is niet slechts een verzameling nieuwsverhalen. Het is een mix van vele verschillende structuren. De oude tests loog tegen ons door alleen te testen op nieuws. Deze nieuwe benchmark (WCXB) onthult dat computers, hoewel ze geweldig zijn in het lezen van nieuws, nog steeds worstelen met het begrijpen van de complexe, gestructureerde en rommelige delen van het web. Om vooruit te komen, moeten we stoppen met het behandelen van alle webpagina's alsof het nieuwsartikelen zijn.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.