← Nieuwste papers
📄 other

The FIFA World Cup 2026 Master Dataset: A Normalized 3NF Relational Benchmark of the Expanded 48-Team International Football Tournament

Dit artikel introduceert de FIFA World Cup 2026 Master Dataset, een strikt geverifieerde, in de derde normale vorm aanwezige relationele benchmark met uitgebreide wedstrijd-, speler- en tactische statistieken voor het uitgebreide toernooi met 48 teams, ontworpen om sportanalyse en voorspellende modellering te bevorderen.

Oorspronkelijke auteurs: MD Mominul Islam

Gepubliceerd 2026-08-24
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: MD Mominul Islam

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Voetbal is al lang een spel van passie en instinct, maar in de afgelopen decennia heeft een stille revolutie de sport veranderd in een wetenschap. Analisten en coaches vertrouwen nu op enorme hoeveelheden gestructureerde informatie om te begrijpen wat er op het veld gebeurt, waarbij ze verder gaan dan eenvoudige scores door elke pass, schot en wissel te volgen. Dit veld, bekend als sportanalyse, probeert patronen te vinden in de chaos van een wedstrijd, waarbij data wordt gebruikt om te verklaren waarom een team won of verloor, hoe een speler presteerde en wat er vervolgens zou kunnen gebeuren. Hoewel commerciële bedrijven vaak de meest gedetailleerde gegevens achter betaalmuren vasthouden, heeft de wetenschappelijke gemeenschap lang behoefte gehad aan open, betrouwbare datasets om nieuwe ideeën te testen en ons begrip van het spel te verbeteren. De uitdaging is altijd geweest dat beschikbare publieke data vaak rommelig, onverbonden of ontendoet aan de specifieke details die nodig zijn voor diepgaande studie, zoals de exacte locatie van een stadion of de precieze marktwaarde van een speler.

In de zomer van 2026 adresseerde een onderzoeker genaamd MD Mominul Islam van de Shahjalal University of Science and Technology in Bangladesh deze kloof door een uitgebreid digitaal verslag van het FIFA Wereldkampioenschap te creëren. Dit toernooi was een historische gebeurtenis, waarbij het aantal nationale teams werd uitgebreid van 32 naar 48 en het bestond uit 104 wedstrijden gespeeld op 16 locaties in Canada, Mexico en de Verenigde Staten. De finale zag Spanje Argentinië met 1–0 verslaan, maar de ware betekenis van de gebeurtenis voor data science ligt in de enorme hoeveelheid activiteit die het genereerde. De onderzoeker stelde informatie samen naar aanleiding van het 39 dagen durende toernooi, waarbij details verzamelde over elke enkele wedstrijd, de 48 gekwalificeerde teams en de 1.248 geregistreerde spelers. Het resultaat is een enorme, georganiseerde collectie feiten die spelersbiometrie, de geografie van de locaties en wedstrijdgebeurtenissen koppelt in één enkel, samenhangend systeem.

De kernprestatie van dit werk is de creatie van een "genormaliseerde" database, een specifieke manier van het organiseren van informatie zodat elk stukje data een unieke plaats heeft en logisch verbonden is met de rest. In plaats van verspreide spreadsheets waar informatie mogelijk herhaald of tegenstrijdig is, bouwde de onderzoeker een systeem met 12 afzonderlijke tabellen die in elkaar passen als een puzzel. Eén tabel bevat de details van de 16 stadions, inclusief hun capaciteit en, cruciaal, hun hoogte boven zeeniveau, wat invloed kan hebben op hoe spelers ademen en presteren. Een andere tabel houdt de 1.248 spelers bij, waarbij lengte, geboortedatum, internationale ervaring en hun geschatte marktwaarde in euro's worden geregistreerd. Een derde reeks tabellen legt de 104 wedstrijden zelf vast, waarbij ze worden gekoppeld aan de specifieke scheidsrechters, de betrokken teams en de eindscores. Deze structuur stelt een onderzoeker in staat om complexe vragen te stellen, zoals hoe de hoogte van een stadion in Mexico-Stad de prestaties van een team uit een kustland heeft beïnvloed, zonder handmatig tientallen verschillende bestanden te hoeven kruisverwijzen.

Wat deze dataset bijzonder waardevol maakt, is de opname van metrieken die vaak ontbreken in gratis publieke data. De collectie bevat "expected goals", een statistische maatstaf die de waarschijnlijkheid inschat dat een schot een doelpunt wordt op basis van waar het werd genomen en de hoek van het schot. Het biedt ook minuut-per-minuut verslagen van wie er speelde, wanneer er werd gewisseld en hoe lang zij op het veld bleven. Voor elke wedstrijd biedt de dataset een samenvatting van teamtactieken, zoals hoeveel tijd een team de bal controleerde en hoeveel schoten zij losten. Bovendien heeft de onderzoeker vooraf berekende kenmerken opgenomen die bedoeld zijn om computers te helpen leren van de data, wat het makkelijker maakt voor anderen om modellen te bouwen die wedstrijduitslagen kunnen voorspellen. De data beslaat het gehele toernooi, van de openingswedstrijden in de groepsfase tot de finale, en legt de volledige boog van de competitie vast.

Om de informatie betrouwbaar te maken, heeft de onderzoeker niet simpelweg cijfers van het internet gekopieerd. Hij bouwde een geautomatiseerd systeem om de data te controleren tegen officiële rapporten van FIFA en andere gezaghebbende bronnen. Dit proces omvatte het uitvoeren van een reeks van negen verschillende tests om te verifiëren dat de cijfers zin maakten, naast een handmatige steekproef van 30 wedstrijden. Het systeem controleerde bijvoorbeeld of het totale aantal teams en spelers overeenkwam met de officiële telling, dat geen enkele wedstrijd een score had zonder een bijbehorende status, en dat de som van de gescoorde doelpunten door een speler in de gedetailleerde gebeurtenislogs overeenkwam met hun totale doelpunten in de spelersstatistieken. Dit rigoureuze verificatieproces bevestigde dat de data tot een zeer hoge graad nauwkeurig was, met een empirisch nauwkeurigheidspercentage van 99,87 procent.

De bevindingen gepresenteerd in dit werk zijn niet slechts een lijst met scores, maar een geverifieerde basis voor toekomstige ontdekkingen. De data onthult een sterke verbinding tussen de expected goals die een team genereert en de daadwerkelijk gescoorde doelpunten, wat laat zien dat de statistische modellen die prestaties voorspellen nauw aansluiten bij de realiteit. Het benadrukt ook de economische ongelijkheid tussen naties, door de totale marktwaarde van de selecties voor de top 15 gekwalificeerde teams te tonen. Hoewel de dataset niet de hogesnelheid, seconde-per-seconde tracking van elke beweging van een speler bevat vanwege licentiebeperkingen, biedt het een niveau van detail dat zeldzaam is voor open-access bronnen. Het legt de fysieke omstandigheden van het toernooi vast, de tactische beslissingen van de coaches en de individuele bijdragen van elke speler in een formaat dat klaar is voor analyse.

Deze dataset is nu beschikbaar voor iedereen die geïnteresseerd is in sportwetenschap, aangeboden in formaten die kunnen worden gebruikt door standaard database-software en machine learning-tools. Het dient als een benchmark voor onderzoekers die willen bestuderen hoe het uitbreiden van een toernooi het spel beïnvloedt, hoe verschillende omgevingen de prestaties van spelers beïnvloeden, of hoe men betere modellen kan bouwen voor het voorspellen van de toekomst van het voetbal. Door deze informatie open en betrouwbaar te maken, verwijdert het werk een belangrijke barrière voor wetenschappers en analisten, waardoor zij zich kunnen richten op ontdekking in plaats van op het opschonen van data. Het resultaat is een helder, concreet verslag van een van de populairste sportevenementen ter wereld, bewaard op een manier die het mogelijk maakt dat het verhaal van het WK 2026 niet alleen wordt verteld via hoogtepunten en koppen, maar door de precieze, onderling verbonden feiten van het spel zelf.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →