← Nieuwste papers
🤖 machine learning

AI World Cup 2026: Benchmarking Large Language Models for End-to-End Football Tournament Prediction

Dit artikel presenteert de "AI World Cup"-benchmark, een gestandaardiseerde evaluatie waarbij tien grote taalmodellen het volledige WK 2026 van de FIFA voorspellen onder identieke omstandigheden, wat onthult dat GPT-5.5 Thinking anderen overtrof, primair door superieure voorspellingen in de knock-outfase, en dat het succes van voorspellingen op toernooiniveau significant verschilt van de nauwkeurigheid per wedstrijd.

Oorspronkelijke auteurs: Jonaid Shianifar, Iias Faiud

Gepubliceerd 2026-08-05
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Jonaid Shianifar, Iias Faiud

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin computers niet alleen vragen over het verleden beantwoorden, maar ook proberen de toekomst te raden. Dit is het domein van voorspellen (forecasting), een tak van de wetenschap waar modellen fungeren als kristallen bollen die proberen gebeurtenissen te voorspellen voordat ze plaatsvinden. In tegenstelling tot een triviaquiz waarbij de antwoorden al in een tekstboek staan geschreven, is voorspellen als het proberen te voorspellen van het weer over een maand: je moet tegenstrijdige aanwijzingen afwegen, omgaan met ontbrekende informatie en een definitieve gok wagen zonder de uitkomst te kennen. De grote vraag die onderzoekers stellen is: kunnen deze superintelligente computerbreinen, bekend als Large Language Models (LLM's), dit daadwerkelijk beter dan mensen? Het is belangrijk omdat als we machines kunnen leren om complexe gebeurtenissen accuraat te voorspellen, we ze kunnen gebruiken om alles te voorspellen, van aandelenmarkten tot natuurrampen, en niet alleen sport. Maar om te weten of ze er echt goed in zijn, hebben we een eerlijke test nodig waarbij iedereen zich aan exact dezelfde regels houdt.

Maak kennis met de AI World Cup 2026, een massaal, real-time experiment dat het grootste voetbaltoernooi op aarde veranderde in een gigantisch wetenschappelijk project. De onderzoekers zetten een "battle royale" op voor tien verschillende AI-assistenten. Ze gaven elke AI exact dezelfde momentopname van de toernooigegevens, exact dezelfde instructies, en vroegen hen één ding te doen: het hele toernooi voorspellen voordat er een eerste bal werd getrapt. Ze moesten de uitslag van elke wedstrijd in de groepsfase raden, bepalen wie zou doorstromen, en de volledige "bracket" (het pad naar de finale) uittekenen tot aan de kampioen. Het was alsof je tien verschillende studenten vroeg om een enorme, 104-wedstrijden tellende toernooi-invulsheet in te vullen, maar met de twist dat het formulier perfect consistent moest zijn — als je een team koos om een wedstrijd te winnen, moest je hen ook de volgende wedstrijd winnen.

De resultaten waren een wilde rit die een verrassende waarheid onthulde over hoe deze AI's denken. Toen het stof neerdaalde en de echte World Cup 2026 eindigde, nam het model genaamd GPT-5.5 Thinking de eerste plaats in met 744 punten, gevolgd door GPT-5.5 (717 punten), Gemini (699) en Qwen 3.7 (687). Maar hier is de twist: de winnaar was niet degene die het beste was in het raden van de uitslag van individuele wedstrijden. Sterker nog, het model dat de meeste individuele wedstrijdresultaten goed had, Claude Sonnet 4.6, eindigde slechts als zesde in het algemeen voorkomen.

Waarom draaiden de ranglijsten om? Het paper suggereert dat het geheime ingrediënt niet het weten was wie er zou winnen van een enkele dinsdagavondwedstrijd, maar het bewaren van een coherent verhaal voor het hele toernooi. Het scoresysteem was zwaar gewogen naar de "knockout"-fase (de eliminatierondes). De gegevens toonden een zeer sterke link (een correlatie van 0,986) tussen de totaalscore van een model en hoe goed het het pad door de knockouts voorspelde. In contrast hiermee was er bijna geen link tussen de totaalscore en hoe goed ze de vroege wedstrijden uit de groepsfase voorspelden. Het is als een detective die de uiteindelijke moord perfect oplost, maar de eerste paar aanwijzingen fout heeft gehad; in dit toernooi matterde het goed krijgen van het laatste hoofdstuk meer dan het perfect krijgen van de openingsscènes.

Het paper vond ook andere fascinerende eigenaardigheden. Zo was de AI die het meest zelfverzekerd was in haar antwoorden (Mistral Medium 3.5) helemaal niet de meest accurate. Zelfvertrouwen en nauwkeurigheid waren in feite niet gerelateerd, met een correlatie van -0,060, wat suggereert dat het er niet toe doet of een AI zegt dat hij het zeker weet, of dat hij het ook echt bij het rechte eind heeft. Nog een verrassing was de kampioensvoorspelling: GPT-5.5 Thinking was het enige model dat Spanje als winnaar koos, en in een ironische wending van het lot won Spanje daadwerkelijk het echte toernooi door Argentinië met 1–0 te verslaan. Deze enkele juiste gok, gecombineerd met een solide pad door de knockouts, hielp het model de anderen voorbij te springen.

Uiteindelijk suggereert dit paper dat het voorspellen van een heel toernooi een andere vaardigheid is dan het voorspellen van een enkele wedstrijd. Het gaat niet alleen om het zijn van een goede voetbalanalist; het gaat erom een goede verhalenverteller te zijn die een consistent narratief kan behouden van de eerste fluit als tot de uiteindelijke trofee. Hoewel de onderzoekers voorzichtig zijn door te zeggen dat dit slechts één experiment is met tien modellen en dat de resultaten sterk afhangen van hoe zij hebben besloten punten toe te kennen, bieden de bevindingen een duidelijk routekaart voor de toekomst: als we AI willen testen op grote, complexe voorspellingen, moeten we stoppen met naar hen te kijken wedstrijd voor wedstrijd en beginnen met het beoordelen van hoe goed ze het hele plaatje kunnen zien.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →