← Nieuwste papers
🤖 AI

Towards Comprehensive Basketball Understanding

Dit artikel introduceert BasketballBench, een uitgebreide multimodale benchmark afgeleid van het NBA-seizoen 2025-2026, en stelt BasketballSkills voor, een agent die bestaande MLLM's overtreft door expliciet domeinspecifieke perceptie- en retrievaltools samen te stellen om de complexe, geïntegreerde aard van basketbalbegrip aan te pakken.

Oorspronkelijke auteurs: Yirong Hu, Jiayuan Rao, Yu Zhang, Shangzhe Di, Weidi Xie

Gepubliceerd 2026-08-25
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yirong Hu, Jiayuan Rao, Yu Zhang, Shangzhe Di, Weidi Xie

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het kijken naar een professionele basketbalwedstrijd is een rijke, gelaagde ervaring. Om echt te begrijpen wat er gebeurt, moet een kijker meer doen dan simpelweg zien hoe een bal over een veld beweegt. Men moet de specifieke spelers herkennen, het exacte moment van een pass volgen, precies lokaliseren waar een schot is genomen, en deze visuele momenten verbinden aan een enorme bibliotheek aan feiten over de teams, de carrières van de spelers en de regels van de sport. Decennialang hebben computers moeite gehad met dit soort diepgaand, geïntegreerd begrip. Hoewel moderne kunstmatige intelligentie erg goed is geworden in het identificeren van objecten op foto's of het beantwoorden van eenvoudige vragen over afbeeldingen, faalt het vaak wanneer er wordt gevraagd om deze vaardigheden te combineren. Het kan misschien het gezicht van een speler herkennen, maar faalt erin de statistieken van diens carrière te herinneren, of het kan een schot zien worden genomen, maar is niet in staat om precies te zeggen waar op de baan dit gebeurde. Deze kloof tussen zien en begrijpen is de centrale uitdaging waar een nieuwe studie van onderzoekers van Peking University en Shanghai Jiao Tong University zich op richt.

De onderzoekers benaderden dit probleem door eerst een enorme, rigoureuze testomgeving genaamd BasketballBench op te zetten. Ze verzamelden gegevens uit het NBA-seizoen van 2025–2026, waarbij ze meer dan 2.500 videoclips van wedstrijdbeurten, officiële gegevens van 530 actieve spelers en duizenden gestructureerde wedstrijddetails verzamelden. Van dit materiaal maakten ze bijna 8.000 specifieke vragen die verschillende soorten denken vereisten. Sommige vragen waren eenvoudig, waarbij de computer werd gevraagd de score af te lezen van een broadcast-grafiek of een speler uit een foto te identificeren. Andere waren veel complexer en vereisten dat de computer een video bekijkt, uitzoekt wie een specifieke actie maakte, vaststelt waar deze in tijd en ruimte plaatsvond, en vervolgens een specifiek feit over de carrière van die speler uit een database ophaalt. Het doel was om te zien of huidige systemen voor kunstmatige intelligentie deze taken individueel konden uitvoeren en, nog belangrijker, of ze deze vaardigheden konden combineren om een enkel, meerstaps probleem op te lossen.

Wanneer de onderzoekers de meest geavanceerde algemene AI-modellen die beschikbaar zijn testten, waren de resultaten veelzeggend. Deze krachtige systemen presteerden goed op eenvoudige taken. Ze konden de score van een scherm aflezen of een rugnummer identificeren met een hoge nauwkeurigheid. Hun prestaties daalden echter drastisch wanneer de vragen vereisten dat ze wat ze in de video zagen koppelden aan wat ze wisten over het spel. Bijvoorbeeld, wanneer gevraagd werd om de speler te identificeren die een schot maakte en vervolgens de carrièrestatistieken van die speler op te zoeken, struikelden de modellen vaak. Ze konden de actie zien, maar ze hadden moeite om die actie aan de juiste persoon te koppelen en vervolgens de juiste informatie op te halen. De studie toonde aan dat deze algemene modellen niet van nature zijn uitgerust om visuele perceptie, ruimtelijk redeneren en feitelijke kennis samen te weven tot één coherent antwoord.

Om deze beperking aan te pakken, ontwikkelde het team een nieuw systeem genaamd BasketballSkills. In plaats van te vertrouwen op één enkel, massaal model om alles tegelijk te doen, bouwden ze een framework dat fungeert als een gespecialiseerd team van experts. Dit systeem gebruikt een centrale controller die een vraag leest en vervolgens een specifieke set hulpmiddelen selecteert om het op te lossen. Deze hulpmiddelen zijn gespecialiseerd voor basketbal: één hulpmiddel volgt spelers en de bal, een ander identificeert het type actie dat plaatsvindt, een derde leest de rugnummers en een vierde doorzoekt een gestructureerde database met spelergegevens. De controller raadt niet; hij volgt een duidelijke, stapsgewijze procedure. Als een vraag gaat over het schotpercentage van een speler na een specifieke actie, volgt het systeem eerst de video om de speler te vinden, identificeert vervolgens diens rugnummer en raadpleegt tot slot de database voor diens statistieken. Het valideert elke stap voordat het naar de volgende gaat, om er zeker van te zijn dat het verzamelde bewijs accuraat is voordat een definitief antwoord wordt geformuleerd.

De resultaten van deze nieuwe aanpak waren opmerkelijk. In tests over de tien verschillende soorten vragen presteerde het BasketballSkills-systeem op acht van hen beter dan de beste commerciële AI-modellen. Het blonk vooral uit in de complexe taken die het combineren van meerdere vaardigheden vereisten, zoals het identificeren van een speler uit een videoclip en vervolgens de carrièregegevens van die speler ophalen. Terwijl de algemene modellen vaak faalden in het verbinden van het visuele bewijs met de feitelijke kennis, slaagde het gespecialiseerde systeem erin deze verschillende capaciteiten samen te stellen om tot de juiste conclusie te komen. De studie suggereert dat voor complexe, real-world domeinen zoals professionele sporten, de weg vooruit mogelijk niet is om algemene modellen groter te maken, maar om systemen te bouwen die gespecialiseerde vaardigheden expliciet kunnen organiseren en combineren. Door een moeilijk probleem onder te verdelen in een reeks betrouwbare, domeinspecifieke stappen, hebben de onderzoekers aangetoond dat computers geleerd kunnen worden het spel van basketbal te begrijpen met een diepgang en nauwkeurigheid die voorheen onbereikbaar was.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →