When Lifts Predict Lifts: Leakage-Controlled Strength Prediction and a Closed-Form Leakage Diagnostic
Dit artikel legt bloot hoe machine learning-modellen voor het voorspellen van de maximale gewichten van atleten lijden onder een significante inflatie van de nauwkeurigheid door data-lekkage van gelijktijdige lifts, en stelt een gesloten diagnostisch instrument voor om de ernst van deze lekkage te kwantificeren, evenals een kosteneffectief generatief model dat gekalibreerde, fysiologisch consistente voorspellingen biedt zonder afhankelijk te zijn van gegevens van verwante lifts.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In de wereld van de krachtsport, van het Olympische platform tot de lokale sportschool, is weten hoeveel een atleet kan tillen het fundament van alles. Coaches gebruiken deze cijfers om trainingsprogramma's te ontwerpen, vooruitgang bij te houden en te beslissen of een beweging veilig kan worden uitgevoerd. Ideaal gezien zou een coach elke lift die een atleet kan uitvoeren moeten meten—de clean and jerk, de snatch, de back squat en de deadlift—om een compleet beeld te krijgen. Maar alles meten is traag, uitputtend en vaak onmogelijk voor een nieuwe atleet die nog nooit heeft meegedaan aan een wedstrijd. Dit heeft geleid tot een groeiende belangstelling voor het gebruik van computerprogramma's om deze lifts te voorspellen op basis van eenvoudige feiten zoals leeftijd, geslacht, lengte en lichaamsgewicht. De hoop is dat een machine naar het basisprofiel van een persoon kan kijken en precies kan vertellen hoeveel deze kan tillen, wat tijd en moeite bespaart.
Jarenlang hebben computermodellen beweerd dit met verbazingwekkende nauwkeurigheid te kunnen doen, waarbij ze de cijfers vaak in meer dan 90 procent van de gevallen goed krijgen. Echter, een nieuwe studie suggereert dat deze hoge scores misleidend zijn. De onderzoekers ontdekten dat de modellen niet daadwerkelijk leerden hoe ze kracht konden voorspellen op basis van het lichaam van een persoon; in plaats daarvan vertrouwden ze op andere bekende lifts als aanwijzingen om de ontbrekende lift te raden. Als een model weet hoeveel iemand kan squatten, kan het de deadlift met bijna perfecte nauwkeurigheid raden omdat de twee bewegingen zo nauw met elkaar verbonden zijn. Dit is als proberen de lengte van een persoon te raden door te vragen hoe lang diegene is; het antwoord is makkelijk, maar het vertelt je niets nieuws. De echte uitdaging, waar coaches daadwerkelijk voor staan, is het voorspellen van een volledig profiel voor een vreemde die nog nooit een gewicht heeft getild, gebruikmakend van alleen de leeftijd en de lichaamsafmetingen.
Yasin Alipour en Reza Pourgholi, onderzoekers aan de Damghan Universiteit in Iran, zetten zich af tegen dit gebrek en bouwden een betere manier om kracht te voorspellen. Ze begonnen met het nemen van een grote, publieke database van CrossFit-atleten en reproduceerden de hoge nauwkeurigheidsresultaten die eerdere studies hadden gerapporteerd. Wanneer ze hun computermodellen de andere lifts van een atleet lieten zien tijdens een voorspelling, presteerden de modellen briljant en haalden ze de 93 procent nauwkeurigheid die in eerdere studies werd gezien. Maar toen veranderden ze de regels. Ze verwijderden de andere lifts uit de input, waardoor het model gedwongen werd om een lift te voorspellen met alleen de leeftijd, het geslacht, de lengte en het gewicht van de atleet. De resultaten stortten in. De nauwkeurigheid daalde met een aanzienlijke marge, van de hoge 90 procent naar het midden van de 60 procent. Deze dramatische daling onthulde dat het eerdere succes grotendeels een illusie was gecreëerd door datalekken (data leakage), waarbij het antwoord verborgen zat in de vraag.
De onderzoekers realiseerden zich dat het eerlijke probleem veel moeilijker is dan het probleem dat in het lab wordt opgelost. Het voorspellen van een lift voor een nieuwe atleet zonder enige geschiedenis is een moeilijke taak, en de beste computerprogramma's die momenteel beschikbaar zijn, krijgen het slechts in ongeveer 65 procent van de gevallen goed. Dit is geen falen van de technologie, maar een reflectie van de realiteit: de lichaamsgrootte en leeftijd van een persoon kunnen je slechts een beperkt deel vertellen over hun kracht. De studie laat zien dat hoewel machines atleten kunnen screenen en een ruwe startpositie kunnen geven, ze de werkelijke meting van een lift niet kunnen vervangen. De extra informatie die door complexe algoritmen wordt geleverd, voegt slechts een kleine hoeveelheid waarde toe ten opzichte van een eenvoudige berekening op basis van geslacht en lichaamsgewicht alleen.
Om de verwarring in het vakgebied op te lossen, ontwikkelde het team een nieuw hulpmiddel om dit soort afhankelijkheid te detecteren voordat het gebeurt. Ze creëerden een eenvoudige score die een dataset kan analyseren en kan voorspellen hoeveel nauwkeurigheid verloren zal gaan als de "sibling" targets—zoals de andere lifts—worden verwijderd. Deze score werkt door te analyseren hoe de verschillende lifts met elkaar samenhangen nadat rekening is gehouden met de basislichaamsfacten. Als de score hoog is, waarschuwt dit dat de dataset waarschijnlijk opgeblazen is door datalekken. De onderzoekers testten deze diagnostiek op krachtgegevens en vonden dat het perfect werkte. Ze probeerden het ook in volledig andere velden, zoals het voorspellen van de sterkte van betonmengsels en het energieverbruik van gebouwen. In gevallen waar de targets echt verbonden waren, zoals de verschillende lifts in een sportschool, voorspelde de score correct een grote daling in nauwkeurigheid. In gevallen waar de targets al bepaald werden door de inputdata, zoals de verwarmings- en koelingsbehoeften van een gebouw, voorspelde de score correct bijna geen daling, wat bewees dat het hulpmiddel het onderscheid kan maken tussen echte voorspelling en datalekken.
Naast het blootleggen van het probleem, bouwden de onderzoekers een nieuw type model dat ontworpen is om de eerlijke, moeilijke taak van 'cold-start' voorspellingen aan te kunnen. In plaats van elke lift als een apart probleem te behandelen, bouwden ze een enkel systeem dat kracht ziet als een combinatie van algemene capaciteit en een specifieke stijl. Stel je kracht voor als een volumeknop die bepaalt hoe sterk een atleet in het algemeen is, en een set schuifregelaars die bepalen hoe die kracht over verschillende bewegingen wordt verdeeld. Dit systeem kan een paar bekende lifts nemen en de gaten invullen voor de onbekende lifts, of een volledig profiel voorspellen voor een nieuwe atleet. Het doet dit in een fractie van de tijd en kosten van oudere, complexere methoden, terwijl het ook een mate van onzekerheid biedt zodat coaches weten hoeveel ze de cijfers kunnen vertrouwen.
Het team valideerde deze bevindingen op grote schaal door hun methoden te testen op bijna 300.000 competitieve powerlifters uit een andere database. De resultaten hielden stand: de hoge nauwkeurigheid van de oude modellen verdween wanneer de andere lifts werden verwijderd, en het nieuwe diagnostische hulpmiddel identificeerde de lekken correct. Ze toonden ook aan dat de relatie tussen lifts consistent is over verschillende populaties. Een model getraind op recreatieve CrossFit-atleten kon de relatie tussen lifts succesvol voorspellen voor elite powerlifters, zelfs hoewel de elite-atleten veel sterker waren. Dit suggereert dat hoewel de absolute getallen veranderen, de onderliggende structuur van hoe kracht wordt verdeeld, hetzelfde blijft.
De studie sluit af met een duidelijke boodschap voor coaches en datawetenschappers: de krantenkoppen over de nauwkeurigheid van krachtvoorspelling zijn vaak te mooi om waar te zijn. Wanneer een model de andere lifts van een atleet gebruikt om een nieuwe te raden, toont het geen intelligentie; het exploiteert simpelweg een bekende fysieke relatie. De echte waarde van machine learning in dit veld ligt in het vermogen om een redelijk startpunt te bieden voor nieuwe atleten en om ontbrekende gegevens in te vullen wanneer sommige lifts bekend zijn, terwijl het eerlijk toegeeft wat de grenzen van de zekerheid zijn. Door de gemakkelijke, gelekte voorspellingen te scheiden van de moeilijke, eerlijke voorspellingen, hebben de onderzoekers een duidelijk pad gebaand voor het gebruik van data om het menselijk vermogen te begrijpen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.