← Últimos artículos
💻 computer science

When Lifts Predict Lifts: Leakage-Controlled Strength Prediction and a Closed-Form Leakage Diagnostic

Este artículo expone cómo los modelos de aprendizaje automático para predecir las levantamientos máximos de los atletas sufren una inflación significativa de la precisión debido a la fuga de datos de levantamientos concurrentes, y propone un diagnóstico de forma cerrada para cuantificar la severidad de esta fuga junto con un modelo generativo rentable que proporciona predicciones calibradas y fisiológicamente consistentes sin depender de los datos de levantamientos hermanos.

Autores originales: Yasin Alipour, Reza Pourgholi

Publicado 2026-09-24
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Yasin Alipour, Reza Pourgholi

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el mundo de los deportes de fuerza, desde la plataforma olímpica hasta el gimnasio local, saber cuánto puede levantar un atleta es la base de todo. Los entrenadores utilizan estos números para diseñar programas de entrenamiento, realizar un seguimiento del progreso y decidir si un movimiento es seguro de intentar. Idealmente, un entrenador mediría cada uno de los levantamientos que un atleta puede realizar—el clean and jerk, el snatch, la sentadilla trasera y el peso muerto—para obtener una imagen completa. Pero medirlo todo es lento, agotador y, a menudo, imposible para un atleta nuevo que nunca ha competido antes. Esto ha llevado a un creciente interés en el uso de programas informáticos para predecir estos levantamientos basándose en hechos simples como la edad, el sexo, la altura y el peso corporal. La esperanza es que una máquina pueda mirar el perfil básico de una persona y decirle exactamente cuánto puede levantar, ahorrando tiempo y esfuerzo.

Durante años, los modelos informáticos han pretendido hacer esto con una precisión asombrosa, logrando a menudo acertar en las cifras más del 90 por ciento de las veces. Sin embargo, un nuevo estudio sugiere que estos altos puntajes son engañosos. Los investigadores descubrieron que los modelos no estaban aprendiendo realmente a predecir la fuerza a partir del cuerpo de una persona; en su lugar, estaban recurriendo a otros levantamientos conocidos como pistas para adivinar el faltante. Si un modelo sabe cuánto puede hacer alguien en sentadilla, puede adivinar su peso muerto con una precisión casi perfecta porque ambos movimientos están estrechamente vinculados. Esto es como intentar adivinar la estatura de una persona preguntándole qué tan alta es; la respuesta es fácil, pero no aporta nada nuevo. El verdadero desafío, el que los entrenadores enfrentan realmente, es predecir un perfil completo para un extraño que nunca ha levantado una pesa antes, utilizando solo su edad y tamaño.

Yasin Alipour y Reza Pourgholi, investigadores de la Universidad de Damghan en Irán, se propusieron exponer este fallo y construir una mejor forma de predecir la fuerza. Comenzaron tomando una gran base de datos pública de atletas de CrossFit y reproduciendo los resultados de alta precisión que estudios anteriores habían reportado. Cuando permitieron que sus modelos informáticos vieran los otros levantamientos de un atleta mientras realizaban una predicción, los modelos funcionaron brillantemente, igualando la precisión del 93 por ciento vista en trabajos anteriores. Pero luego cambiaron las reglas. Eliminaron los otros levantamientos de la entrada, obligando al modelo a predecir un levantamiento usando solo la edad, el sexo, la altura y el peso del atleta. Los resultados colapsaron. La precisión cayó por un margen significativo, bajando de los altos 90 a mediados de los 60. Esta dramática caída reveló que el éxito anterior era en gran medida una ilusión creada por la fuga de datos (data leakage), donde la respuesta estaba escondida dentro de la pregunta.

Los investigadores se dieron cuenta de que el problema honesto es mucho más difícil que el que se resuelve en el laboratorio. Predecir un levantamiento para un nuevo atleta sin ningún historial es una tarea difícil, y los mejores programas informáticos disponibles actualmente solo aciertan aproximadamente el 65 por ciento de las veces. Esto no es un fallo de la tecnología, sino un reflejo de la realidad: el tamaño del cuerpo y la edad de una persona solo pueden decirte tanto sobre su fuerza. El estudio muestra que, si bien las máquinas pueden evaluar a los atletas y dar un punto de partida aproximado, no pueden reemplazar la medición real de un levantamiento. La información adicional proporcionada por algoritmos complejos añade solo un pequeño valor sobre un cálculo simple basado en el sexo y el peso corporal por sí solos.

Para solucionar la confusión en el campo, el equipo desarrolló una nueva herramienta para detectar este tipo de dependencia antes de que ocurra. Crearon una puntuación simple que puede analizar un conjunto de datos y predecir cuánto se perderá de precisión si se eliminan los objetivos "hermanos"—como los otros levantamientos—. Esta puntuación funciona analizando cómo se relacionan los diferentes levantamientos entre sí después de contabilizar los datos corporales básicos. Si la puntuación es alta, advierte que el conjunto de datos probablemente esté inflado por la fuga de datos. Los investigadores probaron este diagnóstico en datos de fuerza y descubrieron que funcionaba perfectamente. También lo probaron en campos completamente diferentes, como la predicción de la resistencia de mezclas de concreto y el uso de energía en edificios. En los casos donde los objetivos estaban verdaderamente vinculados, como los diferentes levantamientos en un gimnasio, la puntuación predijo correctamente una gran caída. En los casos donde los objetivos ya estaban determinados por los datos de entrada, como las necesidades de calefacción y refrigeración de un edificio, la puntuación predijo correctamente que no habría casi ninguna caída, demostrando que la herramienta puede distinguir entre la predicción real y la fuga de datos.

Más allá de solo exponer el problema, los investigadores construyeron un nuevo tipo de modelo diseñado para manejar la tarea honesta y difícil de la predicción de arranque en frío (cold-start prediction). En lugar de tratar cada levantamiento como un problema separado, construyeron un único sistema que ve la fuerza como una combinación de capacidad general y un estilo específico. Imagine la fuerza como una perilla de volumen que controla qué tan fuerte es un atleta en general, y un conjunto de controles deslizantes que determinan cómo se distribuye esa fuerza a través de diferentes movimientos. Este sistema puede tomar algunos levantamientos conocidos y completar los huecos de los desconocidos, o predecir un perfil completo para un nuevo atleta. Lo hace en una fracción del tiempo y costo de los métodos antiguos y más complejos, proporcionando además una medida de incertidumbre para que los entrenadores sepan cuánto confiar en el número.

El equipo validó estos hallazgos a gran escala, probando sus métodos en casi 300,000 levantadores de potencia competitivos de una base de datos diferente. Los resultados se mantuvieron: la alta precisión de los modelos antiguos desapareció cuando se eliminaron los otros levantamientos, y la nueva herramienta de diagnóstico identificó correctamente la fuga de datos. También demostraron que la relación entre los levantamientos es consistente a través de diferentes poblaciones. Un modelo entrenado con atletas recreativos de CrossFit pudo predecir con éxito la relación entre levantamientos para levantadores de potencia de élite, a pesar de que los atletas de élite eran mucho más fuertes. Esto sugiere que, si bien los números absolutos camben, la estructura subyacente de cómo se distribuye la fuerza permanece igual.

El estudio concluye con un mensaje claro para entrenadores y científicos de datos: las cifras de los titulares en la predicción de la fuerza suelen ser demasiado buenas para ser ciertas. Cuando un modelo utiliza los otros levantamientos de un atleta para adivinar uno nuevo, no está demostrando inteligencia; simplemente está explotando una relación física conocida. El verdadero valor del aprendizaje automático en este campo reside en su capacidad para proporcionar un punto de partida razonable para nuevos atletas y para completar datos faltantes cuando algunos levantamientos son conocidos, todo ello admitiendo honestamente los límites de su certeza. Al separar las predicciones fáciles y filtradas de las difíciles y honestas, los investigadores han proporcionado un camino más claro para utilizar los datos para comprender la fuerza humana.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →