← Últimos artículos
📊 statistics

Optimal Hold-Out Size in Cross-Validation

Este artículo propone un marco basado en la utilidad y con fundamentos sólidos para seleccionar el tamaño óptimo de la muestra de validación externa en la validación cruzada, equilibrando explícitamente el tamaño de la muestra de entrenamiento frente a la incertidumbre de la evaluación, reemplazando así las convenciones arbitrarias con elecciones específicas al contexto que mejoran la fiabilidad de la selección de modelos y la inferencia científica derivada.

Autores originales: Kenichiro McAlinn, Kōsaku Takanashi

Publicado 2026-02-03
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Kenichiro McAlinn, Kōsaku Takanashi

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El gran problema: El dilema de los "Tres Osos" de las pruebas

Imagina que eres un chef intentando perfeccionar la receta de una nueva sopa. Tienes una olla de ingredientes (tus datos). Para saber si la sopa sabe bien, tienes que probarla. Pero aquí está el truco: no puedes probar la sopa antes de terminar de cocinarla, pero tampoco puedes cocinarla perfectamente si te detienes a probarla constantemente.

En la ciencia de datos, esto se llama Validación Cruzada (Cross-Validation). Divides tus datos en dos montones:

  1. El Montón de Entrenamiento: Se utiliza para enseñar al modelo (el chef) cómo hacer la sopa.
  2. El Montón de Prueba (Hold-out): Se utiliza para probar la sopa y ver si realmente es buena.

El artículo argumenta que, durante años, los científicos han estado adivinando qué tan grandes deben ser estos montones. Por lo general, simplemente eligen una regla estándar, como "80% para entrenamiento, 20% para prueba" (o dividirlo en 5 o 10 fragmentos). Los autores dicen que esto es como un chef que adivina a ciegas cuánta sopa debe reservar para la degustación sin saber si tiene suficientes ingredientes para cocinar una buena tanda primero.

El equilibrio: Cocinar vs. Probar

El artículo identifica un tira y afloja entre dos necesidades contrapuestas:

  • Necesitar más entrenamiento (Montón de prueba pequeño): Si le das al chef casi todos los ingredientes para practicar (un montón de prueba diminuto), aprenderá la receta muy bien. La sopa probablemente sabrá excelente. Pero, debido a que solo tienes una cucharadita para probar, no estás seguro de si esa cucharadita representa toda la olla. Podría ser una cucharada con suerte o una mala. Tu "certeza" es baja.
  • Necesitar más pruebas (Montón de prueba grande): Si reservas un tazón enorme de sopa para probarla, puedes estar muy seguro de cómo sabe la sopa. Tu "certeza" es alta. Pero, el chef tuvo que cocinar con menos ingredientes, por lo que la sopa podría estar poco sazonada o mal hecha. El modelo es menos preciso.

El objetivo del artículo: Encontrar el punto de los "Tres Osos" (Goldilocks): el tamaño perfecto para el montón de prueba que equilibre una sopa bien cocinada con una prueba de sabor fiable.

El ingrediente secreto: El "Ruido Irreducible" (σ2\sigma^2)

Los autores descubrieron que la respuesta depende de algo llamado Ruido Irreducible.

Piensa en esto como el "caos" o la "aleatoriedad" en tus ingredientes.

  • Bajo Ruido: Imagina hornear un pastel en un laboratorio perfecto donde la temperatura y la humedad están controladas. Los ingredientes se comportan exactamente como se espera. El "ruido" es bajo.
  • Alto Ruido: Imagina intentar predecir el clima o el comportamiento humano. Hay tanta aleatoriedad que incluso un modelo perfecto no puede estar 100% seguro. El "ruido" es alto.

El artículo afirma que qué tanto puedes confiar en tus resultados de prueba depende de qué tan ruidosos sean tus datos.

  • Si tus datos son limpios y predecibles (Bajo Ruido), puedes permitirte darle al modelo más datos para aprender (hacer el montón de prueba más pequeño) porque los resultados son estables.
  • Si tus datos son desordenados y caóticos (Alto Ruido), necesitas un montón de prueba más grande para estar seguro de que el modelo no está simplemente adivinando, incluso si eso significa que el modelo tuvo menos práctica.

La solución: Un "Dial de Ajuste" en lugar de un libro de reglas

En lugar de decir "Usa siempre 5 pliegues (folds)", los autores proponen un nuevo método donde el investigador actúa como el sintonizador de una radio.

  1. Estimar el Ruido: Tienes que decidir (o adivinar) qué tan ruidosos son tus datos. Este es tu "dial de ajuste".
  2. Ejecutar el Cálculo: El artículo proporciona una fórmula que toma tu nivel de ruido y te indica el tamaño óptimo para tu montón de prueba.
  3. El Resultado: Obtienes un mapa. Puede decir: "Si tus datos son muy ruidosos, usa una división de 2 pliegues. Si son limpios, usa una división de 20 pliegues".

Ejemplos del mundo real del artículo

Los autores probaron esto con datos reales para demostrar que la regla de "talla única" es errónea.

  • El ejemplo del Abalone (Caracol de mar): Intentaron predecir la edad de caracoles marinos.

    • Para un modelo simple (Regresión Lineal), el mejor tamaño de prueba cambió mucho dependiendo de qué tan ruidosos asumían que eran los datos.
    • Para un modelo complejo (Random Forest), el mejor tamaño de prueba fue diferente otra vez.
    • La Lección: Usar el mismo tamaño de prueba para ambos modelos era engañoso. El modelo complejo necesitaba más práctica (montón de prueba más pequeño), mientras que el modelo simple necesitaba más certeza (montón de prueba más grande).
  • El ejemplo de la Mutación del Cáncer: Observaron datos genéticos para encontrar patrones en el cáncer.

    • Cuando cambiaron el tamaño de la prueba (el valor "K"), la lista de genes de cáncer "importantes" cambió.
    • La Lección: Un pequeño cambio en cómo divides los datos puede cambiar la conclusión científica sobre qué genes causan la enfermedad.

Por qué esto es importante para todos

El artículo concluye que no existe un único "mejor" número para dividir los datos.

  • Para los Científicos: Dejen de usar ciegamente la validación cruzada de "5 pliegues" o "10 pliegues". Necesitan preguntarse: "¿Qué tan ruidosos son mis datos?" y "¿Qué tan complejo es mi modelo?".
  • La Conclusión: La elección de cómo dividir tus datos es una decisión científica, no solo un ajuste de computadora. Al hacer explícita la suposición sobre el "ruido", los investigadores pueden evitar sacar conclusiones falsas.

En resumen: El artículo ofrece a los científicos una nueva herramienta para dejar de adivinar y empezar a calcular el equilibrio perfecto entre enseñar a un modelo y probarlo, asegurando que sus descubrimientos científicos sean reales y no solo un golpe de suerte de cómo cortaron los datos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →