← Últimos artículos
💬 NLP

Data Repetition Beats Data Scaling in Long-CoT Supervised Fine-Tuning

Este artículo demuestra que, contrariamente a la intuición estándar, el ajuste fino supervisado con datos de cadena de pensamiento logra un rendimiento de razonamiento superior al entrenar repetidamente en conjuntos de datos más pequeños hasta alcanzar la memorización completa, en lugar de escalar el tamaño del conjunto de datos para un único ciclo de entrenamiento.

Autores originales: Dawid J. Kopiczko, Sagar Vaze, Tijmen Blankevoort, Yuki M. Asano

Publicado 2026-08-11
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Dawid J. Kopiczko, Sagar Vaze, Tijmen Blankevoort, Yuki M. Asano

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás tratando de enseñarle a un estudiante brillante pero distraído cómo resolver acertijos increíblemente difíciles, como problemas matemáticos complejos o preguntas científicas profundas. En el mundo de la inteligencia artificial, este estudiante es un "modelo de lenguaje", un programa informático que aprende leyendo texto. Para que estos modelos sean buenos razonando, los científicos utilizan un proceso llamado "Ajuste Fino Supervisado" (SFT, por sus siglas en inglés). Piensa en esto como darle al estudiante una pila de soluciones de ejemplo escritas por un maestro experto. El estudiante lee estos ejemplos e intenta copiar el proceso de pensamiento, paso a paso, hasta que pueda resolver problemas similares por su cuenta.

Durante mucho tiempo, la regla de oro en el aprendizaje automático ha sido que "más es mejor". La intuición es simple: si quieres que un estudiante aprenda bien, debes darle una biblioteca masiva de libros únicos. Cuantos más ejemplos diferentes vea, mejor debería volverse para generalizar ante nuevas situaciones. Es como creer que leer 10,000 historias diferentes siempre es mejor que leer las mismas 100 historias una y otra vez. Pero, ¿y si esa regla es errónea? ¿Y si, para este tipo específico de entrenamiento de "razonamiento", el secreto no es una biblioteca más grande, sino una comprensión más profunda de una más pequeña? Esta es la pregunta que aborda un nuevo artículo de la conferencia COLM 2026, el cual desafía nuestras suposiciones básicas sobre cómo aprende la IA.

Los investigadores detrás de este estudio decidieron probar la regla de "más es mejor" realizando una serie de experimentos controlados. Tomaron un modelo de IA estándar y lo entrenaron con datos de "Cadena de Pensamiento" (Chain-of-Thought): trazas de razonamiento largas y detalladas donde el modelo aprende a pensar en un problema antes de responder. Establecieron un presupuesto estricto: una cantidad fija de "esfuerzo de computación" (como un número fijo de horas que se le permite estudiar al estudiante). Luego compararon dos estrategias. La Estrategia A consistía en darle al estudiante una enorme pila de ejemplos únicos (51,200 muestras) pero permitirle leer toda la pila solo una vez. La Estrategia B consistía en darle al estudiante una pila diminuta de ejemplos (tan pocos como 200 o 400 muestras) pero permitirle leer esa misma pila pequeña muchas, muchas veces, hasta 128 veces.

Los resultados fueron sorprendentes y contraintuitivos. El artículo encontró que el estudiante que leyó la pila pequeña una y otra vez (Estrategia B) se volvió significativamente mejor resolviendo problemas nuevos y difíciles que el estudiante que leyó rápidamente la enorme biblioteca una sola vez. En pruebas de rendimiento difíciles como las competencias matemáticas AIME y el cuestionario científico GPQA, el modelo entrenado con solo 400 muestras durante 128 épocas superó al modelo entrenado con 51,200 muestras durante solo 1 época por un margen masivo: mejorando la precisión entre 12 y 26 puntos porcentuales. Es como si el estudiante que memorizó algunas historias clave perfectamente pudiera resolver nuevos misterios mejor que el estudiante que hojeó mil libros diferentes.

El artículo también exploró por qué sucede esto y cuáles son los límites. Descubrieron que la mejora no provino de aprender nuevos hechos, sino de que el modelo "memorizara" la estructura del razonamiento. A medida que el modelo repetía el pequeño conjunto de datos, eventualmente llegaba a un punto en el que podía predecir la siguiente palabra en los ejemplos de entrenamiento con una precisión casi perfecta (100%). Una vez que el modelo alcanzaba esta "memorización total" de los datos de entrenamiento, su rendimiento en nuevas pruebas dejaba de mejorar y se estancaba. Esto sugiere que, para este tipo de entrenamiento, el objetivo no es ver tantos ejemplos diferentes como sea posible, sino interiorizar el patrón de razonamiento hasta que se convierta en algo natural.

Curiosamente, los investigadores verificaron si esta "repetición" causaba que el modelo olvidara todo lo demás que sabía (un problema llamado "olvido catastrófico"). Encontraron que repetir el pequeño conjunto de datos en realidad causaba menos olvido que leer el enorme conjunto de datos una sola vez. Parece que, al practicar profundamente la estructura del razonamiento, el modelo se volvió más seguro de su propia lógica, lo que le ayudó a mantenerse en la tarea sin perder su conocimiento general.

Sin embargo, los autores son cuidadosos al no llamar a esto una solución mágica que lo resuelve todo. Descartan explícitamente la idea de que esto funcione para todos los datos; por ejemplo, si el profesor que proporciona los ejemplos es débil o si los ejemplos son incorrectos, los beneficios cambian. También señalan que, aunque la "ventaja de la repetición" es robusta, la razón exacta de por qué memorizar los datos de entrenamiento ayuda a la generalización sigue siendo un misterio. Sugieren que el modelo podría estar desbloqueando capacidades ocultas que ya poseía, en lugar de aprender algo completamente nuevo.

En resumen, este artículo sugiere que, para enseñar a la IA a razonar, podríamos estar perdiendo el tiempo intentando encontrar conjuntos de datos cada vez más grandes. En su lugar, podríamos obtener mejores resultados tomando un conjunto pequeño y de alta calidad de ejemplos de razonamiento y dejando que el modelo los estudie hasta que los conozca a la perfección. Los autores proponen una nueva regla práctica: continúa el entrenamiento en el conjunto de datos pequeño hasta que el modelo pueda predecir perfectamente el texto de entrenamiento, y luego detente. Aunque no han explicado completamente el "porqué" de este fenómeno, han demostrado que, a veces, en el mundo de la IA, leer la misma página 100 veces es mucho más poderoso que ojear 100 páginas diferentes.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →