Procedural-skill SFT across capacity tiers: A W-Shaped pre-SFT Trajectory and Regime-Asymmetric Mechanism on 0.8B-4B Qwen3.5 Models
Este trabajo demuestra que, aunque el SFT de habilidades procedimentales produce mejoras absolutas uniformes en los modelos Qwen3.5 de 0.8B a 4B, la trayectoria de rendimiento resultante sigue un patrón en forma de W impulsado por capacidades base asimétricas según el régimen, donde el SFT proporciona la mejora absoluta más significativa a los modelos que inicialmente tienen dificultades con el procedimiento.
Artículo original dedicado al dominio público bajo CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
La Gran Imagen: Enseñar una Receta a Diferentes Cocineros
Imagina que tienes tres cocineros con diferentes niveles de experiencia:
- El Novato (0.8B): Un ayudante de cocina que está ansioso pero se abruma con facilidad.
- El Aprendiz (2B): Un cocinero que conoce lo básico, pero a veces se vuelve perezoso o salta pasos.
- El Ayudante de Chef (4B): Un cocinero muy competente que generalmente puede resolver las cosas por sí mismo.
Los investigadores querían ver qué ocurría si les daban a los tres cocineros una receta escrita específica de 5 pasos (una "habilidad procedimental") para seguir en 200 desafíos culinarios diferentes. Querían saber: ¿Darles la receta realmente les ayuda a cocinar mejor, o simplemente fingen seguirla?
El Descubrimiento Principal: La Forma de "W"
Los investigadores encontraron algo sorprendente. Antes de darle la receta a cualquiera, la capacidad de los cocineros para manejar la tarea seguía una extraña forma de "W" cuando se observaban desde el más pequeño al más grande:
- El Novato (0.8B): Cuando se le dio la receta antes del entrenamiento, en realidad lo hizo peor. Los 5 pasos eran demasiado complicados; se confundió en el paso 1 y arruinó todo el plato. La receta fue una carga.
- El Aprendiz (2B): Cuando se le dio la receta, lo hizo mejor. Estaba en el "punto dulce". La receta actuaba como ruedas de entrenamiento, ayudándole a revisar su trabajo y evitar errores que solía cometer.
- El Ayudante de Chef (4B): Cuando se le dio la receta antes del entrenamiento, lo hizo ligeramente peor (o se mantuvo igual). Ya era tan bueno cocinando que leer la receta se sentía como papeleo extra. Los ralentizaba sin añadir valor.
El Giro: Después de que los investigadores entrenaron a los cocineros usando la receta (un proceso llamado SFT), ocurrió algo mágico. La cantidad de mejora fue casi la misma para los tres cocineros.
- El Novato aprendió a seguir los pasos sin confundirse.
- El Aprendiz se volvió un poco más agudo.
- El Ayudante de Chef aprendió a dejar de tratar la receta como papeleo molesto y empezar a usarla como una herramienta útil.
La Lección: El entrenamiento (SFT) funciona más intensamente donde el cocinero está luchando más. Corrige la confusión del Novato y la pereza del Ayudante de Chef, resultando en un "impulso" similar para todos, incluso aunque comenzaron desde lugares muy diferentes.
La Trampa del "Formato" (Un Gran Error que Corrigieron)
El artículo destaca un enorme error que casi cometen.
Imagina un juez estricto que solo acepta respuestas escritas en una línea específica: "RESPUESTA: [El Nombre del Plato]".
- El Novato y el Ayudante de Chef a menudo escribían la respuesta en una oración como: "Concluyo que el plato es Pizza".
- El juez estricto (un script de computadora) no podía encontrar la palabra "RESPUESTA" y los marcaba como fracasos, incluso aunque dieran la respuesta correcta.
- El Aprendiz casualmente escribió exactamente en el formato que el juez quería, así que parecía el ganador.
Los investigadores se dieron cuenta de que su "juez" estaba sesgado. No estaba midiendo la habilidad culinaria; estaba midiendo la habilidad de mecanografía.
La Solución: Cambiaron a un juez similar a un humano (una IA que lee la oración completa).
- Resultado: ¡Las puntuaciones del Novato y del Ayudante de Chef saltaron!
- El Sesgo: El juez estricto había estado castigando injustamente a los cocineros que escribían en oraciones "de forma libre". Los investigadores descubrieron que el grupo "curado" (que seguía la receta) fue en realidad penalizado más por el juez estricto porque sus explicaciones detalladas a menudo enterraban la respuesta final en el texto.
El "Techo" y la "Frontera"
Los investigadores compararon a su Ayudante de Chef (4B) entrenado con un Chef Celebre de Clase Mundial (llamado "Haiku-4-5").
- Antes del entrenamiento, el Ayudante de Chef era bueno, pero no estaba exactamente al nivel del Chef Celebre.
- Después de entrenar con la receta, el Ayudante de Chef empató con el Chef Celebre. Ambos obtuvieron 197 de 200 platos perfectos.
- Esto demuestra que el entrenamiento no solo hizo que el Ayudante de Chef "pareciera" que seguía pasos; en realidad lo hizo tan bueno como el mejor del mundo para estas tareas específicas.
Lo Que No Funcionó (Los Resultados "Negativos")
Los investigadores intentaron mejorar al Novato (0.8B) cambiando la receta de entrenamiento (cambiando el texto, eliminando partes de los pasos, etc.).
- Resultado: Nada funcionó. El Novato todavía no podía cocinar los platos perfectamente.
- Por qué: El Novato simplemente no tenía suficiente capacidad cerebral (capacidad) para mantener todos los pasos en su cabeza a la vez. No importa cómo intentaran enseñarle, el "techo" eran los propios límites del Novato, no el método de enseñanza.
Resumen de Conclusiones Clave
- El entrenamiento ayuda a todos, pero por razones diferentes: Rescata al confundido, afila al competente y reengancha al sobreconfiado. El "impulso" es sorprendentemente similar en todos los casos.
- No confíes en jueces rígidos: Si solo buscas un formato específico (como "RESPUESTA: X"), podrías pasar por alto el hecho de que un modelo resolvió el problema correctamente.
- El tamaño importa, pero no como piensas: Un modelo pequeño puede aprender a usar un procedimiento tan bien como uno grande, pero no necesariamente puede ejecutar toda la tarea perfectamente si la tarea es demasiado difícil para el tamaño de su cerebro.
- La Curva "W": Los modelos pequeños se confunden con los procedimientos; los modelos medianos los adoran; los modelos grandes los encuentran molestos hasta que se entrenan para ver su valor.
En resumen: El artículo muestra que enseñar un proceso paso a paso es una herramienta poderosa, pero debes medirla con justicia (ignorando reglas de formato rígidas) y entender que el tamaño de un modelo determina qué tan bien puede ejecutar los pasos, incluso si aprende a seguirlos tan bien como un modelo más grande.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.