← Últimos artículos
🤖 machine learning

Compute Aligned Training: Optimizing for Test Time Inference

Este artículo presenta "Entrenamiento Alineado con la Computación", un marco novedoso que alinea los objetivos de entrenamiento de los Modelos de Lenguaje Grandes con las estrategias de inferencia en tiempo de prueba mediante la derivación de nuevas funciones de pérdida, mejorando así significativamente la escalabilidad del rendimiento en comparación con los enfoques estándar de SFT y RL.

Autores originales: Adam Ousherovitch, Ambuj Tewari

Publicado 2026-04-29
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Adam Ousherovitch, Ambuj Tewari

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás entrenando a un estudiante para un tipo muy específico de examen final.

La Vieja Forma (Entrenamiento Estándar):
Tradicionalmente, cuando enseñamos a modelos de IA (como los que escriben ensayos o resuelven problemas matemáticos), actuamos como un profesor estricto que califica cada tarea individualmente. Si el estudiante responde correctamente una pregunta, decimos "¡Buen trabajo!" y si se equivoca, decimos "Inténtalo de nuevo". Queremos que el estudiante sea perfecto para obtener la primera respuesta correcta cada vez.

El problema es que esto no los prepara para el examen real. En el mundo real, no solo le pedimos al modelo una respuesta. Le pedimos que genere muchas respuestas diferentes (como pedirle a un estudiante que escriba 10 borradores diferentes de un ensayo) y luego elegimos la mejor, o votamos por la más común.

Si entrenas a un estudiante para ser perfecto en el primer borrador, podría volverse demasiado seguro y dejar de intentar explorar nuevas ideas. Podría quedarse atrapado en una forma de pensar "segura". Cuando le pidas que genere 10 borradores más tarde, podría simplemente escribir 10 versiones ligeramente diferentes de la misma respuesta "segura", y ninguna de ellas podría ser la solución brillante y creativa que necesitabas.

La Nueva Forma (Entrenamiento Alineado al Cómputo - CAT):
Los autores de este artículo proponen un nuevo método de entrenamiento llamado Entrenamiento Alineado al Cómputo (CAT). En lugar de calificar al estudiante en una sola tarea, lo califican en función de lo bien que le iría en el formato del examen real.

Así es como funciona, usando algunas analogías:

1. La Analogía del "Pass@N" (El Billete de Lotería)

Imagina que el examen te permite comprar N billetes de lotería (digamos 64 billetes) por una pregunta. Ganas si cualquiera de tus 64 billetes es el número ganador.

  • Entrenamiento Estándar: Si el estudiante ya tiene un 50% de posibilidades de ganar con un billete, el profesor sigue empujándolo para llegar al 90% o al 99%. Pero en una lotería de 64 billetes, una vez que tienes un 50% de posibilidades, comprar más billetes garantiza una victoria de todos modos. El profesor está desperdiciando energía tratando de hacer que un estudiante "bueno" sea "perfecto" en una pregunta fácil, mientras ignora las preguntas difíciles donde el estudiante tiene un 1% de posibilidades.
  • Entrenamiento CAT: El profesor se da cuenta: "Oye, es probable que este estudiante gane con 64 billetes. Voy a dejar de calificar tan duramente esta pregunta fácil". En su lugar, concentran toda su energía en las preguntas difíciles donde el estudiante está fallando actualmente. Le enseñan al estudiante a distribuir sus posibilidades, asegurando que al menos uno de los 64 billetes sea ganador, en lugar de intentar hacer que un billete específico sea perfecto.

2. La Analogía del "Voto Mayoritario" (La Elección)

Imagina que el examen le pide al modelo generar 10 respuestas, y la clase vota por la más popular.

  • Entrenamiento Estándar: El profesor intenta hacer que la primera respuesta del estudiante sea absolutamente la más popular, incluso si ya está ganando por un margen abrumador. Esto es como un candidato que ya está ganando el 90% de los votos; el profesor sigue diciéndole que haga campaña más duro, lo cual es una pérdida de tiempo.
  • Entrenamiento CAT: El profesor mira el "punto de inflexión". Si la respuesta del estudiante está perdiendo actualmente por un margen pequeño, el profesor le da un gran impulso para ayudarle a cruzar la meta. Si el estudiante ya está ganando cómodamente, el profesor deja de darle puntos extra. Esto obliga al modelo a concentrarse en las preguntas "de campo de batalla" donde un poco de esfuerzo extra puede cambiar el voto.

3. La Analogía del "Mejor de N" (El Concurso de Talentos)

Imagina que el modelo genera 10 canciones, y solo guardas la mejor.

  • Entrenamiento Estándar: El profesor intenta hacer que la canción promedio suene bien. Esto lleva a música segura, aburrida y "de la media", que nunca es mala, pero nunca es increíble tampoco.
  • Entrenamiento CAT: El profesor le dice al modelo: "Está bien que 9 de tus canciones sean terribles, siempre y cuando la décima sea una obra maestra". Esto anima al modelo a tomar riesgos y probar ideas extrañas y de alta varianza. Aprende a producir una amplia variedad de salidas, sabiendo que el proceso de "búsqueda" (elegir la mejor) filtrará los fracasos y conservará al ganador.

¿Qué Hicieron Realmente?

Los investigadores probaron esta idea de tres maneras específicas:

  1. Problemas Matemáticos: Entrenaron modelos de IA para resolver problemas matemáticos. Cuando usaron CAT para preparar a los modelos para "Pass@N" (generar muchas respuestas y elegir la correcta), los modelos mejoraron significativamente en la resolución de problemas difíciles en comparación con el método estándar.
  2. Votación: Entrenaron modelos para generar respuestas para una "Votación Mayoritaria". Nuevamente, los modelos CAT rindieron mejor cuando se aplicó la estrategia de votación.
  3. Diseño de Proteínas: Incluso probaron esto en un tipo completamente diferente de IA que diseña proteínas (los bloques de construcción de la vida). En un escenario donde la IA tenía que encontrar una estructura de proteína rara y de alta calidad entre muchas malas, los modelos entrenados con CAT fueron mucho mejores encontrando la proteína "premio gordo" que los modelos estándar.

La Conclusión

El artículo argumenta que cómo entrenas un modelo debe coincidir con cómo lo usas.

Si planeas usar el modelo para generar muchas opciones y elegir la mejor, no deberías entrenarlo para ser perfecto en el primer intento. Deberías entrenarlo para ser bueno en crear un conjunto de opciones donde es probable que se encuentre la mejor.

Llaman a esto "Entrenamiento Alineado al Cómputo" porque alinea el proceso de entrenamiento con el "cómputo" (el poder de pensamiento adicional) utilizado en el momento del examen. Es una forma de obtener mejores resultados sin necesidad de computadoras más potentes ni más tiempo de entrenamiento; solo cambias las reglas del juego para coincidir con la realidad de cómo se usará el modelo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →