← Últimos artículos
🤖 machine learning

Why the Third Axis Is Freedom

Este artículo sostiene que el "tercer eje" en el entrenamiento generativo no es el modelado explorativo (XM) en sí mismo, sino la "libertad" —la debilidad de las restricciones de comportamiento— la cual el XM facilita al aumentar la probabilidad de coincidencia y supera empíricamente a los métodos de selección tradicionales en escenarios de generalización y cambio de distribución.

Autores originales: Michael Timothy Bennett

Publicado 2026-08-07
📖 8 min de lectura🧠 Análisis profundo

Autores originales: Michael Timothy Bennett

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El Gran Juego de Adivinanza de la IA

Imagina que estás enseñando a un robot a hacer dibujos. En el mundo de la inteligencia artificial, esto se hace normalmente mediante un proceso llamado "entrenamiento generativo". El robot intenta hacer una imagen y, si se ve diferente del ejemplo que le mostraste, recibe una "penalización" o una mala puntuación. El robot quiere minimizar esta penalización, por lo que aprende a copiar el ejemplo con la mayor perfección posible. Pero aquí está el truco: si el robot solo aprende a escupir la única respuesta más común que ve, puede volverse muy bueno copiando esa cosa específica, pero terrible al manejar cualquier cosa nueva o diferente. Se convierte en un loro rígido en lugar de un artista creativo.

Durante mucho tiempo, los científicos se preguntaron cómo hacer que estos modelos fueran más flexibles. Descubrieron un truño llamado "Modelado Exploratorio". En lugar de pedirle al robot que haga solo un intento, le pides que haga muchos intentos a la vez —por ejemplo, diez dibujos diferentes—. Luego, solo castigas al que es más cercano al objetivo, ignorando los otros nueve. Esto obliga al robot a mantener una variedad más amplia de ideas en su cabeza, con la esperanza de que una de ellas sea la correcta. Esta idea fue llamada recientemente como un nuevo "tercer eje" del entrenamiento de la IA, sugiriendo que la capacidad de contener muchos "modos" o versiones de una respuesta es la clave para hacer a la IA más inteligente.

Pero, ¿es mantener muchas ideas lo mismo que ser inteligente? Este artículo plantea una pregunta más profunda: ¿Está la magia en el número de intentos, o está en la libertad que tiene el robot para elegir? El autor argumenta que simplemente contar cuántos intentos hace un modelo no es toda la historia. En cambio, el verdadero secreto es la "libertad", que en este contexto significa cuántas formas diferentes tiene el modelo de ser correcto sin romper las reglas. Es la diferencia entre un robot que es forzado a elegir de una lista diminuta de diez opciones, y un robot que tiene permitido elegir de una vasta biblioteca de posibilidades, incluso si actualmente solo usa algunas de ellas. El artículo explora si esta "libertad" es lo que realmente ayuda a la IA a aprender mejor, en lugar de solo el número bruto de intentos.

El Tercer Eje es la Libertad, No Solo un Conteo

El autor, Michael Timothy Bennett, adopta una mirada fresca sobre este "tercer eje" del entrenamiento de la IA. Argumenta que, si bien la idea anterior de "expresividad generativa" (la capacidad de contener muchos modos) es interesante, en realidad es un poco un espejismo. El verdadero héroe de la historia es la libertad.

Piensa en el comportamiento de un modelo como un conjunto de reglas para un juego. Una regla "débil" es una regla que no te restringe mucho. Por ejemplo, una regla que dice "Puedes usar cualquier color de camisa" es débil porque permite millones de posibilidades. Una regla "fuerte" que dice "Debes usar una camisa roja" es fuerte porque te deja con una sola opción. Bennett argumenta que los mejores modelos de IA son aquellos que mantienen sus reglas lo más "débiles" posible mientras siguen siendo correctos. Esta "debilidad" es lo que él llama libertad. Es el volumen de completaciones compatibles que el modelo aún puede imaginar. Si un modelo es demasiado rígido (demasiado fuerte), podría fallar cuando el mundo cambie. Si es libre (débil), puede adaptarse a nuevas situaciones porque no se ha encerrado en un único camino estrecho.

El artículo desafía la idea de que el "tercer eje" es simplemente sobre el número de salidas que un modelo puede producir (su "conteo de modos"). Bennett demuestra que un modelo podría teóricamente tener un número enorme de salidas permitidas pero seguir siendo terrible en la generalización si solo utiliza una de ellas. Por el contrario, un modelo con un conjunto más pequeño de salidas permitidas podría ser increíblemente poderoso si distribuye su atención de manera uniforme entre ellas. El artículo demuestra matemáticamente que la libertad es una propiedad de la función del modelo (lo que realmente hace), no de su forma (cuántos parámetros o capas tiene). Puedes cambiar el tamaño del modelo o los datos que ve, pero si la "libertad" de su comportamiento permanece igual, su capacidad de generalización permanece igual.

La Magia del "Best-of-K"

Entonces, ¿cómo obtenemos esta libertad? El artículo analiza un método llamado Modelado Exploratorio (XM), donde un modelo genera KK candidatos y elige el mejor. El autor deriva una fórmula matemática que muestra exactamente cómo funciona este proceso.

Imagina que estás buscando una llave específica en una habitación oscura.

  • Si solo buscas una vez (K=1K=1), podrías perder la llave aunque esté ahí mismo.
  • Si buscas diez veces (K=10K=10), tus posibilidades de encontrar la llave aumentan.

El artículo muestra que este proceso de "buscar diez veces" actúa como una lupa sobre la libertad del modelo. No crea nueva libertad de la nada; en su lugar, recompensa a los modelos que tienen un "perfil de permiso" amplio. Si un modelo permite muchas salidas diferentes (alta libertad), el proceso "best-of-K" tiene mucha más probabilidad de encontrar una buena coincidencia. Si el modelo es rígido y solo permite una salida, buscar diez veces no ayuda mucho porque los diez intentos serán probablemente la misma cosa aburrida.

El autor demuestra que a medida que aumentas KK (el número de intentos), el proceso de entrenamiento naturalmente empuja al modelo hacia ser más "débil" (más libre). Deja de intentar ser un copión perfecto de una sola cosa y comienza a aprender a cubrir un rango más amplio de posibilidades. Esto es especialmente cierto cuando los objetivos (las cosas que el modelo intenta aprender) no son todos iguales. Si algunos objetivos son raros y otros comunes, un KK pequeño hará que el modelo se concentre solo en los comunes. Pero a medida que KK se vuelve más grande, el modelo se ve obligado a prestar atención también a los raros, eventualmente distribuyendo su "permiso" a través de todas las opciones válidas.

Los Experimentos: Poniendo la Teoría a Prueba

El artículo no se queda solo en el ámbito de las matemáticas; realiza dos experimentos principales para ver si esto se sostiene en el mundo real de las redes neuronales.

Experimento 1: ¿Hace que más intentos el modelo sea más libre?
Los investigadores entrenaron modelos de IA con diferentes valores de KK (de 1 a 32). Midieron la "libertad" de los modelos entrenados contando cuántas salidas válidas diferentes los modelos estaban realmente permitidos producir.

  • El Resultado: Cuando usaron un KK más alto, los modelos se volvieron significativamente más libres. Por ejemplo, bajo objetivos uniformes, aumentar KK de 1 a 8 aumentó el "log de la media de la libertad" en aproximadamente 8.3. Los modelos no solo se volvieron mejores adivinando; realmente expandieron su "perfil de permiso" para incluir más posibilidades válidas. Esto confirmó que el método de entrenamiento convierte con éxito el presupuesto de "intentos" en libertad funcional.

Experimento 2: ¿Hace que elegir el modelo "más libre" lo haga mejor?
Aquí, los investigadores entrenaron un grupo de modelos y luego tuvieron que elegir el mejor para usarlo en una nueva situación (donde las reglas del juego cambiaron ligeramente). Compararon dos formas de elegir:

  1. Validación del Hijo (Child-Validation): Elegir el modelo que mejor funcionó en los datos de entrenamiento originales (la tarea "hijo").
  2. Selección por Libertad (Freedom Selection): Elegir el modelo que tuvo la puntuación de "libertad" más alta, incluso si no era el absolutamente mejor en los datos originales.
  • El Resultado: El método de "Selección por Libertad" ganó 29 de 30 veces. Los modelos elegidos por su libertad funcionaron mucho mejor en los nuevos datos balanceados (mejorando la tasa de acierto de aproximadamente 0.317 a 0.389). Esto sugiere que al seleccionar por libertad, estás seleccionando un modelo que es más robusto y adaptable al cambio, incluso si parece ligeramente menos perfecto en los datos específicos en los que fue entrenado.

El Panorama General: Medios vs. Fines

El artículo concluye con una distinción clara entre la herramienta y el objetivo.

  • La Exploración (los KK intentos) es el medio. Es el mecanismo, el presupuesto, la forma en que forzamos al modelo a mirar alrededor.
  • La Libertad es el fin. Es la propiedad real del modelo que lo hace bueno para la generalización.

El autor argumenta que la "expresividad generativa" (la idea de que tener muchos modos es el objetivo) es solo un indicador de la libertad. Es una forma de contar las posibilidades, pero pierde el matiz de cómo se usan esas posibilidades. Un modelo puede tener un alto conteo de modos pero seguir siendo rígido si no los usa bien. La verdadera generalización proviene de la libertad: la capacidad del modelo para permanecer abierto a muchos futuros compatibles.

Al final, el artículo sugiere que el "tercer eje" de la formación de la IA siempre ha sido la libertad. Los nuevos métodos como el Modelado Exploratorio son solo una forma ingeniosa de entrenar a los modelos para que sean menos restringidos, menos rígidos y más listos para lo que sea que el futuro les depare. Al entrenar con más intentos, no solo estamos enseñando a la IA a adivinar mejor; le estamos enseñando a ser más libre.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →