← Últimos artículos
🤖 machine learning

Weight-Space Geometry of Offline Reasoning Training

Este artículo analiza la geometría del espacio de pesos de seis métodos de entrenamiento de razonamiento fuera de línea en un modelo Qwen3-4B, revelando que mientras SFT, RFT y RIFT convergen a actualizaciones casi colineales con una precisión similar, DPO adopta un subespacio distinto y casi ortogonal que logra un rendimiento significativamente superior en los benchmarks GSM8K y AIME26, mientras que Offline GRPO introduce un componente ortogonal sustancial permaneciendo dentro de la cuenca de pérdida de SFT.

Autores originales: Aleksandr Nikolich, Igor Kiselev, Vladimir Platonov, Karina Romanova

Publicado 2026-06-24
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Aleksandr Nikolich, Igor Kiselev, Vladimir Platonov, Karina Romanova

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un tutor de matemáticas brillante y gigante (el "Profesor") que puede resolver problemas complejos. Quieres enseñar a un estudiante más pequeño y económico (el "Estudiante") a pensar como ese tutor. Le das al estudiante las soluciones paso a paso del Profesor (llamadas "rollouts") y le pides al estudiante que aprenda de ellas.

El artículo plantea una pregunta simple pero profunda: ¿Importa cómo le decimos al estudiante que aprenda?

Existen muchas diferentes "fórmulas de enseñanza" (funciones de pérdida) que los investigadores utilizan. Algunos dicen: "Solo mira las respuestas correctas". Otros dicen: "Mira todas las respuestas, pero otorga créditos extra a las buenas". Otros dicen: "Compara las buenas respuestas con las malas".

Los autores querían saber: ¿Hacen estas diferentes fórmulas que el cerebro del estudiante (los pesos de la computadora) cambie de la misma manera, o crean tipos de pensadores completamente diferentes?

Aquí está el desg款 de sus hallazgos, utilizando analogías simples:

1. El grupo del "Imitador" (SFT, RFT, RIFT)

La Analogía: Imagina a tres estudiantes intentando copiar un dibujo.

  • Estudiante A copia cada línea.
  • Estudiante B solo copia las líneas que son perfectas.
  • Estudiante C copia cada línea, pero dibuja las perfectas de forma un poco más oscura.

El Hallazgo: Aunque usan reglas ligeramente diferentes, todos terminan dibujando casi exactamente el mismo cuadro.

  • Matemáticamente, los cambios en sus cerebros son casi idénticos (97% de similitud).
  • Todos obtienen aproximadamente la misma puntuación en exámenes de matemáticas (alrededor de 87–88%).
  • Conclusión: Si solo quieres que un estudiante imite el razonamiento del profesor, no importa mucho cuál de estas tres fórmulas específicas utilices. Efectivamente, están haciendo lo mismo.

2. El "Auto-ajustador" (DFT)

La Analogía: Este estudiante usa el mismo papel que el Estudiante A, pero tiene un hábito extraño: automáticamente hace que el lápiz sea más claro cuando ya tiene confianza y más oscuro cuando no está seguro.

El Hallazgo: Este pequeño ajuste cambia la dirección del dibujo significativamente. El cerebro de este estudiante cambia de una manera muy diferente a la del grupo del Imitador, a pesar de que no utilizó ninguna puntuación de "recompensa" para guiarse. Es un camino único, pero no necesariamente conduce a una mejor puntuación.

3. El "Paso Lateral" (Offline GRPO)

La Analogía: Este estudiante mira el trabajo del profesor pero decide dar un gran paso hacia un lado. Sigue permaneciendo en el mismo vecindario general (la "cuenca de pérdida"), pero está recorriendo un camino diferente.

El Hallazgo: Este método empuja el cerebro del estudiante en una dirección que es un 67% diferente de la del grupo del Imitador. En las capas finales del cerebro (los "pensamientos finales"), esta diferencia aumenta a casi un 86%.

  • Sin embargo, siguen obteniendo una puntuación similar (alrededor de 87%).
  • Conclusión: Este método explora una nueva dirección, pero no parece desbloquear un "superpoder" en términos de precisión comparado con los Imitadores.

4. El "Atípico" (DPO)

La Analogía: Mientras todos los demás están dibujando en el mismo papel en la misma habitación, este estudiante está dibujando en un lienzo completamente diferente, en una habitación distinta, con un estilo totalmente diferente.

El Hallazgo:

  • Geometría: Los cambios en el cerebro de este estudiante son casi 90 grados (ortogonales) a los de todos los demás. Está haciendo algo fundamentalmente diferente.
  • La Barrera: Si intentaras mezclar el cerebro de este estudiante con el del grupo del Imitador (una "interpolación lineal"), el resultado se rompería. Están en "universos" de soluciones diferentes.
  • La Puntuación: A pesar de ser tan diferente, este estudiante obtuvo las puntuaciones más altas (93.5% en matemáticas, 30% en acertijos difíciles).
  • La Trampa: Este estudiante fue entrenado con una tasa de aprendizaje 10 veces menor (dieron pasos mucho más pequeños y cuidadosos). Los autores advierten que no podemos estar 100% seguros de si la alta puntuación se debe a la fórmula o simplemente a que dieron pasos más pequeños y precisos.

5. La sorpresa de "En Vivo vs. Grabado"

El artículo también analizó qué sucede si el estudiante aprende de la práctica en vivo (Online) frente a la práctica grabada (Offline).

  • Offline: Al aprender de un conjunto fijo de respuestas grabadas del profesor, el estudiante del "Paso Lateral" (Offline GRPO) se mantiene algo cercano a los Imitadores.
  • Online: Cuando el estudiante genera sus propios problemas de práctica (Online GRPO), se vuelven completamente ortogonales (totalmente diferentes) de los Imitadores.
  • Conclusión: El hecho de que los métodos "Offline" se vean similares a los Imitadores es, en parte, porque todos están mirando exactamente el mismo conjunto fijo de respuestas del profesor. Si les permites generar sus propios problemas de práctica, divergen salvajemente.

Resumen

  • La mayoría de los métodos (SFT, RFT, RIFT) son solo diferentes formas de decir "Copia al profesor". Resultan en una estructura cerebral similar y puntuaciones parecidas.
  • DPO es el atípico. Construye una estructura cerebral completamente diferente. Obtiene las mejores puntuaciones, pero lo hace con un estilo de entrenamiento muy específico y cauteloso (tasa de aprendizaje pequeña) que dificulta la comparación directa con los demás.
  • La naturaleza "Offline" de los datos de entrenamiento es una razón importante por la cual muchos de estos métodos terminan pareciéndose tanto entre sí.

El artículo esencialmente mapea la "geografía" de estos métodos de aprendizaje, mostrando cuáles son vecinos y cuáles viven en planetas diferentes.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →