← Últimos artículos
🤖 machine learning

QUADS: Stabilizing NVFP4 Reinforcement Learning for MoE via QUantization-error Alignment across Dual Sides

El artículo propone QUADS, un método de alineación de error de cuantificación de doble lado que estabiliza el aprendizaje por refuerzo con NVFP4 para modelos de Mezcla de Expertos al abordar los errores de activación mediante el entrenamiento consciente de la cuantificación asimétrica y la compensación de activación residual, logrando así una precisión de nivel BF16 con un rendimiento significativamente mejorado en comparación con FP8.

Autores originales: Zhengyang Zhuge, Hao Yu, Xin Wang, Zheng Li, Yizhong Cao, Dayiheng Liu, Jianwei Zhang

Publicado 2026-07-20
📖 4 min de lectura☕ Lectura para el café

Autores originales: Zhengyang Zhuge, Hao Yu, Xin Wang, Zheng Li, Yizhong Cao, Dayiheng Liu, Jianwei Zhang

Artículo original dedicado al dominio público bajo CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás enseñando a un robot superinteligente a resolver acertijos complejos, como problemas matemáticos o escribir código. Para volverse realmente bueno en esto, el robot no solo memoriza respuestas; practica probando miles de soluciones diferentes, recibiendo retroalimentación sobre lo que funcionó y luego ajustando su cerebro para hacerlo mejor la próxima vez. Este proceso se llama Aprendizaje por Refuerzo. Sin embargo, hay un inconveniente: la parte del robot que piensa y aprende (el entrenador) suele estar separada de la parte que genera las respuestas (el motor de despliegue o rollout engine). Para que el aprendizaje funcione, estas dos partes deben hablar exactamente el mismo lenguaje. Si el entrenador piensa en alta definición (como una película en 4K), pero el generador se ve obligado a hablar en una versión de baja resolución y borrosa (como un juego pixelado de 8 bits), el robot se confunde. Comienza a cometer errores porque la "importancia" de sus acciones se distorsiona debido al desenfoque. Este desajuste es un gran problema porque ralentiza todo el proceso de aprendizaje, haciendo que el robot tarde una eternidad en volverse inteligente.

Imagina que queremos hacer que el robot piense más rápido. Podríamos encoger su cerebro aún más, usando un formato de resolución superbaja llamado "NVFP4". Esto es como intentar correr una carrera de alta velocidad en una pista de tierra hecha de guijarros diminutos y toscos. Promete ser increíblemente rápido —mucho más rápido que el estándar actual— pero los guijarros son tan rugosos que las ruedas del coche (la lógica del robot) empiezan a resbalar y a perder el control. El robot intenta aprender, pero la pista rugosa hace que choque tras solo unas pocas vueltas. La gran pregunta es: ¿Podemos hacer que esta pista superrápida y rugosa funcione sin que el robot choque?

Este es exactamente el problema que los investigadores de este artículo se propusieron resolver. Descubrieron que el simple hecho de poner al robot en esta pista rápida y rugosa hace que falle estrepitosamente en unos 150 pasos de entrenamiento. Las puntuaciones de confianza del robot (log-probabilidades) se separan de forma tan salvaje que el aprendizaje se detiene por completo. A través de experimentos cuidadosos, descubrieron por qué sucede esto. Resulta que el problema no son los pesos (el conocimiento almacenado del robot), que pueden sincronizarse fácilmente. El verdadero culpable son las activaciones —los cálculos frescos y realizados sobre la marcha que el robot hace mientras piensa—. Debido a que la pista rugosa (NVFP4) es tan tosca, estos cálculos frescos se distorsionan de una manera que el entrenador no puede arreglar simplemente mirando los pesos.

Para solucionar esto, el equipo inventó una estrategia ingeniosa de dos partes llamada QUADS (QUantization-error Alignment across Dual Sides o Alineación de error de cuantización a través de dos lados). Piensa en esto como un baile entre el entrenador y el generador. En el lado del entrenador, utilizan una técnica especial llamada "Entrenamiento Consciente de la Cuantificación Asimétrica". En lugar de intentar forzar al entrenador a hablar el lenguaje tosco del generador, mantienen su "pensamiento" (activaciones) en alta definición, pero obligan a su "memoria" (pesos) a coincidir con el formato tosco del generador. De esta manera, el entrenador sabe exactamente lo que el generador está viendo cuando mira los pesos, evitando la confusión.

Pero eso no fue suficiente por sí solo. El generador seguía tropezando con los guijarros rugosos cuando intentaba realizar nuevos pensamientos. Así que, en el lado del generador, añadieron una "Compensación de Activación Residual". Imagina que el generador está caminando por la pista rugosa y se da cuenta de: "¡Oye, mi pie está resbalando en este guijarro específico!". En lugar de detener toda la carrera para arreglar la pista, da un paso pequeño y rápido para corregir solo ese desliz específico antes de continuar. Identificaron las partes específicas del cálculo que tenían más probabilidades de resbalar (los "canales de alto residuo") y les dieron un pequeño impulso extra para mantenerse en el camino, todo ello mientras mantenían el resto de la carrera superrápida.

Los resultados son impresionantes. Al usar este baile de dos lados, el robot no solo sobrevivió en la pista rugosa; se desempeñó casi tan bien como si estuviera corriendo en una pista suave y de alta definición. En sus pruebas, el nuevo método mejoró la tasa de éxito del robot en aproximadamente 21.5 puntos en comparación con el intento de usar la pista rugosa sin ayuda. Mejor aún, mantuvo la ventaja de velocidad, corriendo aproximadamente un 16% más rápido que el método estándar anterior. El artículo demuestra que, si bien la pista rugosa es peligrosa por sí sola, con la alineación adecuada y una pequeña corrección adicional para los puntos resbaladizos, finalmente podemos hacer que estos modelos de IA de baja precisión y superrápidos funcionen de manera confiable.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →