← Últimos artículos
🤖 machine learning

Search Your Block Floating Point Scales!

Este artículo presenta ScaleSearch, una estrategia novedosa que optimiza los factores de escala en punto flotante de bloque mediante una búsqueda de granularidad fina de los bits de la mantisa para reducir significativamente el error de cuantificación y mejorar el rendimiento de los modelos generativos de baja precisión, incluyendo un algoritmo especializado ScaleSearchAttention que logra una pérdida de rendimiento cercana a cero.

Autores originales: Tanmaey Gupta, Hayden Prairie, Xiaoxia Wu, Reyna Abhyankar, Qingyang Wu, Austin Silveria, Pragaash Ponnusamy, Jue Wang, Ben Athiwaratkun, Leon Song, Tri Dao, Daniel Y. Fu, Chris De Sa

Publicado 2026-05-13
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Tanmaey Gupta, Hayden Prairie, Xiaoxia Wu, Reyna Abhyankar, Qingyang Wu, Austin Silveria, Pragaash Ponnusamy, Jue Wang, Ben Athiwaratkun, Leon Song, Tri Dao, Daniel Y. Fu, Chris De Sa

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El Panorama General: Empacar una Maleta Eficientemente

Imagina que estás intentando empacar una maleta (la memoria de una computadora) para un viaje. Tienes muchos artículos (datos) que deben caber, pero la maleta es pequeña. Para que todo quepa, tienes que aplastar los artículos (esto se llama cuantización).

En el pasado, al empacar un grupo de artículos, mirabas el artículo más grande del grupo y decías: "Bien, encogeré todo lo demás para que el artículo más grande quepa perfectamente". Este es el método estándar utilizado por los chips modernos de IA.

El Problema:
Los autores notaron que solo porque el artículo más grande quepa, no significa que el resto de los artículos estén empacados eficientemente. A veces, encoger todo basándose en el artículo más grande deja mucho espacio vacío o aplasta demasiado los artículos más pequeños, haciéndolos difíciles de reconocer más tarde. Es como intentar meter un oso de peluche gigante y un botón diminuto en una caja; si dimensionas la caja para el oso, el botón se pierde en el ruido.

La Solución: "ScaleSearch" (El Empacador Inteligente)

El artículo introduce una nueva estrategia llamada ScaleSearch. En lugar de solo mirar el artículo más grande y establecer la regla una vez, el algoritmo toma un pequeño "foco" y verifica algunas formas diferentes de empacar la maleta.

  • La Vieja Forma: "El artículo más grande mide 10 pulgadas de alto. Haré que mi escala sea 10".
  • La Nueva Forma (ScaleSearch): "El artículo más grande mide 10 pulgadas. Pero espera... si establezco mi escala en 9.5, el artículo grande aún cabe, pero los artículos medianos se vuelven mucho más claros. Si la establezco en 10.5, los artículos pequeños se ven mejor. Permíteme probar rápidamente estas pocas opciones y elegir la que hace que todo el grupo se vea mejor".

El artículo muestra que al realizar esta búsqueda pequeña y rápida, la computadora puede empacar los datos con mucha más precisión, reduciendo el "error de cuantización" (el desorden causado por aplastar los datos) en aproximadamente un 27%.

El Hardware Especial: NVFP4

Este truco funciona específicamente debido a nuevos chips de computadora superrápidos (arquitectura Blackwell de NVIDIA) que utilizan un formato llamado NVFP4.

Piensa en el antiguo método de empacar como usar una regla con solo marcas grandes (1, 2, 3). Los nuevos chips tienen una regla con marcas diminutas y finas (1.0, 1.1, 1.2, etc.). ScaleSearch es la técnica que utiliza esas marcas diminutas y finas para encontrar el ajuste perfecto, en lugar de simplemente adivinar con las marcas grandes.

La Mejora de "Atención": ScaleSearchAttention

Los modelos de IA (como los chatbots) deben prestar atención a las palabras que ya han dicho para entender la siguiente palabra. Esta "memoria" se llama KV Cache. Almacenar esta memoria ocupa mucho espacio y ralentiza las cosas.

Los autores crearon una versión especial llamada ScaleSearchAttention.

  • Lo que hace: Aplica la lógica del "Empacador Inteligente" a la memoria de la IA.
  • El Resultado: Permite que la IA almacene su memoria en un formato muy compacto (4 bits) sin perder su capacidad de entender el contexto.
  • La Analogía: Imagina un bibliotecario que usualmente tiene que escribir el título completo de cada libro con todo detalle (lento y voluminoso). Con este nuevo método, el bibliotecario usa un código abreviado inteligente que es diminuto y rápido de escribir, pero verifica doble el código para asegurarse de no haber omitido ningún detalle importante.

¿Qué Demostraron? (Los Resultados)

El artículo probó esto en modelos reales de IA (como Llama y Qwen) y herramientas de generación de video (como Mochi).

  1. Mejor Matemáticas y Razonamiento: Cuando usaron ScaleSearch en problemas matemáticos, la IA se volvió significativamente más inteligente. Para un modelo, la puntuación en una prueba de matemáticas saltó 15 puntos en comparación con el método estándar.
  2. Mejor Lenguaje: Cuando la IA escribía historias o respondía preguntas, cometió menos errores. La "perplejidad" (una medida de cuán confundida está la IA) disminuyó, lo que significa que la IA sonó más natural y humana.
  3. Velocidad: ¿La mejor parte? Esta "búsqueda" es tan rápida que apenas ralentiza la computadora. Es como verificar tres formas diferentes de atarte los zapatos; toma un instante pero asegura que no tropieces más tarde. El sistema funciona al 98% de la velocidad del método estándar.

Resumen

El artículo dice: "No solo adivines cómo encoger tus datos basándote en la pieza más grande. Tómate un instante para verificar algunas opciones cercanas y obtendrás un resultado mucho más claro y preciso con casi ninguna penalización de velocidad".

Llaman a esto ScaleSearch, y cuando se aplica a la memoria de la IA, lo llaman ScaleSearchAttention. Hace que los modelos de IA sean más inteligentes y eficientes sin necesidad de hardware nuevo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →