← Últimos artículos
💬 NLP

Rigel: Reverse-Engineering the Metal 4.1 Tensor Compute Path on the Apple M4 Max GPU

Este artículo presenta Rigel, un estudio empírico que realiza ingeniería inversa al camino de cómputo tensorial de Apple M4 Max Metal 4.1 para revelar que su operación matmul2d de fp8 está limitada por la memoria y es emulada en lugar de estar acelerada por hardware, al tiempo que descubre detalles de ejecución ocultos y permite un kernel de fusión manual que supera al camino descompuesto estándar hasta en un 12.9%.

Autores originales: Ramchand Kumaresan

Publicado 2026-06-12
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Ramchand Kumaresan

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina el nuevo chip de computadora M4 Max de Apple como una cocina enorme y de alta tecnología. Durante años, se les ha dicho a los desarrolladores (los chefs) que esta cocina tiene un "Horno Tensor" especial y superrápido, diseñado específicamente para hornear recetas complejas de IA (como los Modelos de Lenguaje Extensos) a la velocidad del rayo. El manual de instrucciones oficial (la especificación Metal 4.1) dice: "Sí, tenemos este horno, y soporta estos ingredientes específicos". Pero el manual es frustrantemente vago: no dice cómo funciona el horno, dónde está ubicado, o si realmente es más rápido que la estufa estándar.

El artículo RIGEL es como un equipo de científicos de alimentos que decidió dejar de leer el manual y empezar a probar la comida para descubrir qué es lo que realmente está pasando en la cocina. Construyeron un conjunto de herramientas de medición ultra precisas para realizar ingeniería inversa al comportamiento del M4 Max.

Aquí está lo que descubrieron, traducido a analogías de la vida cotidiana:

1. El "Horno Especial" es en realidad una Estufa Regular

La Afirmación: El artículo demuestra que el M4 Max no tiene un "Tensor Core" dedicado (una unidad de hardware especial solo para matemáticas de IA).
La Analogía: Piensa en la operación "Tensor" como un tipo específico de pastel. El manual implica que hay una cinta transportadora especial y de alta velocidad solo para estos pasteles. RIGEL descubrió que, en el M4 Max, no hay una cinta transportadora. En su lugar, el personal de la cocina (los núcleos de sombreado de la GPU) simplemente están haciendo estos pasteles a mano en la estufa regular, usando las mismas herramientas que usan para todo lo demás. Lo están haciendo de manera eficiente, pero no están usando una máquina dedicada y secreta.

2. El "Ingrediente Mágico" (FP8) es un Truco, no un Superpoder

La Afirmación: El artículo pone a prueba un formato de datos de baja precisión llamado FP8 (que utiliza la mitad de la memoria del formato estándar FP16). La especificación sugiere que esto podría ser más rápido porque es más pequeño. RIGEL descubrió que no es más rápido; de hecho, es ligeramente más lento.
La Analogía: Imagina que estás cargando cubetas de agua. El formato FP16 es una cubeta grande; el formato FP8 es una cubeta pequeña. Podrías pensar: "¡Si uso cubetas pequeñas, puedo hacer más viajes en el mismo tiempo!". Pero los científicos descubrieron que, en el M4 Max, los trabajadores tienen que detenerse y verter el agua de la cubeta pequeña en una cubeta grande antes de poder usarla. Este "vertido" (desempaquetado) toma tiempo.

  • El Resultado: Usar las cubetas pequeñas (FP8) no hace que el trabajo sea más rápido. Solo te ahorra tener que cargar tantas cubetas pesadas a la vez (ahorro de espacio de memoria). Es un ahorrador de espacio, no un ahorrador de velocidad. El artículo lo llama una "característica de huella de memoria, no una característica de rendimiento".

3. El "Diseño de la Receta Secreta"

La Afirmación: El manual dice que la forma en que se disponen los datos en la memoria "Tensor" es "opaca" (oculta) y "específica del dispositivo". RIGEL descubrió exactamente cómo están dispuestos.
La Analogía: Imagina que al personal de la cocina se le dice que organice los ingredientes en una cuadrícula, pero el manual solo dice: "Hazlo en un patrón secreto". RIGEL observó al personal y se dio cuenta de que están organizando los ingredientes en un patrón de cuadrado 8x8 muy específico. Una vez que los científicos descifraron este patrón secreto, pudieron reorganizar los ingredientes para que el proceso de cocción fuera más fluido.

4. La "Puerta de Versión" (El Portero)

La Afirmación: El manual dice que puedes usar estas funciones con cierta versión de software (Xcode 26.1+), pero RIGEL descubrió que eso es mentira.
La Analogía: El manual dice: "Cualquiera con un sombrero rojo puede entrar a la sala VIP". Pero cuando RIGEL intentó entrar con un sombrero rojo del año pasado (Xcode 26.5), el portero los echó. En realidad, necesitas un sombrero rojo completamente nuevo (Xcode 27) y una tarjeta de identificación específica (macOS 27.0) para que la puerta siquiera se abra. El manual simplemente estaba equivocado sobre quién podía entrar.

5. La Optimización del "Súper-Chef"

La Afirmación: Debido a que los científicos ahora saben exactamente cómo funciona la cocina (sin horno secreto, cuadrícula 8x8, FP8 es lento), escribieron una nueva receta personalizada.
La Analogía: En lugar de seguir las instrucciones estándar paso a paso (Hornear Pastel -> Agregar Glaseado -> Agregar Fruta), lo cual implica caminar de ida y vuelta al almacén tres veces, los científicos escribieron una receta de "fusión". Combinaron los pasos de hornear, glasear y agregar la fruta en un solo movimiento fluido directamente en la estufa.

  • El Resultado: Esta receta personalizada fue entre un 6.5% y un 12.9% más rápida para tareas que caben en el espacio de trabajo inmediato de la cocina (residentes en caché). Sin embargo, para tareas enormes que requieren ir y venir del almac warehouse (memoria principal), la mejora de velocidad desaparece porque el tiempo de caminata domina el tiempo de cocción.

Resumen de la "Gran Revelación"

El artículo concluye que, en el Apple M4 Max:

  • No hay Hardware Mágico: No hay un motor de IA especial; todo se está ejecutando en los núcleos de gráficos estándar.
  • FP8 es para Almacenamiento, no para Velocidad: Usar números más pequeños ahorra espacio pero no hace que los cálculos sean más rápidos.
  • El Manual está Incompleto: La documentación oficial oculta la realidad del hardware, el diseño exacto de la memoria y los requisitos reales de software.
  • El Código Personalizado Gana: Si conoces el diseño secreto, puedes escribir un programa personalizado que supere a las herramientas estándar de Apple por un margen pequeño pero medible.

Los autores enfatizan que estos hallazgos se basan en datos duros de un solo chip M4 Max ejecutando una versión beta del sistema operativo, y han publicado todo su código para que cualquiera pueda verificar los resultados por sí mismo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →