← Últimos artículos
🔬 condensed matter

A 35B Hybrid-Attention Mixture-of-Experts Model on a 6GB 2011 GPU: Hand-Written 4-bit CUDA Inference for Fermi

Este artículo demuestra la inferencia de extremo a extremo de un modelo Qwen3.6 MoE de 35 mil millones de parámetros en una GPU Fermi de 6 GB de 2011 mediante la implementación de una estrategia de ejecución híbrida que transmite los pesos para el prellenado de la GPU y utiliza un kernel de enteros SSSE3 escrito a mano para la decodificación de la CPU, mientras documenta tanto las ganancias de rendimiento como las limitaciones prácticas de hardware para ejecutar IA de clase de frontera en silicio legado.

Autores originales: A. C. Opus, J. Q. Lu

Publicado 2026-06-24✓ Author reviewed
📖 5 min de lectura🧠 Análisis profundo

Autores originales: A. C. Opus, J. Q. Lu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes una biblioteca masiva e increíblemente inteligente que contiene 35 mil millones de libros (un modelo de IA moderno). Ahora, imagina que quieres leer una historia específica de esta biblioteca, pero estás atrapado en un pequeño cobertizo de 14 años de antigüedad con solo un escritorio pequeño y una computadora muy vieja y lenta.

Eso es exactamente lo que describe este artículo. Los investigadores lograron que un modelo de IA de vanguardia se ejecutara en una tarjeta gráfica (GPU) de 2011 que tiene solo 6 GB de memoria—aproximadamente la mitad del tamaño del propio modelo.

Aquí explicamos cómo lograron esta hazaña "imposible" a través de analogías sencillas:

1. El Problema: La Biblioteca es Demasiado Grande para el Cobertizo

El modelo de IA es como una enciclopedia gigante. Incluso cuando se reduce (se comprime a precisión de 4 bits), ocupa unos 10.5 GB de espacio. La computadora vieja solo tiene un escritorio de 6 GB.

  • El Problema: No puedes meter todo el libro en el escritorio.
  • La Forma Antigua: Las computadoras modernas tienen "Tensor Cores" (calculadoras especializadas) y memoria rápida para manejar esto. La tarjeta de 2011 no tiene nada de eso. Es como intentar hacer matemáticas avanzadas con una calculadora que solo tiene botones para suma y resta.

2. La Solución: Una Carrera de Relevos de Dos Equipos

Dado que el modelo completo no cabe, los investigadores dividieron el trabajo en dos equipos: un Equipo de GPU (la tarjeta gráfica vieja) y un Equipo de CPU (el procesador principal de la computadora).

  • Fase 1: El "Prefill" (Leer la instrucción/Prompt)

    • La Analogía: Imagina que necesitas leer una larga lista de instrucciones (el prompt) para comenzar.
    • El Truco: La GPU actúa como una cinta transportadora rápida. Toma una pequeña sección de los "libros" (pesos del modelo) desde el disco duro de la computadora principal, la pone en su pequeño escritorio, realiza el cálculo para ese fragmento y luego la intercambia por el siguiente fragmento.
    • El Resultado: En lugar de leer todo el libro a la vez, lo lee página por página en un flujo continuo. Esto les permitió procesar las instrucciones iniciales un 34% más rápido que antes.
  • Fase 2: El "Decode" (Escribir la Historia)

    • La Analogía: Ahora la IA necesita escribir la historia palabra por palabra.
    • El Problema: Si la GPU intentara hacer esto, tendría que ir y venir del disco duro por cada palabra. Eso es como un corredor esprintando hacia la biblioteca, agarrando un libro, corriendo de regreso, escribiendo una palabra y repitiendo el proceso. Es demasiado lento.
    • El Truco: Movieron esta parte al cerebro de la computadora principal (la CPU). Escribieron un código personalizado y altamente eficiente que trata los números como simples enteros en lugar de decimales complejos.
    • El Resultado: Esto hizo que la IA escribiera palabras 3 veces más rápido que antes, convirtiendo un paso lento en un trote constante.

3. Los Atajos "Mágicos"

Los investigadores no solo dividieron el trabajo; inventaron trucos ingeniosos para hacer que el hardware viejo se sintiera nuevo.

  • El Caché de "Instantáneas" (Snapshot Cache):

    • El Problema: La IA tiene una "memoria" que cambia a medida que lee. Normalmente, no puedes reutilizar el trabajo anterior porque el estado de la memoria es diferente.
    • La Solución: Tomaron "instantáneas" de la memoria de la IA en puntos de control específicos. Si le pides a la IA que repita una historia que ya escuchó, no vuelve a leer todo. Salta directamente a la última instantánea que guardó.
    • El Resultado: Repetir un prompt largo pasó de tardar 78 segundos a solo 0.5 segundos. Es como saltar directamente al final de una película que ya has visto en lugar de verla de nuevo.
  • La Memoria "Anclada" (Pinned Memory):

    • La Analogía: Normalmente, mover datos desde el disco duro a la GPU es como mover cajas con un montacargas inestable.
    • La Solución: "Anclaron" las cajas en su lugar (memoria anclada) para que el montacargas pudiera moverlas suavemente sin tambalearse. Esto redujo a la mitad el tiempo dedicado a mover datos.

4. Lo Que No Funcionó (Los "Callejones sin Salida")

Parte del artículo trata sobre lo que falló, lo cual es igual de importante. Nos dice dónde está el muro.

  • Intentar usar la GPU para escribir: Intentaron que la GPU escribiera las palabras, pero la tarjeta vieja era demasiado lenta para mover datos de ida y vuelta. De hecho, era más lenta que la CPU.
  • Usar todos los hilos de la computadora: Intentaron usar cada uno de los hilos de procesamiento disponibles (como contratar a 24 trabajadores en lugar de 12). Esto causó un embotellamiento, ralentizando todo masivamente.
  • Reescribir las matemáticas: Intentaron reescribir los núcleos matemáticos (kernels) de tres maneras diferentes, pero el hardware viejo simplemente no podía manejar el tipo específico de matemáticas requerido.

La Conclusión

Este artículo no trata de establecer un nuevo récord de velocidad. Es una prueba de concepto que dice: "No necesitas una supercomputadora de $20,000 para ejecutar una IA de 35 mil millones de parámetros".

Al tratar el hardware viejo como un rompecabezas y construir un motor personalizado desde cero (escribiendo código a mano para una arquitectura de computadora que los desarrolladores de software abandonaron hace 14 años), demostraron que la IA moderna puede ejecutarse en hardware "basura" si eres lo suficientemente ingenioso con la ingeniería.

En resumen: Tomaron un motor de Ferrari (el modelo de IA) y lograron que funcionara en un cuadro de bicicleta de los años 90 (la GPU de 2011) construyendo una transmisión personalizada y cambiando el tipo de combustible, demostiendo que con suficiente ingenio, puedes llegar sorprendentemente lejos con tecnología vieja.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →