A 35B Hybrid-Attention Mixture-of-Experts Model on a 6GB 2011 GPU: Hand-Written 4-bit CUDA Inference for Fermi
Este artículo demuestra la inferencia de extremo a extremo de un modelo Qwen3.6 MoE de 35 mil millones de parámetros en una GPU Fermi de 6 GB de 2011 mediante la implementación de una estrategia de ejecución híbrida que transmite los pesos para el prellenado de la GPU y utiliza un kernel de enteros SSSE3 escrito a mano para la decodificación de la CPU, mientras documenta tanto las ganancias de rendimiento como las limitaciones prácticas de hardware para ejecutar IA de clase de frontera en silicio legado.