← Derniers articles
🔬 condensed matter

A 35B Hybrid-Attention Mixture-of-Experts Model on a 6GB 2011 GPU: Hand-Written 4-bit CUDA Inference for Fermi

Cet article démontre l'inférence de bout en bout d'un modèle Qwen3.6 MoE de 35 milliards de paramètres sur un GPU Fermi de 6 Go de 2011 en implémentant une stratégie d'exécution hybride qui diffuse les poids pour le préremplissage (prefill) du GPU et utilise un noyau entier SSSE3 écrit à la main pour le décodage CPU, tout en documentant à la fois les gains de performance et les limites matérielles pratiques de l'exécution d'une IA de classe frontalière sur du silicium hérité.

Auteurs originaux : A. C. Opus, J. Q. Lu

Publié 2026-06-24✓ Author reviewed
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : A. C. Opus, J. Q. Lu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous possédez une bibliothèque immense et incroyablement intelligente contenant 35 milliards de livres (un modèle d'IA moderne). Maintenant, imaginez que vous vouliez lire une histoire spécifique dans cette bibliothèque, mais que vous soyez coincé dans un minuscule cabanon de 14 ans avec seulement un petit bureau et un ordinateur très vieux et très lent.

C'est exactement ce que décrit ce document. Les chercheurs ont réussi à faire fonctionner un modèle d'IA de pointe sur une carte graphique (GPU) de 2011 qui ne possède que 6 Go de mémoire — environ la moitié de la taille du modèle lui-même.

Voici comment ils ont accompli ce exploit « impossible », expliqué à travers des analogies simples :

1. Le problème : La bibliothèque est trop grande pour le cabanon

Le modèle d'IA est comme une encyclopédie géante. Même lorsqu'il est réduit (compressé en précision 4 bits), il occupe environ 10,5 Go d'espace. Le vieil ordinateur ne possède qu'un bureau de 6 Go.

  • Le problème : Vous ne pouvez pas faire tenir tout le livre sur le bureau.
  • L'ancienne méthode : Les ordinateurs modernes possèdent des « Tensor Cores » (calculateurs spécialisés) et une mémoire rapide pour gérer cela. La carte de 2011 n'a rien de tout cela. C'est comme essayer de faire des mathématiques avancées avec une calculatrice qui ne possède que des touches pour l'addition et la soustraction.

2. La solution : Une course de relais à deux équipes

Puisque l'ensemble du modèle ne tient pas, les chercheurs ont divisé le travail en deux équipes : une Équipe GPU (la vieille carte graphique) et une Équipe CPU (le processeur principal de l'ordinateur).

  • Phase 1 : Le « Prefill » (Lire l'instruction)

    • L'analogie : Imaginez que vous deviez lire une longue liste d'instructions (le prompt) pour commencer.
    • L'astuce : Le GPU agit comme un tapis roulant rapide. Il saisit une petite section des « livres » (les poids du modèle) depuis le disque dur de l'ordinateur principal, les pose sur son petit bureau, effectue le calcul pour ce bloc, puis les échange pour le bloc suivant.
    • Le résultat : Au lieu de lire tout le livre d'un coup, il le lit page par page dans un flux continu. Cela leur a permis de traiter les instructions initiales 34 % plus rapidement qu'auparavant.
  • Phase 2 : Le « Decode » (Écrire l'histoire)

    • L'analogie : Maintenant, l'IA doit écrire l'histoire un mot à la fois.
    • Le problème : Si le GPU essayait de faire cela, il devrait courir faire des allers-retours vers le disque dur pour chaque mot. C'est comme un coureur sprintant vers la bibliothèque, saisissant un livre, revenant courir, écrivant un mot, et répétant l'opération. C'est trop lent.
    • L'astuce : Ils ont déplacé cette partie vers le cerveau de l'ordinateur principal (le CPU). Ils ont écrit un code personnalisé, ultra-efficace et « fait main », qui traite les nombres comme de simples entiers au lieu de décimales complexes.
    • Le résultat : Cela a permis à l'IA d'écrire les mots 3 fois plus vite qu'auparavant, transformant un pas de tortue en un jogging régulier.

3. Les raccourcis « magiques »

Les chercheurs n'ont pas seulement divisé le travail ; ils ont inventé des raccourcis ingénieux pour donner l'impression au vieux matériel qu'il est neuf.

  • Le cache de « Instantané » (Snapshot Cache) :

    • Le problème : L'IA possède une « mémoire » qui change à mesure qu'elle lit. Habituellement, on ne peut pas réutiliser le travail précédent car l'état de la mémoire est différent.
    • La solution : Ils ont pris des « instantanés » de la mémoire de l'IA à des points de contrôle spécifiques. Si vous demandez à l'IA de répéter une histoire qu'elle a déjà entendue, elle ne relit pas tout. Elle saute directement au dernier instantané sauvegardé.
    • Le résultat : Répéter un long prompt est passé de 78 secondes à seulement 0,5 seconde. C'est comme sauter directement à la fin d'un film que vous avez déjà vu au lieu de le regarder à nouveau.
  • La mémoire « Épinglée » (Pinned Memory) :

    • L'analogie : Normalement, déplacer des données du disque dur vers le GPU est comme déplacer des boîtes avec un chariot élévateur instable.
    • La solution : Ils ont « verrouillé » les boîtes en place (mémoire épinglée) pour que le chariot puisse les déplacer de manière fluide sans vaciller. Cela a réduit de moitié le temps passé à déplacer les données.

4. Ce qui n'a pas fonctionné (Les « impasses »)

Une partie du document concerne ce qui a échoué, ce qui est tout aussi important. Cela nous indique où se trouve le mur.

  • Utiliser le GPU pour l'écriture : Ils ont essayé de faire écrire les mots par le GPU, mais la vieille carte était trop lente pour déplacer les données d'avant en arrière. Elle était en fait plus lente que le CPU.
  • Utiliser tous les threads de l'ordinateur : Ils ont essayé d'utiliser tous les fils de traitement disponibles (comme embaucher 24 ouvriers au lieu de 12). Cela a provoqué un embouteillage, ralentissant massivement les choses.
  • Réécrire les calculs mathématiques : Ils ont essayé de réécrire les noyaux mathématiques (kernels) de trois manières différentes, mais le vieux matériel ne pouvait tout simplement pas gérer le type de mathématiques requis.

L'essentiel

Ce document ne cherche pas à battre un record de vitesse. C'est une preuve de concept qui dit : « Vous n'avez pas besoin d'un supercalculateur à 20 000 $ pour faire fonctionner une IA de 35 milliards de paramètres. »

En traitant le vieux matériel comme un puzzle et en construisant un moteur personnalisé à partir de zéro (en écrivant du code à la main pour une architecture informatique abandonnée par les développagers il y a 14 ans), ils ont prouvé que l'IA moderne peut fonctionner sur du matériel « de rebut » si l'on est assez ingénieux dans l'ingénierie.

En bref : Ils ont pris un moteur de Ferrari (le modèle d'IA) et l'ont fait fonctionner sur un cadre de bicyclette des années 1990 (le GPU de 2011) en construisant une transmission sur mesure et en changeant le type de carburant, prouvant qu'avec assez d'ingéniosité, on peut aller étonnamment loin avec de la vieille technologie.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →