← Derniers articles
🤖 AI

When Good Enough Is Optimal: Multiplication-Only Matrix Inversion Approximation for Quantized Gated DeltaNet

Ce document propose une approximation d'inversion de matrice par multiplication uniquement, adaptée au matériel, utilisant une expansion de Neumann tronquée avec masquage structurel et correction de résidu parallèle pour accélérer l'attention linéaire par blocs dans les modèles Gated DeltaNet quantifiés, atteignant jusqu'à 5× de gain de vitesse et 20 % de surcharge de couche de décodage en moins tout en préservant la précision.

Auteurs originaux : Luoming Zhang, Yuwei Ren, Kui Zhang, Tian Liu, Lingjuan Ge, Denghao Li, Matthew Harper Langston, Yin Huang, Weiliang Will Zeng, Liang Zhang

Publié 2026-06-05
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Luoming Zhang, Yuwei Ren, Kui Zhang, Tian Liu, Lingjuan Ge, Denghao Li, Matthew Harper Langston, Yin Huang, Weiliang Will Zeng, Liang Zhang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de résoudre un puzzle massif et complexe où chaque pièce dépend de la précédente. Dans le monde de l'intelligence artificielle, plus précisément pour les modèles qui doivent se souvenir de longues conversations ou d'histoires (appelés « modèles à contexte long »), il existe une étape spécifique appelée inversion de matrice qui agit comme un embouteillage.

Actuellement, résoudre ce puzzle pièce par pièce est lent et inefficace, en particulier sur les puces spécialisées (NPU) que l'on trouve dans les téléphones et les appareils modernes. C'est comme essayer de remplir une piscine en transportant de l'eau avec une seule tasse, une tasse à la fois, alors que la piscine est immense.

Ce document présente une nouvelle façon beaucoup plus rapide de résoudre ce puzzle. Voici la décomposition de leur solution à l'aide d'analogies simples :

1. Le Problème : L'embouteillage de la « Substitution Progressive »

Dans les méthodes standards, l'ordinateur doit calculer la réponse pour la pièce n°1, puis utiliser celle-ci pour trouver la pièce n°2, puis la pièce n°3, et ainsi de suite. C'est ce qu'on appelle la « substitution progressive » (forward substitution).

  • L'analogie : Imaginez une file de personnes attendant d'obtenir un tampon. La première personne reçoit le tampon, puis la deuxième ne peut obtenir le sien tant que la première n'a pas terminé, et ainsi de suite. La file avance lentement parce que tout le monde attend la personne devant soi.
  • Le résultat : Sur le matériel moderne, cette « file » est très inefficace. Les moteurs puissants (unités de traitement matriciel) restent inactifs, attendant que les étapes séquentielles lentes se terminent.

2. L'Intuition : « Assez bien » est en réalité parfait

Les auteurs ont réalisé que pour obtenir un excellent résultat, vous n'avez pas réellement besoin de résoudre l'intégralité du puzzle parfaitement.

  • L'analogie : Imaginez que vous peignez un portrait. Les détails les plus importants se trouvent au centre du visage (la diagonale principale). Les détails dans les coins lointains (les sous-diagonales profondes) sont si légers qu'on peut à peine les voir. Si vous passez 90 % de votre temps à perfectionner le centre et juste un coup d'œil rapide aux coins, le tableau paraîtra tout aussi bon à l'œil humain, mais vous aurez fini 10 fois plus vite.
  • La science : Le document montre que l'« énergie » ou l'importance de la réponse est concentrée près du centre. Les parties complexes et difficiles à calculer, situées plus loin, contribuent très peu au résultat final.

3. La Solution : Le raccourci de la « Multiplication Uniquement »

Au lieu de la méthode lente, pièce par pièce, les auteurs proposent un nouvel algorithme qui repose entièrement sur la Multiplication de Matrices (effectuer de nombreux calculs en même temps).

Ils utilisent un tour en trois étapes :

  • Étape A : L'esquisse grossière (Série de Neumann tronquée)
    Au lieu de calculer toute la série infinie d'étapes, ils s'arrêtent plus tôt. Ils calculent les premières « couches » de la réponse.

    • Analogie : Au lieu de lire chaque page d'un livre de 1 000 pages pour comprendre l'intrigue, vous lisez les 10 premières pages. Vous obtenez l'idée principale immédiatement.
  • Étape B : Le filet de sécurité (Masquage diagonal)
    Lorsque vous vous arrêtez plus tôt, vous pourriez accidentellement inclure du « bruit » ou des nombres étranges qui sont trop grands et pourraient faire planter le système (comme une erreur de dépassement/overflow).

    • Analogie : Imaginez que vous dessinez une carte. Vous tracez les routes principales clairement, mais vous griffonnez accidentellement des lignes sauvages et insensées dans les champs vides. Les auteurs placent un « masque » sur ces gribouillis sauvages et les effacent, ne gardant que les routes propres et importantes. Cela empêche les nombres de devenir trop grands et de briser les calculs.
  • Étape C : La correction rapide (Correction résiduelle parallèle)
    Parce qu'ils se sont arrêtés plus tôt, l'esquisse n'est pas parfaite. Il reste de petites erreurs. Au lieu de les corriger une par une (ce qui est lent), ils les corrigent toutes en même temps en utilisant un calcul parallèle.

    • Analogie : Imaginez que vous avez un brouillon de document avec quelques fautes de frappe. Au lieu de lire ligne par ligne pour les corriger, vous lancez un outil « Rechercher et Remplacer » qui corrige toutes les fautes simultanément en une fraction de seconde.

4. Les Résultats : Vitesse et Stabilité

Le document a testé cette méthode sur de vrais modèles d'IA (famille Qwen3.5) et a constaté :

  • Vitesse : La nouvelle méthode est 5 fois plus rapide au niveau du calcul central.
  • Efficacité : Elle réduit le temps total de décodage (génération de texte) d'environ 20 %.
  • Précision : Malgré les raccourcis, les réponses de l'IA restent tout aussi précises que la méthode lente et parfaite. Cela fonctionne même lorsque les nombres sont réduits pour gagner de l'espace (basse précision/quantification), ce qui est crucial pour faire fonctionner l'IA sur les appareils mobiles.

Résumé

Le document soutient que dans l'IA, la perfection est l'ennemie de la vitesse. En réalisant que nous n'avons besoin que de la « diagonale principale » du calcul pour qu'elle soit parfaite, et que nous pouvons corriger le reste en parallèle, ils ont transformé un goulot d'étranglement séquentiel lent en une autoroute parallèle rapide. Cela permet aux grands modèles d'IA de fonctionner beaucoup plus rapidement sur les puces situées à l'intérieur de nos téléphones et de nos appareils de bord sans perdre leur intelligence.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →