← Derniers articles
🤖 AI

TileMix: Tile-Centric Mixed-Precision Attention for LLM Inference Acceleration

TileMix est un noyau de précision mixte centré sur les tuiles et sans entraînement qui accélère l'inférence des LLM à contexte long en acheminant dynamiquement des tuiles de scores d'attention alignées sur le matériel entre des chemins FP16 et INT8 au sein d'une opération d'attention dense fusionnée, récupérant ainsi la précision perdue par les méthodes uniformes à basse précision tout en améliorant le débit.

Auteurs originaux : Hanzhi Zhang, Qiao Zhang, Qinglei Cao, Heng Fan, Yan Huang, Kewei Sha, Yunhe Feng

Publié 2026-08-19
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Hanzhi Zhang, Qiao Zhang, Qinglei Cao, Heng Fan, Yan Huang, Kewei Sha, Yunhe Feng

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Les grands modèles de langage sont devenus les moteurs d'une nouvelle génération d'intelligence artificielle, capables de résumer des livres entiers, de répondre à des questions complexes issues de documents longs et de tenir des conversations s'étendant sur des milliers de mots. Pour ce faire, ces modèles s'appuient sur un mécanisme appelé l'attention, qui leur permet de pondérer l'importance de chaque mot d'une phrase par rapport à tous les autres mots. Lorsque le texte est court, ce processus est rapide. Mais à mesure que le contexte s'étend pour inclure des chapitres entiers ou des contrats juridiques, le coût computationnel explose. Le modèle doit calculer un score pour chaque paire de mots possible, créant une grille de données massive qui exige des quantités énormes de mémoire et de puissance de traitement. Ce goulot d'étranglement a rendu difficile l'exécution efficace de ces outils puissants sur du matériel standard, en particulier lorsqu'il s'agit de traiter les séquences longues requises pour des tâches du monde réel comme l'analyse juridique ou la revue de dossiers médicaux.

Les chercheurs ont tenté de résoudre ce problème en simplifiant les mathématiques. Une approche courante consiste à abaisser la précision des nombres utilisés par l'ordinateur, en passant de calculs de haute précision à des calculs plus rapides et de moindre précision. C'est comme passer de la mesure des ingrédients avec une balance de laboratoire à l'utilisation d'une cuillère de cuisine ; c'est beaucoup plus rapide, mais si vous le faites pour chaque étape d'une recette complexe, le plat final pourrait avoir un mauvais goût. Une autre approche consiste à sauter entièrement certaines calculs, en ignorant les mots qui semblent peu importants. Bien que cela permette de gagner du temps, cela risque de couper les connexions mêmes dont le modèle a besoin pour comprendre l'histoire. Le défi consistait à trouver un moyen d'utiliser la vitesse des mathématiques de faible précision sans sacrifier la précision de type haute précision, tout en préservant la capacité du modèle à voir l'ensemble du tableau.

Une équipe de chercheurs a introduit une nouvelle méthode appelée TileMix qui s'attaque à ce problème en traitant le processus d'attention non pas comme un bloc de travail unique et uniforme, mais comme une collection de tuiles plus petites et gérables. Imaginez la grille massive des scores de paires de mots comme une grande mosaïque. Au lieu de peindre toute la mosaïque avec un seul type de peinture, TileMix la divise en petites sections carrées alignées sur le matériel. Pour chacune de ces sections, le système prend une décision instantanée : ce groupe spécifique de paires de mots nécessite le calcul lent de haute précision, ou peut-il se contenter du calcul rapide de faible précision ? Cette décision est prise sur la base d'une carte pré-planifiée qui regroupe ces tuiles, permettant à l'ordinateur de basculer entre la haute et la basse précision au sein d'une même opération sans s'arrêter pour réorganiser les données.

Le cœur de cette innovation est un système de routage qui agit comme un contrôleur de trafic pour le processeur de l'ordinateur. Il emballe ces décisions dans un code compact, essentiellement une chaîne de bits qui indique au processeur quel chemin prendre pour chaque tuile. Si une tuile est marquée pour la haute précision, le processeur utilise ses unités mathématiques les plus précises. S'il est marqué pour la basse précision, il bascule vers ses unités les plus rapides et les plus économes en énergie. Crucialement, les deux chemins mettent à jour un état de mémoire partagé qui suit les résultats globaux, garantissant que la sortie finale reste cohérente. Cela permet au système de préserver la pleine connectivité du modèle — ce qui signifie qu'aucune interaction entre les mots n'est jamais ignorée — tout en bénéficiant des avantages de vitesse des mathématiques de faible précision pour les parties du calcul qui peuvent les tolérer.

Dans leurs expériences, les chercheurs ont testé cette méthode sur plusieurs modèles de langage de grande taille populaires, notamment LLaMA, Qwen et Vicuna, utilisant des séquences allant de 16 000 à 64 000 mots. Ils ont comparé leur approche à la méthode standard de haute précision ainsi qu'à une version utilisant la mathématique de faible précision pour tout. Les résultats ont montré que l'utilisation de la mathématique de faible précision pour l'ensemble du calcul entraînait souvent une baisse significative de la précision, faisant manquer des détails au modèle ou provoquant des échecs lors des tâches de récupération d'informations. Cependant, TileMix a été capable de récupérer la majeure partie de cette qualité perdue. En routant soigneusement uniquement des groupes spécifiques de tuiles vers le chemin de haute précision, le système a maintenu des niveaux de précision très proches de la référence complète de haute précision, tout en atteignant simultanément des vitesses de traitement beaucoup plus rapides.

L'étude a également exploré différents schémas pour décider quelles tuiles devraient recevoir le traitement de haute précision. Ils ont constaté que l'agencement importait ; certains schémas, qui maintenaient les calculs de haute précision dans des régions spatiales spécifiques de la grille de mots, fonctionnaient mieux que d'autres selon la tâche. Par exemple, certaines configurations qui préservaient la haute précision pour les interactions locales entre les mots performaient mieux sur les tâches de rappel factuel, tandis que d'autres étaient plus robustes pour la réponse aux questions générales. Les chercheurs ont démontré que cette méthode pouvait être appliquée sans réentraîner les modèles, ce qui signifie qu'elle peut être déployée immédiatement sur les systèmes existants. Ils ont également montré que l'approche fonctionne bien avec des lots de longueurs variables et différentes architectures de modèles, suggérant qu'il s'agit d'un outil flexible pour améliorer l'efficacité.

En fin de compte, TileMix offre un équilibre contrôlable entre vitesse et précision. Cela suggère que l'avenir du traitement efficace de contextes longs ne nécessite pas de choisir entre être rapide ou être intelligent. Au contraire, en mélangeant intelligemment les deux, les systèmes peuvent traiter de longs documents à une vitesse qui approche les limites théoriques du matériel, sans les graves pénalités de précision qui accompagnent l'utilisation de la mathématique de faible précision partout. Cette approche offre une voie pratique pour le déploiement des grands modèles de langage dans des scénarios où la vitesse et la précision sont toutes deux critiques, comme l'analyse en temps réel de jeux de données massifs ou les outils interactifs qui doivent comprendre instantanément des contextes longs et complexes.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →