Faster Than Flash: Exploiting Attention Sparsity for Efficient Long-Context Decoding
Faster Flash Decoding (FFD) est un cadre de co-conception matériel-algorithme sans entraînement qui atteint une accélération au niveau du noyau allant jusqu'à 11,6x et s'étend à des longueurs de contexte de 256K en fusionnant la sélection et le calcul en un seul noyau et en employant une stratégie top-delta pour une parcimonie adaptative à la distribution, tout en maintenant la précision du modèle.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Dans le monde de l'intelligence artificielle, les programmes informatiques modernes connus sous le nom de grands modèles de langage sont devenus remarquablement habiles à comprendre et à générer le langage humain. Ces systèmes fonctionnent en prédisant le mot suivant dans une phrase, un jeton à la fois, en construisant une réponse cohérente étape par étape. Cependant, à mesure que ces modèles deviennent plus capables, ils sont confrontés à un obstacle physique important lorsqu'on leur demande de traiter des documents ou des conversations très longs. Plus le modèle a besoin de se souvenir de contexte, plus il doit déplacer de données entre sa mémoire interne rapide et son stockage principal. Ce mouvement constant de données crée un goulot d'étranglement, semblable à une tentative de remplir une piscine avec un tuyau d'arrosage alors que le drain est largement ouvert. L'ordinateur passe la majeure partie de son temps à attendre que l'information arrive plutôt qu'à réellement réfléchir, ce qui ralentit l'ensemble du processus et limite la quantité de texte qu'un modèle peut traiter à la fois.
Pour résoudre ce problème, des chercheurs de l'Université de Fudan et de l'Institut d'Innovation de Shanghai ont développé une nouvelle méthode appelée Faster Flash Decoding. Leur approche s'attaque au problème en modifiant la manière dont le modèle décide quelles parties de l'information conserver et lesquelles ignorer. Au lieu d'essayer de lire chaque mot d'un document massif pour trouver les plus pertinents, le nouveau système utilise un raccourci ingénieux. Il crée d'abord une esquisse minuscule et compressée de tout l'historique de la conversation. Cette esquisse est si petite que l'ordinateur peut l'analyser presque instantanément. En examinant cette esquisse, le système peut identifier rapidement quelles parties de l'historique sont susceptibles d'être importantes et lesquelles peuvent être ignorées en toute sécurité. Ce n'est qu'après ce balayage rapide que le modèle récupère la version complète et détaillée des parties sélectionnées pour effectuer le calcul final. Ce processus en deux étapes permet au modèle de sauter de vastes quantités de données non pertinentes sans perdre la capacité de comprendre le sens profond du texte.
Les chercheurs ont testé cette méthode sur des cartes graphiques puissantes, de celles utilisées pour le jeu vidéo haut de gamme et le calcul scientifique, et ont constaté qu'elle était considérablement plus rapide que les techniques standards actuelles. Lors du traitement d'un contexte de 256 000 jetons, le nouveau système a réduit le temps nécessaire pour générer un seul jeton de plus d'une milliseconde à une simple fraction de celle-ci. En termes de vitesse globale, le système a généré du texte jusqu'à 2,37 fois plus vite que les méthodes précédentes tout en maintenant le même niveau de précision. L'équipe a vérifié cette performance à travers un large éventail de tâches, incluant le raisonnement complexe et la récupération de faits spécifiques dans de longs documents, confirmant que les gains de vitesse ne se faisaient pas au détriment de l'intelligence. Le système fonctionne sans nécessiter de réentraînement du modèle, ce qui signifie qu'il peut être intégré immédiatement aux systèmes d'intelligence artificielle existants pour améliorer leur efficacité.
Une innovation clé de ce travail est la manière spécifique dont le système filtre l'information. Les méthodes traditionnelles reposent souvent sur des règles fixes, comme ne conserver que les dix mots les plus importants, ou sur des calculs complexes qui exigent que l'ensemble du système s'arrête et se synchronise avant de poursuivre. La nouvelle méthode utilise un seuil dynamique qui s'adapte au flux naturel de la conversation. Elle recherche des mots qui sont significativement importants par rapport au mot le plus important dans le contexte actuel, ce qui lui permet d'ajuster la quantité de données conservées en fonction de la concentration de l'attention. Cette flexibilité, combinée à l'utilisation de données de très basse précision pour le balayage initial, permet à l'ordinateur de contourner le goulot d'étranglement de la mémoire qui freine depuis longtemps le traitement de contextes longs. Le résultat est un système capable de gérer de vastes quantités de texte avec une vitesse que l'on pensait auparavant impossible sans sacrifier la qualité des réponses fournies.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.