CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention
CoSA est un cadre d'attention parcimonieuse à deux étapes et sans entraînement qui couple un proxy sensible au noyau (Kernel-Aware Proxy) avec un noyau de saut ordonné (Ordered-Skipping Kernel) pour optimiser dynamiquement la sélection et le saut de blocs, réalisant ainsi des accélérations d'inférence significatives et une latence réduite pour les LLM à contexte long tout en maintenant une précision élevée sous des budgets de calcul serrés.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayiez de lire une encyclopédie massive de 128 000 pages pour répondre à une seule question. Dans le monde de l'intelligence artificielle, ces « encyclopédies » sont appelées Modèles de Langage Étendus (LLM), et le processus de « lecture » est la manière dont ils comprennent le contexte. Le problème est que la méthode standard par laquelle ces modèles lisent est comparable à un bibliothécaire qui insiste pour lire chaque page du livre, du tout premier mot jusqu'au dernier, avant même de pouvoir commencer à réfléchir à votre question. À mesure que le livre s'allonge, cette approche de « tout lire » devient douloureusement lente et coûteuse, comme si l'on essayait de courir un marathon en portant un sac à dos rempli de briques.
Pour corriger cela, les scientifiques ont tenté d'apprendre au bibliothécaire à être un peu plus sélectif, une technique appelée « attention parcimonieuse » (sparse attention). Au lieu de lire chaque page, le modèle essaie de deviner quelles pages sont importantes et saute les autres. Cela implique généralement deux étapes : d'abord, un « proxy » rapide (un devineur rapide) examine le livre et marque les pages importantes avec une liste simple de « Oui » ou de « Non ». Deuxièmement, un « noyau » (le travailleur réel) suit cette liste et effectue le gros du travail. C'est un système décent, mais il présente un défaut : lorsque le livre devient énorme et que vous devez être très strict sur les pages à sauter pour gagner du temps, le devineur rapide commence à faire des erreurs, et le travailleur suit aveuglément la mauvaise liste. Le résultat est que le modèle devient plus rapide mais commence à oublier des détails importants, comme un bibliothécaire qui sauterait le point culminant d'une histoire parce qu'il a pensé que c'était ennuyeux.
C'est ici qu'intervient une nouvelle méthode appelée CoSA (Co-Designed Sparse Attention). Les chercheurs derrière CoSA ont réalisé que le « devineur » et le « travailleur » travaillaient de manière isolée, ce qui faisait que le système s'effondrait sous la pression. Ils ont décidé de repenser tout le processus afin que les deux travaillent ensemble comme une équipe. Au lieu de simplement remettre au travailleur une liste simple de « Oui/Non », le nouveau « devineur » (appelé Kernel-Aware Proxy, ou KAP) lui remet une liste de priorité. Il ne dit pas seulement « lisez cette page » ; il dit : « Lisez cette page en premier, puis celle-ci, puis celle-là. »
Voici le tour de magie : le travailleur (appelé Ordered-Skipping Kernel, ou OSK) utilise cette liste de priorité pour réorganiser l'ordre dans lequel il lit les pages. En lisant les pages les plus critiques en premier, le travailleur construit un « score progressif » de ce qui est important très tôt dans le processus. Parce qu'il connaît les éléments les plus importants dès le début, il peut sauter avec assurance encore plus de pages plus tard dans le processus sans s'embrouiller. C'est comme si vous lisiez un roman policier et que le détective vous disait : « Lisez les trois premiers chapitres pour trouver le tueur, puis vous pourrez sauter en toute sécurité les cinquante chapitres suivants sur les conseils de jardinage. »
L'article montre que cette approche de travail d'équipe change la donne. Testé sur des modèles lisant des contextes aussi longs que 128 000 tokens (environ la taille d'un long roman), CoSA a réussi à accélérer la partie « attention » du processus de 4,93 fois et à réduire le temps nécessaire pour générer le premier mot de 2,53 fois. Crucialement, il a fait cela sans que le modèle ne perde sa capacité à comprendre l'histoire ou à résoudre des problèmes de raisonnement complexes. Les chercheurs ont découvert qu'en laissant le proxy et le noyau communiquer et partager un ordre d'opérations spécifique, ils pouvaient être beaucoup plus agressifs dans le saut de tâches tout en gardant le modèle intelligent. Il s'avère que dans le monde de l'IA, savoir quand lire une page est tout aussi important que de savoir quelle page lire.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.