← Derniers articles
💻 computer science

AHASD: Asynchronous Heterogeneous Architecture for LLM Adaptive Drafting Speculative Decoding on Mobile Devices

Cet article présente AHASD, une architecture mobile hétérogène asynchrone au niveau des tâches qui exploite la collaboration NPU-PIM avec des mécanismes de contrôle novateurs pour atteindre jusqu'à 4,2 fois le débit et 5,6 fois l'amélioration de l'efficacité énergétique du décodage spéculatif dans les grands modèles de langage par rapport aux références existantes.

Auteurs originaux : Ma zirui, Fan Zhihua, Li Wenxing, Wu Haibin, Zhang Fulin, Ye Xiaochun, Li Wenming

Publié 2026-04-29
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Ma zirui, Fan Zhihua, Li Wenxing, Wu Haibin, Zhang Fulin, Ye Xiaochun, Li Wenming

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayiez d'écrire une longue histoire, mais que vous ayez une règle stricte : vous devez demander à un éditeur très sage, lent et coûteux (le Modèle Cible) de vérifier chaque mot que vous écrivez avant de pouvoir écrire le suivant. Cela rend l'écriture incroyablement lente.

Pour accélérer les choses, vous engagez un assistant rapide et énergique (le Modèle Brouillon) pour deviner les quelques mots suivants à votre place. Vous notez ces suppositions, puis l'éditeur sage les vérifie tous en une seule fois. Si les suppositions sont bonnes, vous les conservez et vous continuez. Si elles sont mauvaises, vous les jetez et vous recommencez. Cela s'appelle le Décodage Spéculatif.

Cependant, sur un téléphone mobile, ce processus présente deux gros problèmes :

  1. Le "Jeu de l'Attente" : Parfois, l'assistant devine 2 mots, parfois 20. Si l'assistant est lent, l'éditeur reste inactif en attendant. Si l'assistant est rapide, l'éditeur reste inactif en attendant le prochain lot. Ils se tiennent constamment la main, attendant que l'autre termine, ce qui gaspille du temps.
  2. Le Problème de la "Mauvaise Supposition" : Parfois, l'assistant devient trop confiant et devine un paragraphe entier de non-sens parce que le contexte est délicat. L'éditeur doit tout rejeter, gaspillant toute l'énergie que l'assistant a dépensée à deviner.

L'article présente AHASD, un nouveau système conçu pour résoudre ces problèmes sur les téléphones mobiles en utilisant un type spécial de puce informatique appelé PIM (Traitement dans la Mémoire) et une puce IA standard appelée NPU.

Voici comment fonctionne AHASD, en utilisant des analogies simples :

1. La "Danse Désynchronisée" (Exécution Asynchrone au Niveau des Tâches)

Dans les anciens systèmes, l'assistant et l'éditeur devaient danser parfaitement à l'unisson. Si l'assistant s'arrêtait, l'éditeur s'arrêtait.
AHASD brise la chaîne. Il permet à l'assistant (fonctionnant sur la puce mémoire, PIM) et à l'éditeur (fonctionnant sur le processeur, NPU) de travailler indépendamment.

  • L'Analogie : Imaginez une chaîne de montage dans une usine. Au lieu que l'ouvrier attende que la machine termine avant de commencer l'étape suivante, l'ouvrier continue de prendre de nouvelles pièces dans un bac (la file d'attente) et de travailler dessus pendant que la machine traite encore le lot précédent. Ils n'attendent pas l'un l'autre ; ils maintiennent simplement la chaîne en mouvement. Cela élimine les "temps d'arrêt" où un appareil reste assis à ne rien faire.

2. Le "Radar de Confiance" (Rédaction Consciente de l'Histoire et de l'Entropie)

L'assistant devient parfois trop confiant et commence à deviner de manière folle alors qu'il devrait être prudent.
AHASD donne à l'assistant un "Radar de Confiance". Il examine l'historique de ses récentes suppositions.

  • L'Analogie : Pensez à un prévisionniste météo. S'il s'est trompé sur la pluie pendant les trois derniers jours, il arrête de prédire de la pluie pour le lendemain, même si les nuages semblent similaires. De même, si les suppositions de l'assistant ont une faible "confiance" (entropie élevée), le système lui dit : "Arrête de deviner à l'avance ! Attends que l'éditeur confirme le mot actuel avant de deviner le suivant." Cela empêche l'assistant de gaspiller de l'énergie sur des suppositions qui seront certainement jetées.

3. Le "Minuteur Intelligent" (Pré-vérification Consciente du Temps)

Parfois, l'assistant termine son travail, mais l'éditeur est encore occupé. L'assistant pourrait commencer à deviner à nouveau, mais s'il devine trop, l'éditeur pourrait manquer de travail à vérifier et rester inactif.
AHASD utilise un "Minuteur Intelligent" pour décider exactement quand l'assistant devrait faire une pause et effectuer un rapide "mini-contrôle" (pré-vérification) de son côté.

  • L'Analogie : Imaginez un chef (l'assistant) qui hache des légumes pendant qu'un sous-chef (l'éditeur) prépare une sauce. Le chef sait exactement combien de temps la sauce prendra. Si le chef voit que la sauce sera prête dans 5 secondes, il arrête de hacher et fait un rapide test de goût (pré-vérification) sur les légumes pour s'assurer qu'ils sont prêts. Cela garantit que le sous-chef a des légumes frais prêts au moment où la sauce est terminée, de sorte que le sous-chef n'ait jamais à rester debout en attendant.

Les Résultats

Les auteurs ont construit une simulation de ce système sur une puce de téléphone mobile. Ils ont constaté que :

  • Vitesse : Il est jusqu'à 4,2 fois plus rapide que l'utilisation d'une simple carte graphique (GPU) standard et 1,5 fois plus rapide que les tentatives précédentes de mélange de puces mobiles avec le traitement mémoire.
  • Autonomie de la Batterie : Il est jusqu'à 5,6 fois plus économe en énergie qu'un GPU standard et 1,24 fois meilleur que le meilleur système mobile précédent.
  • Coût : Toutes ces nouvelles fonctionnalités sophistiquées ne prennent que environ 3 % de l'espace supplémentaire sur la puce mémoire, ce qui est un prix très faible à payer pour un tel boost de vitesse.

En bref, AHASD est comme donner à l'IA de votre téléphone une équipe de travailleurs qui arrêtent de s'attendre les uns les autres, vérifient leur propre confiance avant de deviner, et synchronisent parfaitement leurs pauses pour maintenir le flux de travail sans gaspiller l'énergie de la batterie.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →