← Derniers articles
🤖 machine learning

Efficient On-Device Diffusion LLM Inference with Mobile NPU

Ce document présente llada.cpp, le premier cadre d'inférence conscient des NPU qui accélère les LLM de diffusion sur l'appareil en employant un décodage spéculatif multi-blocs, une révision progressive à double voie et un runtime de mémoire optimisé pour l'échange afin de surmonter les limitations du matériel mobile et d'atteindre jusqu'à 42 fois une réduction de latence par rapport aux références CPU.

Auteurs originaux : Tuowei Wang, Yanfan Sun, Ju Ren

Publié 2026-06-15
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Tuowei Wang, Yanfan Sun, Ju Ren

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que votre smartphone est une cuisine très occupée, et que le chef (l'IA) essaie d'écrire une histoire.

Le Problème : Le Chef lent, un mot à la fois

Traditionnellement, les modèles d'IA (comme ceux de votre téléphone) écrivent des histoires un mot à la fois. C'est comme un chef qui doit hacher un oignon, puis attendre que la cuisinière chauffe, puis hacher une carotte, puis attendre encore. Même si la cuisinière est puissante, le chef est forcé de travailler lentement car il ne peut faire qu'une chose à la fois. Cela rend la génération de textes longs sur un téléphone poussive et épuise la batterie.

La Nouvelle Idée : Le Chef "Diffusion"

Un nouveau type d'IA, appelé Modèle de Langage de Diffusion (dLLM), tente de faire différemment. Au lieu d'écrire un mot à la fois, il commence par une page entière de "bruit" (du charabia aléatoire) et essaie de l'épurer en une phrase réelle d'un seul coup. C'est comme un chef qui jette tout un tas d'ingrédients sur le comptoir et essaie de les arranger en une salade parfaite simultanément.

Cela semble génial car cela utilise bien mieux le "NPU" (Unité de Traitement Neural) de votre téléphone — une puce spécialisée conçue pour les calculs massifs et parallèles. Cependant, il y a un bémol :

  1. Le Problème de la "Poêle Vide" : À mesure que le chef se rapproche de la fin de la salade, il y a de moins en moins d'ingrédients à corriger. Le puissant NPU se retrouve à attendre car il n'y a plus assez de travail à faire, gaspillant ainsi sa vitesse.
  2. Le Problème du "Oups, je change d'avis" : Parfois, le chef dispose un mot, mais réalise ensuite : "Attendez, cela ne s'accorde pas avec la phrase suivante". L'IA doit alors revenir en arrière pour corriger. Faire cela sur le NPU rapide est désordonné et ralentit tout le processus.
  3. Le Problème du "Petit Frigo" : Le "frigo" (mémoire) du NPU est très petit et spécial, là où il garde les ingrédients prêts à être cuisinés. Si la recette est trop grande, le chef doit constamment échanger les ingrédients entrants et sortants de ce petit frigo, ce qui prend beaucoup de temps et gaspille de l'énergie.

La Solution : llada.cpp

Les auteurs ont construit un nouveau système appelé llada.cpp pour résoudre ces trois problèmes. Voyez cela comme un nouvel ensemble de règles de cuisine qui permet au chef d'utiliser efficacement le puissant NPU.

1. Décodage Spéculatif Multi-Blocs : "Jeter un œil à la prochaine recette"

L'Analogie : Imaginez que le chef est en train de finir la salade actuelle (Bloc A), mais que le NPU s'ennuie car il ne reste plus qu'une feuille à hacher. Au lieu d'attendre, le système dit : "Hé, commençons à préparer les ingrédients pour la prochaine salade (Bloc B) dès maintenant, juste au cas où."
Comment ça marche : Même si le bloc actuel n'est pas terminé à 100 %, le système commence discrètement à travailler sur les mots futurs. Cela maintient le puissant NPU occupé et pleinement utilisé, afin qu'il ne reste pas inactif. Si les mots futurs s'avèrent corrects, tant mieux ! Sinon, le système les rejette simplement et continue.

2. Révision Progressive à Double Voie : "La voie rapide vs La voie lente"

L'Analogie : Le NPU est une voiture de Formule 1 : elle est incroyablement rapide mais ne sait pas bien prendre les virages. Le CPU est un SUV fiable et lent : il est excellent pour effectuer de petits ajustements délicats.
Comment ça marche : Quand l'IA est sûre d'un mot, le NPU le conserve. Mais si l'IA hésite et doit "changer d'avis" sur un mot, llada.cpp n'arrête pas la voiture de course rapide qu'est le NPU. Au lieu de cela, il envoie discrètement le travail de "correction" au SUV plus lent et plus flexible (le CPU) en arrière-plan. Le NPU continue de foncer vers l'avant avec les nouveaux mots pendant que le CPU corrige tranquillement les anciens.

3. Runtime de Mémoire Optimisé pour l'Échange : "Le Garde-Manger Organisé"

L'Analogie : Le petit frigo du NPU est si petit que si vous jetez les ingrédients au hasard, vous passerez tout votre temps à ouvrir et fermer la porte pour échanger les éléments.
Comment ça marche : llada.cpp agit comme un gestionnaire de garde-manger ultra-organisé. Il regarde toute la recette à l'avance et détermine exactement quels ingrédients doivent être dans le frigo en ce moment même et lesquels peuvent attendre. Il prépare également le lot suivant d'ingrédients pendant que le chef cuisine, afin que la porte ne reste jamais fermée trop longtemps. Cela élimine le "temps d'attente" causé par le déplacement des données.

Les Résultats

Les auteurs ont testé cela sur de vrais smartphones (comme le OnePlus Ace5 Pro).

  • Vitesse : Ils ont constaté que llada.cpp rendait l'IA 17 à 42 fois plus rapide que l'ancienne méthode sur un téléphone.
  • Qualité : Les histoires écrites étaient aussi bonnes qu'auparavant ; la vitesse n'a pas été obtenue au détriment de la précision.
  • Batterie : Comme le NPU a terminé le travail rapidement et n'a pas eu à rester inactif, le téléphone a consommé moins d'énergie globale.

En résumé, llada.cpp est un gestionnaire intelligent qui apprend au cerveau de l'IA de votre téléphone comment utiliser son cerveau super rapide (le NPU) sans rester coincé dans les embouteillages, rendant l'IA mobile instantanée et réactive.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →