← Derniers articles
🤖 machine learning

Llamas on the Web: Memory-Efficient, Performance-Portable, and Multi-Precision LLM Inference with WebGPU

Ce document présente LlamaWeb, un backend WebGPU pour llama.cpp qui réalise une inférence de LLM économe en mémoire, portable en performance et multi-précision dans les navigateurs en exploitant une planification statique de la mémoire, une bibliothèque de noyaux ajustable et des noyaux GPU paramétrables, ce qui se traduit par une réduction significative de l'utilisation de la mémoire et une augmentation du débit de décodage par rapport aux frameworks existants sur des matériels divers.

Auteurs originaux : Reese Levine, Rithik Sharma, Nikhil Jain, Abhijit Ramesh, Zheyuan Chen, Neha Abbas, James Contini, Tyler Sorensen

Publié 2026-05-21
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Reese Levine, Rithik Sharma, Nikhil Jain, Abhijit Ramesh, Zheyuan Chen, Neha Abbas, James Contini, Tyler Sorensen

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous souhaitiez exécuter un assistant IA ultra-intelligent (un grand modèle de langage, ou LLM) directement dans votre navigateur web, comme Chrome ou Safari. Habituellement, ces cerveaux d'IA sont si vastes et voraces en mémoire qu'ils nécessitent d'énormes serveurs coûteux pour fonctionner. L'objectif de cet article est de rétrécir ce cerveau géant afin qu'il puisse tenir dans votre ordinateur portable ou votre téléphone sans faire planter votre navigateur, tout en maintenant sa rapidité et sa confidentialité.

Les auteurs ont créé un nouvel outil appelé LlamaWeb. Imaginez-le comme un « traducteur » spécialisé permettant au moteur d'IA populaire llama.cpp de parler le langage des navigateurs web (spécifiquement une technologie appelée WebGPU).

Voici comment ils ont résolu les trois plus grands problèmes, en utilisant des analogies du quotidien :

1. Le problème de la mémoire : « Le camion de déménagement vs la liste de colis »

Le problème : Les outils d'IA existants pour navigateurs ressemblaient à une entreprise de déménagement chaotique. Ils continuaient à saisir de nouvelles boîtes (mémoire) au fur et à mesure, parfois en en prenant trop, ce qui provoquait le crash du navigateur ou le ralentissait jusqu'à l'arrêt. Ils effectuaient également des copies inutiles des meubles (poids du modèle) avant de les déplacer.

La solution LlamaWeb :

  • Planification statique : Au lieu de saisir des boîtes au fil de l'eau, LlamaWeb examine toute la maison avant l'arrivée du camion et calcule exactement le nombre de boîtes nécessaires. Il emballe tout dans une seule « arène mémoire » pré-dimensionnée dès le début. Plus de saisie de boîtes supplémentaires en cours de déménagement.
  • Chargement direct : Au lieu de décharger les meubles dans l'allée (mémoire CPU) puis de les charger dans le camion (mémoire GPU), LlamaWeb charge les meubles directement depuis l'entrepôt dans le camion.
  • Le résultat : Ils ont constaté que LlamaWeb utilise 29 à 33 % de mémoire en moins que ses concurrents. C'est comme réussir à faire tenir tout un salon dans une fourgonnette qui ne pouvait auparavant contenir qu'un canapé.

2. Le problème de la performance : « La télécommande universelle vs la télécommande personnalisée »

Le problème : Internet regorge d'ordinateurs différents : certains possèdent des cartes graphiques NVIDIA, d'autres des puces Apple, certains sont dans des téléphones et d'autres dans des ordinateurs portables. Les outils existants ressemblaient à une « télécommande universelle » qui tentait de fonctionner sur tout mais n'utilisait pas les boutons spéciaux d'aucune télévision spécifique, entraînant des performances lentes.

La solution LlamaWeb :

  • Kernels ajustables : LlamaWeb est comme une télécommande intelligente capable de se reprogrammer elle-même. Au démarrage, elle vérifie sur quel type de « télévision » (matériel) elle s'exécute. Si elle est sur une carte NVIDIA puissante, elle utilise des fonctionnalités « sous-groupes » haute vitesse. Si elle est sur un téléphone, elle passe en un mode plus efficace.
  • Le résultat : Sur quatre types différents de cartes graphiques, LlamaWeb était 45 à 69 % plus rapide pour générer du texte (décodage) que les autres outils de navigateur. Ce n'est pas seulement une télécommande universelle ; c'est une télécommande qui sait exactement comment obtenir la meilleure image de votre télévision spécifique.

3. Le problème du format : « Le couteau suisse »

Le problème : Les développeurs d'IA inventent constamment de nouvelles façons de compresser les modèles d'IA (appelées « quantification ») pour les rendre plus petits. Certaines sont de type 4 bits, d'autres 8 bits, d'autres 1 bit. Les anciens outils ressemblaient à un tournevis qui ne s'adaptait qu'à un seul type de vis. Si une nouvelle vis apparaissait, l'outil devenait inutile.

La solution LlamaWeb :

  • Kernels modélisés : LlamaWeb est construit comme un couteau suisse. Il dispose d'un système de « modèle » capable d'échanger instantanément la tête de l'outil pour s'adapter à n'importe quelle vis (format de quantification) sans avoir besoin de reconstruire tout le couteau.
  • Le résultat : Il prend en charge 23 formats de poids différents, alors que les concurrents n'en prenaient en charge que 6 ou 7. Cela signifie que si un développeur invente demain une nouvelle méthode de compression ultra-efficace, LlamaWeb pourra probablement l'exécuter immédiatement sans nécessiter de mise à jour logicielle.

Les résultats globaux

L'équipe a testé cela sur 16 appareils différents provenant de 8 fabricants différents (y compris NVIDIA, Apple, Intel, AMD et des puces mobiles).

  • Mémoire : Il a économisé une quantité massive de RAM, empêchant les plantages sur des appareils à mémoire limitée (comme les iPhone).
  • Vitesse : Il était nettement plus rapide que les autres outils d'IA basés sur navigateur.
  • Polyvalence : Il peut exécuter presque n'importe quel modèle pris en charge par la communauté llama.cpp, qui est une vaste bibliothèque de plus de 177 000 modèles.

Une réserve : Bien que LlamaWeb soit un champion pour générer du texte mot par mot (phase de « décodage »), il est actuellement un peu plus lent pour lire l'invite initiale (phase de « préremplissage ») par rapport à certains concurrents. Cependant, les auteurs notent que, à mesure que la technologie des navigateurs s'améliorera, cet écart devrait se combler.

En résumé, LlamaWeb est un nouveau moteur qui rend possible, privé et efficace l'exécution d'une IA puissante dans votre navigateur, garantissant que votre ordinateur ne fond pas pendant que vous discutez avec une IA.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →