Deltoris: Enabling Real-time VLA Inference in Embodied AI via Bit-level Sparsity and Speculative Inference
Deltoris est un cadre de co-conception algorithme-matériel qui permet une inférence en temps réel et économe en énergie pour les modèles de vision-langage-action basés sur la diffusion sur les appareils de bord en exploitant la parcimonie de bits sensible au temps, l'inférence spéculative et un accélérateur systolique bit-sériel personnalisé afin d'obtenir des accélérations significatives par rapport aux solutions existantes.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez un robot essayant d'apprendre à jouer au jeu du lancer de balle. Pour y parvenir, il a besoin d'un cerveau capable de voir la balle, de comprendre les règles et de décider exactement comment bouger son bras. Dans le monde de la robotique, ce « cerveau » est souvent un programme informatique spécial appelé modèle Vision-Langage-Action (VLA). Considérez cela comme un traducteur super intelligent qui transforme ce que le robot voit et entend en mouvements physiques. Pendant longtemps, ces robots étaient un peu lents et maladroits car les mathématiques requises pour les faire bouger étaient incroyablement lourdes, comme essayer de courir un marathon en portant un sac à dos rempli de briques.
Récemment, des scientifiques ont découvert une nouvelle façon d'enseigner le mouvement aux robots appelée « diffusion ». Imaginez un robot apprenant à marcher en titubant d'abord dans une pièce embrumée, puis en dissipant lentement le brouillard étape par étape jusqu'à trouver le chemin parfait. Cette méthode permet aux robots de bouger de manière beaucoup plus fluide et de mieux gérer les nouvelles situations qu'auparavant. Cependant, il y a un hic : ce processus de « dissipation du brouillard » est si lourd en termes de calcul qu'il est trop lent pour une utilisation en temps réel. Un robot doit prendre des décisions de 50 à 200 fois par seconde pour rester équilibré et en sécurité, mais ces nouveaux modèles prenaient trop de temps, comme un escargot essayant de gagner une course contre un guépard. C'est le problème qu'une équipe de chercheurs a entrepris de résoudre : comment rendre ces robots super intelligents et fluides assez rapides pour suivre le rythme du monde réel ?
Voici Deltoris, un nouveau système ingénieux conçu pour accélérer ces cerveaux de robots sans les rendre moins intelligents. Les chercheurs ont réalisé que les robots ne vivent pas dans un monde où tout change instantanément. Si un robot tend la main vers une tasse, la vue de la tasse d'un millième de seconde à l'autre est presque exactement la même. C'est comme regarder un film où 98 % des images sont identiques ; vous n'avez pas besoin de redessiner toute l'image à chaque fois, vous devez juste dessiner la petite partie qui a changé.
Deltoris tire profit de cette observation grâce à une technique appelée parcimonie au niveau du bit temporellement consciente (temporal-aware bit-level sparsity). Au lieu de recalculer l'intégralité du problème mathématique pour chaque mouvement, le système calcule uniquement la différence entre le moment actuel et le précédent. C'est comme envoyer un SMS qui dit seulement « J'ai levé la main de 5 cm » au lieu de réécrire toute votre biographie à chaque fois que vous bougez. Cela permet de sauter une quantité massive de travail inutile, réduisant les calculs de plus de 90 %.
Cependant, il y avait un obstacle. En envoyant uniquement la « différence », le système devait constamment récupérer les anciennes informations de la mémoire pour les comparer aux nouvelles, ce qui créait un embouteillage dans le pipeline de données. Pour correr cela, l'équipe a ajouté un second tour de force appelé inférence spéculative. Imaginez un entraîneur qui a un petit assistant rapide pour prédire les prochaines actions du match, puis un grand entraîneur lent et super intelligent qui vérifie ces prédictions toutes ensemble en groupe. Cela permet de charger les données lourdes une seule fois et de les utiliser pour vérifier plusieurs étapes, lissant ainsi l'embouteillage.
Pour que toute cette magie opère, les chercheurs n'ont pas seulement écrit un logiciel ; ils ont construit une puce matérielle personnalisée (un accélérateur) spécifiquement conçue pour gérer ces calculs de « différence ». Ils ont créé une chaîne de montage spéciale de minuscules processeurs qui travaillent parfaitement ensemble, garantissant que personne ne reste inactif en attendant les données.
Les résultats de leurs expériences sont impressionnants. Lorsqu'ils ont testé Deltoris contre des puces informatiques mobiles standards (comme celles des téléphones haut de gamme) et d'autres puces spécialisées pour la robotique, ce fut une victoire écrasante. Deltoris était jusqu'à 34,2 fois plus rapide que les GPU mobiles et 6,1 fois plus rapide que les précédents accélérateurs spécialisés. Peut-être plus important encore, il consommait jusqu'à 822 fois moins d'énergie, ce qui est crucial pour les robots alimentés par batterie. L'équipe a également vérifié que le robot ne se laissait pas confondre par ces raccourcis ; la précision restait presque exactement la même, avec seulement une baisse de performance infime et négligeable.
En résumé, Deltoris montre qu'en étant intelligent sur ce que nous calculons (seulement les changements) et sur comment nous le calculons (en regroupant les prédictions), nous pouvons enfin donner à l'IA incarnée la vitesse et l'efficacité dont elle a besoin pour se déplacer dans notre monde en temps réel. C'est une étape significative vers des robots qui peuvent non seulement penser, mais aussi agir aussi vite que nous.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.