← Derniers articles
🤖 AI

JoyNexus: Service-Oriented Multi-Tenant Post-Training for VLA Models

JoyNexus est un service unifié et multi-locataire pour les modèles de vision-langage-action (VLA) post-entraînement qui découple les composants d'entraînement, d'inférence et d'environnement afin de permettre le partage efficace des ressources, l'ordonnancement inter-locataires et le traitement par lots de groupe, réduisant ainsi le temps GPU global et améliorant l'utilisation par rapport à l'exécution traditionnelle isolée à locataire unique.

Auteurs originaux : Haoran Sun, Wentao Zhang, Junyang Hua, Hedan Yang, Yongjian Guo, Yifei Zhang, Xiaolong Xiang, Mingxi Luo, Jing Long, Chen Zhao, Chen Zhou, Wanting Xu, Qiming Yang, Hui Zhang, Song Wang, Xiaodong Bai
Publié 2026-07-20
📖 8 min de lecture🧠 Analyse approfondie

Auteurs originaux : Haoran Sun, Wentao Zhang, Junyang Hua, Hedan Yang, Yongjian Guo, Yifei Zhang, Xiaolong Xiang, Mingxi Luo, Jing Long, Chen Zhao, Chen Zhou, Wanting Xu, Qiming Yang, Hui Zhang, Song Wang, Xiaodong Bai, Shuai Di, Xu Chu, Xiaotie Deng, Yicheng Gong, Junwu Xiong

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un monde où les robots peuvent apprendre à faire des choses tout comme les humains : voir une pièce en désordre, comprendre l'instruction « ranger » et ensuite trouver comment ramasser les jouets. C'est le domaine passionnant des modèles de Vision-Langage-Action (VLA). Considérez ces modèles comme le cerveau d'un robot qui combine les yeux (la vision), une voix (le langage) et les muscles (l'action). Pour qu'un robot puisse réellement faire quelque chose d'utile, les scientifiques doivent le « post-entraîner ». C'est comme prendre un étudiant intelligent qui connaît des faits généraux et lui enseigner des compétences spécifiques, comme nouer une chaussure ou ouvrir un bocal.

Cependant, enseigner à ces cerveaux de robots est incroyablement coûteux et complexe. Actuellement, si un chercheur veut entraîner un robot, il doit généralement louer un ordinateur massif et coûteux (un GPU) pour lui tout seul. C'est comme louer une salle de sport privée entière juste pour faire quelques pompes ; la machine reste inactive pendant que vous chargez vos poids ou que vous faites une pause, et vous devez quand même payer pour toute l'heure. Cette approche « un robot, une salle de sport » est gaspilleuse et rend difficile l'expérimentation du apprentissage robotique pour de nombreuses personnes en même temps.

Entrez en scène JoyNexus, une nouvelle idée proposée par des chercheurs de JD AI Infra et de plusieurs universités. Ils proposent une « salle de sport partagée » pour les cerveaux de robots. Au lieu de louer un ordinateur entier, plusieurs chercheurs peuvent partager la même machine puissante de manière sûre et efficace. Le papier présente un système qui agit comme un entraîneur super intelligent, permettant à de nombreuses équipes d'entraîner leurs robots simultanément sans qu'elles ne se rentrent dedans. En organisant intelligemment le travail, JoyNexus suggère que nous pouvons réduire le temps et l'énergie nécessaires pour entraîner ces robots, rendant l'apprentissage de robots avancés plus rapide et moins cher pour tout le monde.

La « Salle de Sport Partagée » pour les Cerveaux de Robots

Alors, comment JoyNexus fonctionne-t-il réellement ? Imaginez une salle de sport animée et de haute technologie. Dans l'ancienne méthode, si vous vouliez vous entraîner, vous loueriez une pièce entière avec un tapis roulant, des poids et un miroir, et vous seriez le seul autorisé à y entrer. Si vous vous arrêtiez pour boire de l'eau ou consulter votre téléphone, la pièce restait vide, mais vous payiez quand même pour tout le temps.

JoyNexus change les règles. Il transforme la salle de sport en un espace partagé et animé avec trois zones principales :

  1. La Zone Cerveau (Service de Modèle d'Entraînement) : C'est là que se déroule le gros du travail. Le « cerveau » du robot (la partie grande et complexe qui comprend les images et les mots) est conservé dans un endroit central et partagé. C'est comme un tapis roulant géant et coûteux que tout le monde peut utiliser.
  2. La Zone Muscle (Module d'Action) : Chaque robot possède ses propres « muscles » uniques ou compétences spécifiques (comme une pince pour une griffe ou une roue pour une voiture). Dans JoyNexus, ces parties spécifiques sont gardées séparées pour chaque équipe. Vous apportez vos propres poids uniques sur le tapis roulant partagé.
  3. Le Parcours d'Obstacles (Service d'Environnement) : C'est le simulateur où le robot s'entraîne. Cela peut être une cuisine virtuelle, un sol d'usine ou un salon.

La magie de JoyNexus réside dans la gestion du trafic. Il utilise un « Service Maître » (comme un gérant de salle de sport super organisé) pour décider qui va sur le tapis roulant et quand. Si l'Équipe A attend que son robot finisse une simulation, et que l'Équipe B est prête à faire une mise à jour mathématique, le gestionnaire les échange instantanément pour que le tapis roulant ne s'arrête jamais.

L'Astuce du « Groupement par Lots »

L'une des fonctionnalités les plus cool est ce que les auteurs appellent le groupement par lots (group batching). Imaginez que vous êtes dans un café. Si une personne commande un latte, le barista doit démarrer la machine, moudre les grains et faire mousser le lait juste pour cette tasse. Si dix personnes commandent des lattes en même temps, le barista peut moudre assez de grains pour les dix et faire mousser une grande carafe de lait, ce qui rend le processus beaucoup plus rapide par tasse.

JoyNexus fait cela pour l'entraînement des robots. Souvent, différentes équipes envoient de petites requêtes au « cerveau » partagé (le modèle VLA). Si le système traitait ces requêtes une par une, l'ordinateur perdrait du temps à démarrer et s'arrêter. Au lieu de cela, JoyNexus attend une fraction de seconde infime pour voir si d'autres équipes ont des requêtes. Si c'est le cas, il les regroupe. Il exécute la partie « cerveau partagé » une seule fois pour toutes, puis sépare les résultats pour revenir à chaque équipe afin de terminer l'entraînement de leur « muscle » spécifique.

Le papier montre que cela fonctionne très bien lorsque de nombreuses équipes envoient de petits lots de données. Dans leurs simulations, lorsqu'ils ont regroupé les requêtes de 8 équipes différentes, la vitesse de la « passe avant » partagée (la partie où le cerveau regarde les données) s'est considérablement améliorée. Pour certains modèles, cela a rendu la partie partagée 2,21 fois plus rapide qu'en les faisant une par une.

Ce Qu'Ils Ont Trouvé (et Ce Qu'Ils N'Ont Pas Trouvé)

Les chercheurs ont testé JoyNexus en simulant un scénario avec quatre équipes différentes : trois équipes entraînant des robots pour effectuer des tâches dans des environnements virtuels (comme déplacer des blocs dans une simulation appelée LIBERO ou ManiSkill), et une équipe pratiquant simplement avec un ensemble de données statiques (Apprentissage Supervisé par Ajustement Fin).

Ils ont comparé cette approche de « salle de sport partagée » à l'ancienne méthode de la « salle de sport privée » où chaque équipe exécutait ses tâches les unes après les autres. Les résultats sont prometteurs :

  • Moins de Gaspillage : En superposant le travail, JoyNexus a réduit le « temps GPU » total (le temps pendant lequel l'ordinateur coûteux fonctionnait) de 28,3 %.
  • Meilleure Utilisation : Les ordinateurs partagés étaient occupés 41,3 % du temps dans la configuration multi-locataire, contre seulement 20,8 % dans la configuration isolée. C'est presque le double d'efficacité !
  • Pas de Confusion : Crucialement, le système a maintenu la sécurité de tout. Même si les équipes partageaient le gros cerveau, leurs « muscles » spécifiques, leurs données et leurs progrès étaient complètement isolés. Le papier montre que les courbes d'apprentissage (la vitesse à laquelle les robots s'améliorent) pour chaque équipe étaient exactement les mêmes que si elles s'étaient entraînées seules.

Il est important de noter que ces résultats proviennent de simulations et de tests de charge de travail, et non d'un déploiement réel de milliers de robots. Les auteurs suggèrent que cette approche pourrait économiser de l'argent et du temps, mais ils n'ont pas encore prouvé qu'elle fonctionnerait parfaitement dans tous les scénarios réels possibles. Ils soulignent également que, bien que le système soit excellent pour partager les ressources, il repose actuellement sur le fait que les utilisateurs respectent des règles spécifiques sur la manière de formater leurs données. Si une équipe souhaite utiliser un design de robot totalement étrange et personnalisé qui ne rentre pas dans les règles standard de la « salle de sport », cela pourrait être plus difficile.

L'Avenir de l'Entraînement des Robots

Le papier conclut que JoyNexus est un grand pas vers la rendre l'apprentissage des robots accessible. Au lieu d'avoir besoin d'un million de dollars pour louer un supercalculateur privé, les chercheurs pourraient potentiellement payer uniquement pour le temps qu'ils utilisent réellement, en partageant les coûts avec d'autres.

Cependant, les auteurs sont réalistes. Ils admettent que pour que cela fonctionne dans le monde réel, nous avons besoin de meilleures façons de gérer la sécurité (pour qu'une équipe ne casse pas accidentellement le robot d'une autre), la tarification (combien charger pour le temps partagé) et la flexibilité (permettre aux utilisateurs d'apporter leurs propres simulateurs bizarres). Ils suggèrent que les futures versions du système pourraient devenir plus intelligentes, en ajustant automatiquement les ressources en fonction de l'occupation de la salle de sport.

En bref, JoyNexus suggère que l'avenir de l'entraînement des robots n'est pas de construire des forteresses isolées et plus grandes pour chaque chercheur. Il s'agit de construire un centre communautaire animé et efficace où tout le monde peut apprendre ensemble, partager l'équipement coûteux et faire bouger ses robots plus rapidement que jamais auparavant.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →